DynamicCity是什么?一文让你看懂DynamicCity的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

DynamicCity概述简介

DynamicCity 是上海AI Lab推出的大规模动态场景生成的4D生成框架。DynamicCity 专注于生成具有语义信息的动态 LiDAR 场景,能处理大规模空间(80×80×6.4 m³)和长序列(最多 128 帧)的数据。DynamicCity基于 VAE 模型将 4D 场景编码为紧凑的 HexPlane 表示,用基于扩散模型(DiT)的生成器重建动态场景。DynamicCity 框架支持多种应用,如轨迹引导、指令驱动生成和动态场景修复。DynamicCity 在 CarlaSC 和 Occ3D-Waymo 数据集上表现出色,显著优于现有方法,展现了在高质量动态场景生成中的强大能力,为自动驾驶和机器人技术提供了有力支持。

DynamicCity的功能特色

高质量 4D 场景生成:生成大规模、高质量的动态 LiDAR 场景,捕捉真实世界环境中动态变化的时空演变。支持长达 128 帧的长序列生成,能模拟复杂的动态环境。

多样化下游应用:

轨迹引导生成:基于输入特定的轨迹,控制场景中对象的运动。

指令驱动生成:基于指令(如“左转”、“右转”、“前进”)控制自车或场景的运动。

动态场景修复(Inpainting):对部分缺失或损坏的场景进行修复,生成完整的动态场景。

布局条件生成:基于鸟瞰图布局控制车辆和其他对象的放置。

DynamicCity的技术原理

VAE 模型:

编码阶段:将 4D LiDAR 场景编码为紧凑的 HexPlane 表示。基于 3D 卷积神经网络提取特征,用 Projection Module 将 4D 特征压缩为六个 2D 特征图。提升 HexPlane 的拟合质量(最高提升 12.56% 的 mIoU)。

解码阶段:基于 Expansion & Squeeze Strategy (ESS) 并行解码 HexPlane,重建 3D 特征体积。相比逐点查询的方法,ESS 提升了拟合质量(最高提升 7.05% 的 mIoU),加快了训练速度(最高提升 2.06 倍)减少了内存使用(最高减少 70.84%)。

DiT 模型:

HexPlane 生成:基于编码后的 HexPlane,DiT 模型用于生成新的 HexPlane,实现 4D LiDAR 场景的生成。为使 HexPlane 适用于 DiT 生成,提出 Padded Rollout Operation (PRO),将六个特征平面重新组织为一个方形 2D 特征图,高效地建模了特征序列中的空间和时间关系。

条件生成:DiT 支持基于条件注入(如轨迹、指令、布局等)实现多样化的 4D 场景生成应用。 Classifier-Free Guidance (CFG),模型在训练时同时学习条件生成和无条件生成,在生成过程中实现更精细的控制。

DynamicCity项目介绍

项目官网:https://dynamic-city.github.io/

GitHub仓库:https://github.com/3DTopia/DynamicCity

arXiv技术论文:https://arxiv.org/pdf/2410.18084

DynamicCity能做什么?

自动驾驶仿真:生成复杂动态场景,用于自动驾驶算法的开发和测试,提升系统安全性。

虚拟现实:创建逼真的虚拟环境,支持 VR 和 AR 应用,如虚拟驾驶和城市规划展示。

机器人导航:模拟三维动态环境,帮助机器人进行路径规划和障碍物检测,增强适应性。

交通流量分析:建模和分析交通流量,预测拥堵,优化交通信号和道路规划。

智能城市规划:生成城市级动态场景,辅助评估城市布局和公共设施规划。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • PodSnap.AI
    PodSnap.AI PodSnap.AI是一个利用尖端AI技术,为用户提供播客摘要的服务。用户可以通过订阅,将播客的AI生成摘要直接发送到他们的邮箱。这项服务帮助用户节省...
  • Journey
    Journey Journey是一个用于通过互动式幻灯片、视频录制和嵌入式日历等内容创作故事和赢得更多交易的在线工具。它使企业能够通过丰富的多媒体内容有效地引导潜在客...
  • pdfpeer
    pdfpeer PDFPER使您能够快速,轻松地将PDF变成AI。从学习材料到银行对帐单,PDFPER可以帮助您与文档进行互动。提出问题,产生摘要等等,在很短的时间内...
  • A.V. MAPPING
    A.V. MAPPING A.V. MAPPING 是一款 AI 音乐搜索引擎,通过理解您上传的视频和图片,为您找到完美匹配的免版权音乐和音效。它还提供从情感、流派、音乐性到参...
  • fairytailai
    fairytailai Fairytailai是希望使就寝时间更神奇的父母的专家解决方案。使用AI技术,Fairytailai个性化的睡前故事是根据您孩子的偏好量身定制的,甚...
  • Fish Speech V1.2
    Fish Speech V1.2 Fish Speech V1.2是一款基于300,000小时的英语、中文和日语音频数据训练而成的文本到语音(TTS)模型。该模型代表了语音合成技术的最...
  • Multi
    Multi Multi是一款专为软件开发团队设计的协作工具,它通过多人协作、共享控制、即时通讯和自动记录等功能,帮助团队成员更高效地沟通和工作。产品基于Zoom的...
  • Chorus.sh
    Chorus.sh Chorus是一款面向桌面的AI聊天工具,支持多种先进AI模型的集成和交互。它通过强大的合成技术将不同AI模型的响应整合为单一输出,极大地提升了用户体...