18k个视频、专为自动驾驶世界模型设计,DrivingDojo数据集来了

简介: DrivingDojo是首个专为训练复杂驾驶动态交互式世界模型设计的大规模驾驶视频数据集,包含约18k个视频,覆盖多城市、多天气条件下的驾驶场景。它注重丰富的纵向与横向驾驶操作、多智能体交互及开放世界罕见事件(如动物横穿马路)。此外,研究团队还提出动作指令跟随(AIF)基准,用于评估世界模型的预测能力。尽管数据集在多样性上取得突破,但仍存在局限性,例如主要依赖前视摄像头数据。DrivingDojo为自动驾驶世界模型的研究提供了重要平台,但也提醒我们关注技术集成、计算成本及社会伦理等挑战。

自动驾驶技术的发展离不开对复杂驾驶动态的建模和预测,而世界模型因其能够模拟真实世界的物理动态而备受关注。然而,现有驾驶数据集的视频多样性有限,限制了世界模型的建模能力。为了解决这一问题,研究团队推出了DrivingDojo数据集,这是首个专为训练具有复杂驾驶动态的交互式世界模型而设计的大规模驾驶视频数据集。

DrivingDojo数据集包含约18k个视频,涵盖了完整的驾驶操作、多样的多智能体交互以及丰富的开放世界驾驶知识。这些视频片段来自中国多个主要城市的车队数据,记录了各种天气和光照条件下的驾驶场景。数据集的设计旨在通过丰富的纵向操作(如加速、紧急制动和走走停停)和横向操作(如掉头、超车和变道)来释放世界模型在动作指令跟随方面的全部潜力。此外,数据集还特别收录了大量包含多智能体交互(如切入、切出和迎面合并)的轨迹。

DrivingDojo数据集的另一个亮点是其丰富的开放世界驾驶知识。通过从数以百万计的驾驶视频片段中采样罕见的事件(如动物横穿马路、瓶子掉落和碎片散落),数据集为世界模型提供了对开放世界驾驶场景的深入理解。这种知识对于确保自动驾驶车辆在复杂和不可预测的环境中安全行驶至关重要。

为了评估世界模型在驾驶场景建模方面的进步,研究团队还引入了一个新的动作指令跟随(AIF)基准。该基准通过测量世界模型在动作条件控制下生成的视频的视觉和结构保真度,来评估其执行合理未来预测的能力。通过在DrivingDojo数据集上进行实验,研究团队展示了其提出的数据集在生成动作控制的未来预测方面的优越性。

DrivingDojo数据集的发布为自动驾驶世界模型的研究提供了一个重要的平台。通过提供丰富的驾驶操作、多智能体交互和开放世界驾驶知识,数据集有望推动下一代驾驶世界模型的发展。然而,需要注意的是,虽然DrivingDojo数据集在视频多样性和交互性方面取得了显著进展,但它仍然存在一些局限性。例如,数据集主要关注前视摄像头的数据,可能无法全面捕捉车辆周围的环境信息。此外,数据集的规模虽然较大,但可能仍然无法涵盖所有可能的驾驶场景和事件。

在肯定DrivingDojo数据集的贡献的同时,我们也应该意识到自动驾驶世界模型的研究仍然面临许多挑战。除了数据集的局限性外,世界模型的训练和评估也存在许多技术难题。例如,如何有效地将世界模型与自动驾驶车辆的规划和控制模块集成,以及如何在保证模型性能的同时降低计算成本,都是需要解决的重要问题。此外,自动驾驶技术的发展还受到法规、伦理和社会接受度等多方面因素的影响。因此,在推动自动驾驶世界模型研究的同时,我们也需要关注这些更广泛的问题,以确保自动驾驶技术能够以负责任和可持续的方式发展。

论文:https://arxiv.org/pdf/2410.10738

目录
相关文章
|
监控 算法 自动驾驶
基于YOLOv8的7种交通场景识别项目【完整源码数据集+PyQt5界面+完整训练流程+开箱即用】
本项目基于YOLOv8算法,打造了一个支持7类交通场景识别的智能系统,包括机动车、非机动车、行人及各类信号灯状态。采用PyQt5开发图形界面,提供单图、批量图片、视频文件和摄像头实时流等多种输入方式,并支持检测结果保存与模型自定义训练。项目包含完整源码、数据集及预训练权重,开箱即用,适合智能驾驶、城市监控等领域。通过简洁友好的UI,用户无需代码基础即可体验高性能目标检测功能,同时支持二次开发与工程部署。
|
人工智能 计算机视觉
Dataset之BDD100K:BDD100K数据集的简介、下载、使用方法之详细攻略
Dataset之BDD100K:BDD100K数据集的简介、下载、使用方法之详细攻略
Dataset之BDD100K:BDD100K数据集的简介、下载、使用方法之详细攻略
|
并行计算 Ubuntu Docker
Docker环境Ubuntu20.04安装Python3.10版本
Docker环境Ubuntu20.04安装Python3.10版本
6733 0
|
Linux 网络安全 数据安全/隐私保护
Xshell7免费版下载安装使用
Linux,SSH,Xshell
10790 6
|
传感器 机器学习/深度学习 编解码
最新多传感器融合基准 | Argoverse 2:用于感知和预测的下一代数据集(下)
本文介绍Argoverse 2(AV2)--一个用于自动驾驶域中感知和预测研究的三个数据集的集合。
最新多传感器融合基准 | Argoverse 2:用于感知和预测的下一代数据集(下)
|
4月前
|
机器学习/深度学习 人工智能 自然语言处理
大模型应用:轻量化视觉语言模型(VLM):基于Qwen2-VL多模态模型实践.87
超紧凑视觉语言模型(如Qwen2-VL-2B)以仅20亿参数、约4GB体积,实现本地化图文理解与生成,支持CPU/入门GPU实时推理,兼顾精度与轻量部署,推动多模态AI走向终端、离线与普惠应用。
1165 2
|
机器学习/深度学习 人工智能 Linux
SAM 2.1:Meta 开源的图像和视频分割,支持实时视频处理
SAM 2.1是由Meta(Facebook的母公司)推出的先进视觉分割模型,专为图像和视频处理设计。该模型基于Transformer架构和流式记忆设计,实现了实时视频处理,并引入了数据增强技术,提升了对视觉相似物体和小物体的识别能力。SAM 2.1的主要功能包括图像和视频分割、实时视频处理、用户交互式分割、多对象跟踪以及改进的遮挡处理能力。
1886 6
SAM 2.1:Meta 开源的图像和视频分割,支持实时视频处理
|
机器学习/深度学习 编解码 计算机视觉
深度可分离ViT | SepViT | 深度可分离卷积造就深度可分离Transformer(一)
深度可分离ViT | SepViT | 深度可分离卷积造就深度可分离Transformer(一)
676 0