视频生成得很真,机器人却抓了个寂寞:DreamX-Phi 的几何药方

简介: DreamX-Phi 1.0 创新性地将机械臂3D运动轨迹(SE(3))直接嵌入注意力机制(PRoPE),解决视频世界模型“画面真、动作错”的核心痛点,在WorldArena 2.0视频预测赛道夺冠,兼具几何精度与推理轻量性。

氛围图

💡 一句话总结:DreamX-Phi 1.0 用"把每条手臂的 3D 运动轨迹直接钉进注意力机制"的几何化方式,解决视频世界模型"画面很真、动作不听"的老毛病,拿下 WorldArena 2.0 视频预测赛道第一——做世界模型、具身智能或视频生成的人都该看看这个思路。

🎯 先问一个可能戳到你的问题

如果你玩过或做过视频世界模型(world model,一种"给定当前画面和你的输入,预测接下来会发生什么"的生成模型),下面这个场景大概率不陌生:

你给模型一段机械臂轨迹,说"去抓左边那瓶水"。它生成了一段画质惊艳的视频——光影正确、运动流畅、物理感十足。唯一的小问题是:它动的是右臂,然后把瓶子捏没了。

对,就是你想的那个坑。视频生成模型这两年进化神速,但一旦把它当机器人的"想象引擎"用,你就会发现:逼真听话是两码事。跑得再炫的 rollout,只要动错了手臂、丢了被操作的物体、把"抓取"渲染成"释放",对机器人来说就全是废片——因为世界模型存在的意义,就是在物理执行之前评估"这么动会发生什么"。

最近 AMAP-ML 团队的论文 DreamX-Phi 1.0 就是对着这个痛点来的。它在 WorldArena 2.0 这个具身世界模型基准的固定快照上拿了 Track 1(视频预测)31 支队伍里的第一,Track 2(用世界模型训策略)并列第二。但比名次更值得聊的,是它开出的那剂"几何药方"。

想自己动手试?

🤔 这篇论文到底想解决什么问题?

先把问题说精确。DreamX-Phi 处理的是动作条件视频预测:给定一帧观测画面、一句语言指令、一段规定的双臂动作序列(每条手臂在每个时刻的末端位姿和夹爪开合),模型要预测接下来的视频。这在行话里叫前向动力学模型(Forward Dynamics Model,FDM)——只从给定动作推后果,不自己发明动作。

那为什么现有方法做不好?论文的诊断直指一个行业惯例:动作的注入方式太"含糊"了

目前主流做法(IRASim、Vid2World、HMA 这些工作)大多把动作序列压缩成一串低维 token,或者用特征调制(feature-wise modulation,就是拿动作信息去缩放、平移网络内部的特征)塞进模型。这就像你给导航员口述一条 3D 路线:"先往前大概一米,再往左下偏一点……"——信息都在,但路线本身的几何结构没了。网络拿到的是一堆被压扁的数字,末端执行器走过的那条刚性轨迹长什么样,得它自己从数据里反推。

反推就会出错。出错的表现就是开头那一幕:动错手臂、物体凭空消失、夹爪穿透物体——而且因为画面本身足够逼真,这些错误藏在高画质里,肉眼第一时间根本看不出来。

所以 DreamX-Phi 的研究问题一句话就能说清:能不能设计一个动作接口,让"指令的 3D 运动"和"这个运动该出现在画面哪里"都被显式地保留下来,而不是让模型去猜?

🛠️ 它的思路是什么?

DreamX-Phi 没有从零训模型,而是站在开源视频生成基座 Wan2.2-TI2V-5B(一个 50 亿参数的视频扩散 Transformer)的肩膀上,加了四味"药"。先看全景图:

DreamX-Phi 概念总览
图说:单帧画面 + 双臂动作序列进,未来视频出——整个系统就是在回答"这么动,画面会变成什么"。

DreamX-Phi 训练框架
图说:左边是动作怎么进模型(PRoPE 几何注意力 + 光流线索),中间是三路辅助监督(SAM3 掩码、深度、V-JEPA 教师),右边是 DMD 蒸馏成少步推理——一图看懂全文骨架。

第一味药,也是全文的灵魂:PRoPE 几何注意力。

PRoPE(Projective Relative Positional Encoding,投影式相对位置编码)本来是给多视角相机设计的技术——把已知的相机几何变换直接"揉"进 Transformer 的注意力计算里,让两个 token 之间的交互自动带上它们的相对几何关系。DreamX-Phi 做了个漂亮的挪用:末端执行器在每一帧都有一个 3D 位姿,这不就是一个随时间移动的"虚拟相机"吗?

具体来说,模型先把每条手臂每帧的位姿变成一个 SE(3) 变换(SE(3) 就是三维空间里"旋转 + 平移"的数学总称,刚体运动的标准语言),统一到同一个参考系、按运动幅度归一化,然后把它直接注入每个 Transformer 块里一条并行的注意力分支:注意力头被分成组,每组绑定一条手臂,同一帧同一臂的 token 共享同一个几何变换。这样两个 token 交互时,耦合的是它们之间的相对运动,而不是某个绝对坐标。

类比一下:低维 token 接口像是把 GPS 轨迹口述成一段话,PRoPE 则是直接把轨迹坐标系钉进地图——哪条手臂、走到哪、转了多少,从结构上就不会认错。

还有一个很讲卫生的细节:这条几何分支是零初始化的残差结构——训练开始时它完全"静默",等于不存在,随训练逐渐激活。预训练好的视频生成能力一点不被破坏,几何控制只是"追加"而不是"重写"。夹爪开合是标量、没法塞进 SE(3),就单独做成一个小的逐臂偏置注入。

第二味药:深度分支。

RGB 生成目标只管"看起来对",不管"空间结构对"。DreamX-Phi 复制了主干的尾部几层做成一条轻量深度分支,用 Depth Anything 3 生成的深度图当监督,让内部表征顺便学会场景的 3D 结构。妙处在于这条分支是单向的:深度可以读 RGB 的特征,RGB 永远不读深度的——所以推理时深度分支整个可以摘掉,零推理开销。纯赚不赔的设计。

第三味药:别让背景淹没物体。

操作视频里有个天然的坑:机械臂和被抓的物体往往只占画面一小角,其余全是桌面和背景。均匀的生成损失意味着——打个比方——你在 4K 全景照里找一枚硬币,评分标准却是"整张照片平均像不像",硬币糊没糊根本拉不动分数。于是模型可以生成"夹爪穿模、物体毫无反应"的 rollout 而分数依然很高。

DreamX-Phi 的解法分两层:

  • 🔵 SAM3 掩码重加权:用 SAM3(Segment Anything Model 3,分割模型)离线标出被操作物体的掩码,训练时把落在物体上的误差权重调大——相当于告诉损失函数"硬币才是重点";
  • 🧊 V-JEPA 关系对齐:拿一个冻结的 V-JEPA 视频理解模型当老师,约束预测视频里物体的特征关系(同一物体在时间轴上的"人格")不漂移——保证瓶子的形状、状态在被抓起的全程保持是那个瓶子,而不是中途悄悄变成别的东西。

注意 SAM3 只在训练时用,推理时不需要任何掩码,又是一个不增加部署负担的设计。

第四味药:DMD 蒸馏,让它跑得动。

5B 参数的视频扩散模型动辄几十步去噪,当世界模型用来批量 rollout 太贵了。DreamX-Phi 用 DMD(Distribution Matching Distillation,分布匹配蒸馏)把多步生成器蒸馏成少步学生模型——这步是成熟技术的搬运,但它把蒸馏条件从文生图的"文本"扩展成了"首帧 + 动作序列 + 指令"三元组,全程保持一致。

可以看出四味药的共同哲学:结构进注意力,监督进训练,推理零负担。该讲究几何的地方讲究几何,不该增加部署成本的地方一克都不加。

📈 效果到底怎么样?

看数字前先认识一下考场:WorldArena 2.0 是具身世界模型的基准,Track 1 给你 1000 段初始画面 + 指令/动作轨迹,考视频预测质量,用 EWMScore-P 评分(15 项指标的平均分,涵盖画质、时序、物理合理性、条件忠实度等,满分 100,越高越好);Track 2 更狠——把你提交的世界模型当训练环境去训一个 π0.5 策略,看策略在真值仿真里的任务成功率,考的是"世界模型是否真的有用"。

三个最值得记的数字:

  • 🥇 Track 1 第一名:DreamX-Phi 拿到 EWMScore-P 60.65,在固定快照(2026 年 8 月 12 日)的全部 31 支队伍里排第一;
  • 🤝 Track 2 并列第二:用它的世界模型训出来的策略,在 held-out 的 Adjust Bottle 任务上成功率 67.19%(第一名 WOVR-PLUS,另一队 Lute 与它并列第二);
  • 🧪 跨代对比领先:在上一代 WorldArena 1.0 上,它离线自评拿到 76.88,高于该榜固定快照榜首 UNIS 的 73.64(注意这是自评对榜单,流程不完全对等,看个趋势就好)。

定性结果长这样:

WorldArena 2.0 定性 rollout:标准场景
图说:每行是一段预测的 episode,从左到右按时间采样——机械臂、夹爪和被摆弄的物体全程保持连贯,没有"手是手、物是物、互不相认"的经典事故。

WorldArena 2.0 定性 rollout:域随机化场景
图说:把背景、纹理、光照、干扰物全部随机化后再测,行为依然稳定——说明模型不是背下了某套特定渲染,而是真的在预测交互。

我自己最在意的是 Track 2 那个数字。视频指标再漂亮,都可能藏着"高画质的糊弄";但"用你的世界模型训出来的策略,放到真值仿真里能完成任务"这件事,很难靠画质演技糊弄过去——它至少说明模型预测的动力学对策略学习是有信息量的。当然,只考了一个任务(摆瓶子),泛化面还得打个问号。

💡 为什么你要关心?

就算你不做机器人,这篇论文的思路也可能是你的菜。几个我觉得真正可迁移的点:

  • 🎓 给生成模型加控制信号的"结构派"范式:如果你在做可控视频生成、具身仿真或任何"条件必须被精确遵守"的生成任务,"把条件的数学结构(这里是 SE(3))直接编码进注意力,而不是压成 token 让网络猜"这个思路,比具体实现更值得抄。零初始化残差分支保证不动预训练能力,这个工程细节同样百搭;
  • 🧹 "训练时监督、推理时摘除"的辅助分支模板:深度分支单向连接、SAM3 只用于训练——想要额外监督信号又怕拖慢推理的场合,这套模板直接套用;
  • 🔍 小目标在损失里被淹没的问题:不止机器人操作,任何"关键区域只占画面一小部分"的生成/检测任务(医学影像、遥感、文档里的表格线)都面临同样的损失分配问题,掩码重加权 + 特征关系对齐的组合拳值得记下;
  • 🤖 对做具身智能的人:WorldArena 2.0 这个基准本身就是信息——"世界模型好不好"正在从"视频像不像"转向"训出的策略行不行"(Track 2 的设计),评测风向的变化往往比单篇论文更能预示领域走向。

再往远看一层:DreamX-Phi 只做"给动作、预测果"的前向模型,论文的 Future Work 已经预告了"视频和动作联合生成"的 World Action Model。当视频生成、世界模型、VLA 策略这三条线继续合流,这类"几何先验进生成模型"的工作大概率会越来越多——早一点理解 PRoPE 这类接口,后面读起来会越来越顺。

🧭 理性看待

朋友式提醒,三点:

  • 零消融。这是挑战赛报告的通病——榜单成绩衡量的是整个系统(基座 + 数据 + 全部四味药),没有任何实验告诉你"PRoPE 到底贡献了几分"。理论上完全存在这种可能:第一名主要靠强基座 + 数据工程,几何分支只学到接近恒等的映射。论文自己在结论里也承认需要消融实验来量化各组件贡献,算诚实;
  • 全是仿真。训练和评测都基于 RoboTwin 仿真环境(真机数据有参与训练,但评测没上真机),Track 2 也只考了一个任务。离"真机器人上能用"还有距离;
  • 代码未放、超参未披露。仓库承诺赛后公开,撰写时还没有;关键超参(掩码权重比、蒸馏配置等)论文里也没给全,现阶段想复现得等。

所以我的读法是:方法设计当教科书读,榜单名次当参考看。等代码和消融放出来,这份"几何药方"的疗效才真正见分晓。


作者:lusca
版本:lusca-paper-blog v1.6.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog

相关文章
|
9天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1893 119
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
|
10天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1451 13
|
16天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1966 10
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
7天前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)
|
10天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
|
8天前
|
人工智能 API 开发工具
2026 零基础本地 AI 漫剧完整实操教程(8G 笔记本显卡可用|附可直接复制命令与代码)
本方案提供完全离线、本地运行的漫剧全自动制作流程:RTX3060/4050 8G显卡即可驱动,涵盖Qwen写分镜→ComfyUI统一角色绘图→LTX2.3图生微动画→Qwen3-TTS本地配音→FFmpeg自动合成,全程无水印、免API、不限次。专为低显存优化,解决变脸、闪烁、爆内存三大痛点。(239字)
|
22天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
3412 5
|
10天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
555 113

热门文章

最新文章