
💡 一句话总结:DreamX-Phi 1.0 用"把每条手臂的 3D 运动轨迹直接钉进注意力机制"的几何化方式,解决视频世界模型"画面很真、动作不听"的老毛病,拿下 WorldArena 2.0 视频预测赛道第一——做世界模型、具身智能或视频生成的人都该看看这个思路。
🎯 先问一个可能戳到你的问题
如果你玩过或做过视频世界模型(world model,一种"给定当前画面和你的输入,预测接下来会发生什么"的生成模型),下面这个场景大概率不陌生:
你给模型一段机械臂轨迹,说"去抓左边那瓶水"。它生成了一段画质惊艳的视频——光影正确、运动流畅、物理感十足。唯一的小问题是:它动的是右臂,然后把瓶子捏没了。
对,就是你想的那个坑。视频生成模型这两年进化神速,但一旦把它当机器人的"想象引擎"用,你就会发现:逼真和听话是两码事。跑得再炫的 rollout,只要动错了手臂、丢了被操作的物体、把"抓取"渲染成"释放",对机器人来说就全是废片——因为世界模型存在的意义,就是在物理执行之前评估"这么动会发生什么"。
最近 AMAP-ML 团队的论文 DreamX-Phi 1.0 就是对着这个痛点来的。它在 WorldArena 2.0 这个具身世界模型基准的固定快照上拿了 Track 1(视频预测)31 支队伍里的第一,Track 2(用世界模型训策略)并列第二。但比名次更值得聊的,是它开出的那剂"几何药方"。
想自己动手试?
- 📄 论文:arXiv 2608.13489
- 💻 代码:GitHub · AMAP-ML/DreamX-Phi(承诺挑战赛结束后放出,撰写时还没上)
- 🧩 基座模型:HuggingFace · Wan2.2-TI2V-5B
🤔 这篇论文到底想解决什么问题?
先把问题说精确。DreamX-Phi 处理的是动作条件视频预测:给定一帧观测画面、一句语言指令、一段规定的双臂动作序列(每条手臂在每个时刻的末端位姿和夹爪开合),模型要预测接下来的视频。这在行话里叫前向动力学模型(Forward Dynamics Model,FDM)——只从给定动作推后果,不自己发明动作。
那为什么现有方法做不好?论文的诊断直指一个行业惯例:动作的注入方式太"含糊"了。
目前主流做法(IRASim、Vid2World、HMA 这些工作)大多把动作序列压缩成一串低维 token,或者用特征调制(feature-wise modulation,就是拿动作信息去缩放、平移网络内部的特征)塞进模型。这就像你给导航员口述一条 3D 路线:"先往前大概一米,再往左下偏一点……"——信息都在,但路线本身的几何结构没了。网络拿到的是一堆被压扁的数字,末端执行器走过的那条刚性轨迹长什么样,得它自己从数据里反推。
反推就会出错。出错的表现就是开头那一幕:动错手臂、物体凭空消失、夹爪穿透物体——而且因为画面本身足够逼真,这些错误藏在高画质里,肉眼第一时间根本看不出来。
所以 DreamX-Phi 的研究问题一句话就能说清:能不能设计一个动作接口,让"指令的 3D 运动"和"这个运动该出现在画面哪里"都被显式地保留下来,而不是让模型去猜?
🛠️ 它的思路是什么?
DreamX-Phi 没有从零训模型,而是站在开源视频生成基座 Wan2.2-TI2V-5B(一个 50 亿参数的视频扩散 Transformer)的肩膀上,加了四味"药"。先看全景图:

图说:单帧画面 + 双臂动作序列进,未来视频出——整个系统就是在回答"这么动,画面会变成什么"。

图说:左边是动作怎么进模型(PRoPE 几何注意力 + 光流线索),中间是三路辅助监督(SAM3 掩码、深度、V-JEPA 教师),右边是 DMD 蒸馏成少步推理——一图看懂全文骨架。
第一味药,也是全文的灵魂:PRoPE 几何注意力。
PRoPE(Projective Relative Positional Encoding,投影式相对位置编码)本来是给多视角相机设计的技术——把已知的相机几何变换直接"揉"进 Transformer 的注意力计算里,让两个 token 之间的交互自动带上它们的相对几何关系。DreamX-Phi 做了个漂亮的挪用:末端执行器在每一帧都有一个 3D 位姿,这不就是一个随时间移动的"虚拟相机"吗?
具体来说,模型先把每条手臂每帧的位姿变成一个 SE(3) 变换(SE(3) 就是三维空间里"旋转 + 平移"的数学总称,刚体运动的标准语言),统一到同一个参考系、按运动幅度归一化,然后把它直接注入每个 Transformer 块里一条并行的注意力分支:注意力头被分成组,每组绑定一条手臂,同一帧同一臂的 token 共享同一个几何变换。这样两个 token 交互时,耦合的是它们之间的相对运动,而不是某个绝对坐标。
类比一下:低维 token 接口像是把 GPS 轨迹口述成一段话,PRoPE 则是直接把轨迹坐标系钉进地图——哪条手臂、走到哪、转了多少,从结构上就不会认错。
还有一个很讲卫生的细节:这条几何分支是零初始化的残差结构——训练开始时它完全"静默",等于不存在,随训练逐渐激活。预训练好的视频生成能力一点不被破坏,几何控制只是"追加"而不是"重写"。夹爪开合是标量、没法塞进 SE(3),就单独做成一个小的逐臂偏置注入。
第二味药:深度分支。
RGB 生成目标只管"看起来对",不管"空间结构对"。DreamX-Phi 复制了主干的尾部几层做成一条轻量深度分支,用 Depth Anything 3 生成的深度图当监督,让内部表征顺便学会场景的 3D 结构。妙处在于这条分支是单向的:深度可以读 RGB 的特征,RGB 永远不读深度的——所以推理时深度分支整个可以摘掉,零推理开销。纯赚不赔的设计。
第三味药:别让背景淹没物体。
操作视频里有个天然的坑:机械臂和被抓的物体往往只占画面一小角,其余全是桌面和背景。均匀的生成损失意味着——打个比方——你在 4K 全景照里找一枚硬币,评分标准却是"整张照片平均像不像",硬币糊没糊根本拉不动分数。于是模型可以生成"夹爪穿模、物体毫无反应"的 rollout 而分数依然很高。
DreamX-Phi 的解法分两层:
- 🔵 SAM3 掩码重加权:用 SAM3(Segment Anything Model 3,分割模型)离线标出被操作物体的掩码,训练时把落在物体上的误差权重调大——相当于告诉损失函数"硬币才是重点";
- 🧊 V-JEPA 关系对齐:拿一个冻结的 V-JEPA 视频理解模型当老师,约束预测视频里物体的特征关系(同一物体在时间轴上的"人格")不漂移——保证瓶子的形状、状态在被抓起的全程保持是那个瓶子,而不是中途悄悄变成别的东西。
注意 SAM3 只在训练时用,推理时不需要任何掩码,又是一个不增加部署负担的设计。
第四味药:DMD 蒸馏,让它跑得动。
5B 参数的视频扩散模型动辄几十步去噪,当世界模型用来批量 rollout 太贵了。DreamX-Phi 用 DMD(Distribution Matching Distillation,分布匹配蒸馏)把多步生成器蒸馏成少步学生模型——这步是成熟技术的搬运,但它把蒸馏条件从文生图的"文本"扩展成了"首帧 + 动作序列 + 指令"三元组,全程保持一致。
可以看出四味药的共同哲学:结构进注意力,监督进训练,推理零负担。该讲究几何的地方讲究几何,不该增加部署成本的地方一克都不加。
📈 效果到底怎么样?
看数字前先认识一下考场:WorldArena 2.0 是具身世界模型的基准,Track 1 给你 1000 段初始画面 + 指令/动作轨迹,考视频预测质量,用 EWMScore-P 评分(15 项指标的平均分,涵盖画质、时序、物理合理性、条件忠实度等,满分 100,越高越好);Track 2 更狠——把你提交的世界模型当训练环境去训一个 π0.5 策略,看策略在真值仿真里的任务成功率,考的是"世界模型是否真的有用"。
三个最值得记的数字:
- 🥇 Track 1 第一名:DreamX-Phi 拿到 EWMScore-P 60.65,在固定快照(2026 年 8 月 12 日)的全部 31 支队伍里排第一;
- 🤝 Track 2 并列第二:用它的世界模型训出来的策略,在 held-out 的 Adjust Bottle 任务上成功率 67.19%(第一名 WOVR-PLUS,另一队 Lute 与它并列第二);
- 🧪 跨代对比领先:在上一代 WorldArena 1.0 上,它离线自评拿到 76.88,高于该榜固定快照榜首 UNIS 的 73.64(注意这是自评对榜单,流程不完全对等,看个趋势就好)。
定性结果长这样:

图说:每行是一段预测的 episode,从左到右按时间采样——机械臂、夹爪和被摆弄的物体全程保持连贯,没有"手是手、物是物、互不相认"的经典事故。

图说:把背景、纹理、光照、干扰物全部随机化后再测,行为依然稳定——说明模型不是背下了某套特定渲染,而是真的在预测交互。
我自己最在意的是 Track 2 那个数字。视频指标再漂亮,都可能藏着"高画质的糊弄";但"用你的世界模型训出来的策略,放到真值仿真里能完成任务"这件事,很难靠画质演技糊弄过去——它至少说明模型预测的动力学对策略学习是有信息量的。当然,只考了一个任务(摆瓶子),泛化面还得打个问号。
💡 为什么你要关心?
就算你不做机器人,这篇论文的思路也可能是你的菜。几个我觉得真正可迁移的点:
- 🎓 给生成模型加控制信号的"结构派"范式:如果你在做可控视频生成、具身仿真或任何"条件必须被精确遵守"的生成任务,"把条件的数学结构(这里是 SE(3))直接编码进注意力,而不是压成 token 让网络猜"这个思路,比具体实现更值得抄。零初始化残差分支保证不动预训练能力,这个工程细节同样百搭;
- 🧹 "训练时监督、推理时摘除"的辅助分支模板:深度分支单向连接、SAM3 只用于训练——想要额外监督信号又怕拖慢推理的场合,这套模板直接套用;
- 🔍 小目标在损失里被淹没的问题:不止机器人操作,任何"关键区域只占画面一小部分"的生成/检测任务(医学影像、遥感、文档里的表格线)都面临同样的损失分配问题,掩码重加权 + 特征关系对齐的组合拳值得记下;
- 🤖 对做具身智能的人:WorldArena 2.0 这个基准本身就是信息——"世界模型好不好"正在从"视频像不像"转向"训出的策略行不行"(Track 2 的设计),评测风向的变化往往比单篇论文更能预示领域走向。
再往远看一层:DreamX-Phi 只做"给动作、预测果"的前向模型,论文的 Future Work 已经预告了"视频和动作联合生成"的 World Action Model。当视频生成、世界模型、VLA 策略这三条线继续合流,这类"几何先验进生成模型"的工作大概率会越来越多——早一点理解 PRoPE 这类接口,后面读起来会越来越顺。
🧭 理性看待
朋友式提醒,三点:
- 零消融。这是挑战赛报告的通病——榜单成绩衡量的是整个系统(基座 + 数据 + 全部四味药),没有任何实验告诉你"PRoPE 到底贡献了几分"。理论上完全存在这种可能:第一名主要靠强基座 + 数据工程,几何分支只学到接近恒等的映射。论文自己在结论里也承认需要消融实验来量化各组件贡献,算诚实;
- 全是仿真。训练和评测都基于 RoboTwin 仿真环境(真机数据有参与训练,但评测没上真机),Track 2 也只考了一个任务。离"真机器人上能用"还有距离;
- 代码未放、超参未披露。仓库承诺赛后公开,撰写时还没有;关键超参(掩码权重比、蒸馏配置等)论文里也没给全,现阶段想复现得等。
所以我的读法是:方法设计当教科书读,榜单名次当参考看。等代码和消融放出来,这份"几何药方"的疗效才真正见分晓。
作者:lusca
版本:lusca-paper-blog v1.6.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog