20260809062836_flowpilot-uav-wam

简介: FlowPilot 是一种轻量级生成式世界-动作模型,首次将“未来场景预测”与“平滑轨迹生成”耦合于单模型中,在Jetson Orin NX上实现<18ms端到端推理,助力四旋翼在未知森林中以5.5m/s高速自主避障。

氛围图

💡 一句话总结:FlowPilot 把"预测未来看到的画面"和"生成飞行轨迹"塞进同一个生成式模型,让两条流互相参考——部署时只取轨迹、不解码画面。配合一个数学上天然平滑的动作表示,它在 Jetson Orin NX 上跑出 <18 ms 全管线,让四旋翼在陌生森林里飞到 5.5 m/s。做无人机导航、具身智能或生成式控制的人都值得看一眼。

🎯 导语:飞过密林的,都懂那个折磨

先问一个可能戳到你的问题:你让一架无人机自己飞过一片没见过的林子,它撞树了——你觉得是它"没看见"那棵树,还是"看见了但来不及躲"?

做过机载自主导航的人多半会苦笑:通常是后者。撞机很少是因为传感器没拍到障碍,更多是因为拍到了,但等地图建好、规划算完、指令下到电机,飞机已经往前冲了两米。

经典套路是"先建图再规划"(EGO-Planner、MINCO 那一类)——先用深度数据搭个局部地图,再在图上优化一条平滑轨迹。这套方法几何结构清楚、轨迹也好跟踪,但它有个致命的时序问题:每一步规划都基于"已经重建出来"的几何。飞得慢还行,一旦速度上去、障碍一密,地图跟不上、累积误差也跟上来,飞机就是在用过时的信息做决策。

那换学习型策略呢?直接从深度图回归运动(YOPO、agile flight 那一脉),确实快、也容忍传感瑕疵。但这类方法多数是反应式的——只根据当前这一帧决定怎么动,不显式地"预演"接下来会发生什么。说直白点,它不往前想。

于是痛点就清楚了:你需要一个能装进无人机、又能"预判前方"又能"直接生成可飞轨迹"的小模型。这就是 FlowPilot 想做的事。

想自己动手试?

🤔 这篇论文到底想解决什么问题?

把痛点再掰细一点。一架四旋翼要做自主导航,真正卡脖子的是时间预算:从拿到一帧深度图和自身状态,到吐出一条参考轨迹,得在几毫秒内完成。而且这条参考不能只是"位置对"——飞控跟踪它的时候要喂速度、加速度、乃至加加速度(jerk,加速度的变化率)的前馈量,轨迹不够平滑,电机就跟得抖。

打个开车的比方:你不能只盯着车头前一米,那样根本来不及转弯;但你也不能闭眼想十秒后的事,车早冲出去了。你得一边往前看几秒、一边手脚已经在做对应动作——感知和动作是耦合的、同时进行的。

可现状的两种做法都缺了这种"耦合":

  • 建图+规划:先重建几何、再优化轨迹,两步分开。问题不在哪一步,而在"分开"——等你算完,世界已经变了。
  • 端到端学习:快,但只反应当下。它没学过"如果我这么飞,接下来会看到什么",所以没法真正预判。

论文的研究问题可以用一句话概括:能不能用一个紧凑的板载模型,同时输出"接下来会看到的未来场景"和"马上能执行的轨迹",让这两件事在同一个生成过程里互相约束?

这个想法有个名字,叫世界-动作模型(World-Action Model,WAM)——"世界模型"负责预测未来观测,"动作模型"负责生成动作,两者合在一个模型里。问题在于,已有的 WAM 基本都是给桌面机械手用的:大模型、低频动作块,完全不考虑无人机那点可怜的算力和毫秒级延迟。FlowPilot 要做的,就是把这套范式"压缩"到能塞进一架小飞机里。

🛠️ 它的思路是什么?

先看一眼全景:

FlowPilot 系统全景
图说:FlowPilot 的完整流水线——输入深度+状态+速度+上周期轨迹,双流模型联合训练,三层数据金字塔喂养(仿真 16h + 光照级 8h + 实物 2h),两阶段训练,部署时只输出轨迹给 100 Hz 飞控跟踪。

FlowPilot 的核心招式可以拆成三件套:一个双流联合模型、一个天然平滑的动作表示、一套"训练时一起、部署时分开"的取巧部署。挨个说。

第一件:让"预测画面"和"生成轨迹"互相盯着的双流模型

模型里有两条并行的"专家流":一条叫视频专家,专门预测未来的深度画面("再过 1.6 秒,我会看到什么样的场景");另一条叫动作专家,专门生成飞行轨迹。关键是,在每一层网络里,这两条流会通过一个共享的注意力机制互相看对方在干什么

再用个比喻:就像两个专家背靠背坐着,一个负责"画前方画面",一个负责"画飞行路线",每画一笔都互相通个气——动作专家能瞄到"前方预测出来的几何",视频专家也能瞄到"正在规划的动作"。这种双向耦合,让模型不是"先看再动",而是"边看边动、边动边看"。

技术上它用的是 flow matching(流匹配),一种生成式建模方法。你不用关心公式,只要理解它干的事:从一团纯噪声开始,一步步把噪声"抚平",抚成一条真实轨迹或一段真实的未来深度。FlowPilot 一次前向里,同时抚两团噪声——一团变成未来画面,一团变成轨迹——而且两团噪声的"清洁进度"是独立随机的,逼着模型学会所有可能的组合。

双流 mixture-of-transformers 架构
图说:FlowPilot 的双流架构。video stream 编码深度画面、action stream 编码状态和轨迹控制点,每层经共享注意力交换信息(由各自的去噪进度 tv、ta 调制)。注意两条流各保留自己的权重,只在注意力层"对话"。

第二件:别预测一堆点,画一条平滑的数学曲线

这一步是我觉得全文最妙的工程设计。前面说过,飞控要的不只是"位置对",还要速度、加速度、加加速度都平滑。可如果让模型直接预测一串离散的航点(waypoint),位置上看误差挺小,但你一做数值微分求速度、加速度,那些小误差就被放大成剧烈震荡——飞控跟不住。

FlowPilot 的办法是:别预测点,预测一条曲线。具体说是一条 7 次的 Bernstein 多项式(一种用"控制点"定义的平滑曲线,计算机图形学里常用)。曲线有 8 个控制点,其中前 3 个被当前无人机的位置、速度、加速度硬性钉死(保证轨迹从当前真实状态出发,而不是凭空起跳),剩下 5 个交给模型去预测。

为什么这个设计聪明?因为对这种曲线求导,速度、加速度、加加速度全都是解析闭式(直接套公式就能算,不用数值微分)。轨迹天然平滑到家,飞控拿来即用,根本不需要下游再加个平滑器。而且只预测 5 个点(而不是几十个航点),动作流的计算量也压下来了。

Bernstein 表示的两个好处
图说:左图讲多模态——障碍物两边都能绕时,传统回归器会把两条路线"平均"成一条撞墙的中位,而生成式模型能各自采样;右图讲平滑——离散航点的加速度会震荡,Bernstein 曲线一路顺滑。

第三件:训练时一起练,部署时只取轨迹

这里有个很反直觉、但实操上很关键的取舍。既然视频专家那么有用,部署时是不是也该把未来画面解出来、喂给动作专家?FlowPilot 偏不。它训练时让视频流提供密集的场景演化监督、通过共享注意力把动作流"带会";但部署时走的是 action-centric(以动作为中心) 路线——只去噪出轨迹控制点,未来画面根本不解码进控制环。

为什么?因为解码未来画面太耗时间,板载根本扛不住。而前面那些 WAM 研究已经发现一个有意思的现象:视频协同训练带来的控制收益,主要来自"训练时一起学",而不是"测试时真的生成视频"。换句话说,视频流像是动作流的"陪练"——陪练让你变强了,比赛时陪练不上场也没关系。

还有个小细节值得一提:为了防止连续重规划时两次轨迹跳变太大、把飞控震坏,模型会接收"上一周期的轨迹"作为一个软提示。作者特别强调,不能用"从上周期轨迹开始去噪"这种 warm-start——他们试过,模型会直接学成"复制上次输出",要么塌缩、要么越缩越短退化成定点。软提示才是正解。

📈 效果到底怎么样?

直接上最硬的那条数据。论文做了个消融实验,把"同步去噪未来深度"这个能力关掉(动作还在去噪,但未来深度冻结成纯噪声),看会怎样:

指标 正常版(同步去噪) 关掉未来深度版
碰撞率 4.0% 26.0%
平均速度 4.14 m/s 3.83 m/s
峰值速度 6.14 m/s 5.67 m/s

碰撞率从 4% 飙到 26%——这是全文最能说明"预测未来真的有用"的一组数字。我倾向于把它理解成:未来深度的潜变量里编码了引导动作的预期先验,去掉它,模型就退化成一个只会模仿专家的策略。

再看板载实测延迟(Jetson Orin NX 上):

模块 平均耗时
深度预处理 4.7 ms
蒸馏深度编码器 1.2 ms
去噪 3 步 14.9 ms
总推理 16.3 ms(最大 17.1 ms)
下游 MPC 2.4 ms

整条神经感知-动作管线压在 18 ms 以内。其中有个工程小功劳:作者把深度编码器做了蒸馏,把这一步从 21 ms 砍到 1.2 ms——没这步,预算直接超。

仿真成功率对比
图说:在不同障碍密度和不同指令速度下,FlowPilot 的成功率随速度/密度上升时掉得最慢;EGO-Planner、YOPO 和去掉未来深度的纯动作变体都掉得更快。趋势清楚:越紧的条件,预测未来的价值越大。

实物森林飞行
图说:真实森林里的自主飞行,100 米穿越中峰值 5.5 m/s,密林段也能维持 4 m/s,地形起伏达 4 米。第一人称 + 第三人称双视角。

实物这块还有个挺亮眼的:模型只在仿真森林里训练过,但拿到室内密集的人造障碍场(比训练时任何场景都密),零样本照样能飞到 3.8 / 3.1 m/s。这说明它学到的不是"记住某种几何",而是某种能迁移的避障能力。

一个小提醒:实物飞行没有给出多次重复的碰撞率统计,5.5 m/s 是峰值而非持续巡航速度;仿真主结果也只给了柱状图、没在正文列出绝对成功率数字。所以这些数字更适合理解为"可行性证明",而非严格的统计对比。

💡 为什么你要关心?

你大概不在做无人机?没关系,这篇论文里可迁移的东西不少。我看到三条值得带走的:

  • 🎯 "生成式动作空间用平滑参数化"这个套路。只要你的任务需要"轨迹平滑 + 导数可解析"(机械臂、自动驾驶、任何跟踪控制场景),Bernstein 多项式这套"前几个控制点钉状态、剩下的让模型预测"的设计就能直接抄。它比"预测离散航点再事后平滑"干净太多。
  • 🔁 "训练联合、部署单流"的 action-centric 取舍。如果你在做多模态/多任务的生成模型,又苦于推理太重,这个思路值得记一笔:让辅助流当训练期的陪练,部署时果断砍掉。它的实证支撑正是这类 WAM 工作的核心发现。
  • 🧠 软条件优于硬 warm-start。连续决策场景里防"两次输出跳变",别用"从上次结果接着做"——那会塌缩。用 classifier-free 式的软条件提示,既稳又保多模态。

往远了看,这篇也是"世界模型从仿真/桌面走向真实具身"这条线的一个节点。当大家还在争论世界模型到底有没有用、具身智能是不是噱头的时候,已经有人把它压到一架小飞机的 18 毫秒预算里飞进真树林了——这种"把概念做进硬件"的工作,比纯论文讨论更有说服力。

🧊 理性看待

作为朋友提醒几句。第一,那个漂亮的消融(4% vs 26%)固然有力,但它对照的是"完全关掉未来深度"——相当于让模型退化成纯模仿专家策略。它证明了"未来深度有用",但没严格证明"生成式耦合本身有用"。严格点说,还缺一个"把未来深度当普通输入特征喂进去(不经过联合去噪)"的对照组。所以"WAM 范式是不是关键",这篇还留了个口子。

第二,模型只用一颗深度相机、看 1.6 秒的近视距,对细薄的树枝、透明表面、超出量程的区域是脆弱的——作者自己也承认。第三,仿真主结果缺绝对成功率数字、实物没统计,前面提过,不再赘述。

这些都不影响它是一篇扎实的系统工程论文,只是读的时候心里有杆秤:它把"WAM 能不能上机"这个问题回答得很好,"WAM 是不是不可替代"还差一步

作者:lusca
版本:lusca-paper-blog v1.5.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog

相关文章
|
1月前
|
缓存 JSON 文字识别
PaDoc:让端到端文档解析不再串行——吞吐翻倍、延迟减半,质量还没掉
PaDoc创新性提出“布局串行+内容并行”解码范式,通过祖先注意机制与vLLM前缀缓存,在保留整页上下文前提下实现区域级并发生成。同骨干模型下吞吐翻倍、P95延迟减半,质量不降反升(OmniDocBench 94.24),为端到端文档解析提供高效落地新路径。(239字)
|
传感器 算法 安全
【无人机】四旋翼飞行器控制、路径规划和轨迹优化(Matlab实现)
【无人机】四旋翼飞行器控制、路径规划和轨迹优化(Matlab实现)
668 2
|
1月前
|
缓存 JavaScript Shell
DeepSeek Harness 终于来了:开源,一切皆插件
DeepSeek Harness 开源首夜我装好了。本文给四种下载方式、四模式区别、插件生态实测,以及一段 99% 缓存命中率的真实账单
DeepSeek Harness 终于来了:开源,一切皆插件
|
1月前
|
人工智能 API Apache
Qwen3.6-Fable-Fusion-711:209万下载是真的,「首个开源破700」得另说
HuggingFace 和本地 LLM 圈被一个名字长得像密码的模型刷屏——Qwen3.6-27B-Fable-Fusion-711-…-GGUF,12 天下载量从 55 万飙到 209 万。它是社区开发者 DavidAU 在阿里 Qwen3.6-27B 上做「多阶段微调 + 模型融合 + 去审查」后以 GGUF 量化打包发布,能在本地显卡直接跑。最抓眼的「首个开源突破 700 ARC-C」目前只有作者一方说法:媒体都转自同一导流站、评测框架都没交代,唯一相对独立的行业媒体标了 unverified。当热门的去审查开源模型看成立,当「开源追上闭源」看还早。
|
1月前
|
测试技术 调度 开发工具
一文读懂什么是 Subagent
Subagent是一种工程化模式,通过将复杂任务拆解为多个职责专一的子代理(如探索、编码、测试、审查),实现上下文隔离、权限最小化与并行执行,有效解决单Agent的上下文过载、职责混乱和工具权限过大等问题。
281 3
|
1月前
|
机器学习/深度学习 人工智能 自然语言处理
2026测试人必备的"AI驯化"技能树:少了这个能力,简历直接被筛掉
2026年测试工程师正经历能力重构:从“写用例”迈向“驯化AI”。手工测试岗需求降47%,而懂AI Agent、Prompt工程、Skill封装、MCP协议与RAG知识工程的测试人才薪资高30%–50%,成大厂抢手对象。核心转变是——测试对象由确定性系统变为智能体,测试本质从“验功能”升级为“验能力”。
|
1月前
|
缓存 自然语言处理 并行计算
RTX4090单卡跑Qwen3-32B实践:4bit量化+Transformers与vLLM双方案部署差异.193
本文详解RTX4090(24GB显存)部署Qwen3-32B大模型的实战方案:聚焦4bit量化(NF4+双量化)突破显存瓶颈,对比Transformers与vLLM框架——后者推理快2倍、显存利用率更高,实测生成质量无损,为消费级显卡运行32B模型提供可落地的最优解。
264 1
|
1月前
|
人工智能 安全 API
最新版通义千问(Qwen3.8-Max)功能介绍
在人工智能大模型技术快速迭代的当下,通义千问推出的Qwen3.8-Max凭借突破性的技术架构与全面升级的能力,成为大模型领域的全新标杆。作为通义千问系列迄今规模最大、能力最强的旗舰模型,Qwen3.8-Max以2.4万亿总参数的体量,结合前沿稀疏混合专家(MoE)架构,在保持高效推理的同时,实现了文本理解、代码生成、多模态交互、长周期任务执行等核心能力的跨越式提升,为个人用户、开发者与企业级应用提供了前所未有的AI能力支撑。
365 1
|
1月前
|
机器学习/深度学习 人工智能 API
Qwen3.8-Max 开源了:该不该从 Claude 切过去?
阿里正式发布2.4万亿参数旗舰Qwen3.8-Max,支持100万上下文与原生多模态,激活95B参数,推理成本仅6美元/百万token。下周将开源Max系列权重——史上首次,兼具强编码、长程智能体与办公自动化能力,但标准编程基准仍略逊Fable 5。(239字)
|
1月前
|
人工智能 编解码 JSON
ComfyUI AI漫剧工业化量产技术方案|基于FLUX+Wan2.2本地二次元短剧全链路落地教程
本方案基于ComfyUI本地部署,整合FLUX+Wan2.2轻量化模型,专治AI漫剧五大痛点:人设变脸、画风混乱、镜头闪烁、水印限制、量产成本高。支持8G显卡,实现风格统一、人设稳定、零水印、全自动批量成片,适配二次元短剧与自媒体创作。(239字)

热门文章

最新文章