World Labs Atlas 发布解读:几张照片就能推轨运镜,先给机器人造数据

简介: World Labs 于 2026 年 9 月发布三维空间世界模型 Atlas:少量照片即可重建空间、自由推轨运镜,价格与开放计划如实拆解。

大家好,我是晚安code。

这周 AI 圈最「不像 AI」的发布,我投给李飞飞团队的 World Labs Atlas。别人在卷视频能生成几秒,它反过来问:能不能给几张照片,就重建出整个三维空间,然后让镜头在里面随便飞?我看完官方演示确实愣了一下——这也太像科幻片里的动作捕捉了。这篇把 Atlas 到底是什么、能干什么、现在能不能用一次讲清。

一、先说清楚:Atlas 是什么,不是什么

Atlas 是 World Labs(李飞飞联合创立)于 2026 年 9 月发布的多模态世界模型,官方博客标题是《Atlas: A World Model for Spatial Intelligence》。

先泼盆冷水:中文媒体爱喊的「全球首个多模态世界模型」是媒体给的标签,官方没这么自居——毕竟他们自己上一代产品 Marble(2025 年 11 月发布)就已是多模态世界模型。所以别被「首个」带节奏,正确的读法是:Atlas 是这一代把「空间智能」往实了做的一步。

它原生处理的输入比常见多模态模型多两类:文本、图像、视频之外,还有相机位姿(camera pose)和 3D 深度。这是它能「理解空间」的关键。

二、能力一:像素级相机控制,镜头真的能听指挥

视频生成模型的运镜通常是「抽奖」——你写「镜头缓缓左移」,它给不给面子全看运气。Atlas 把运镜从「抽卡」变成了「导演」:相机运动轨迹作为原生几何输入,你直接给定坐标、角度、轨迹和速度。

官方演示里,输入 1~6 张普通照片并设定运镜轨迹,就能生成最长 1 分钟、1440p 的视频,画面空间几何保持一致。更狠的是它还会「脑补」:只拍到机器人正面的照片,它能补出完整的背面;给一张泳池边角照,它能「修好」没拍到的草坪和远山。两张毫不相关的照片,它也能生成门、走廊和过渡空间,把两个场景焊进一个世界。

三、能力二:稀疏视角重建,几张照片还原整个场景

传统 3D 重建(高斯泼溅、点云扫描)要用专业设备围着目标拍几百上千张。Atlas 只需 2~25 张游客视角照片,就能还原一个场景的全部细节,还能「拔地而起」生成上帝视角的航拍漫游——官方演示的斯坦福 Main Quad 就是这么重建的。

它的口号很形象:「The more it sees, the less it imagines」——输入越多、需要它想象的地方越少。静态场景通常 2~3 张就够完成基础重建,最多能容纳上百张输入。输出是点云、3D Gaussian Splats 这类显式 3D 数据,能被程序直接读取,不是只能看不能用的花架子。

四、能力三:子弹时间 + 给机器人造训练数据

这两块是 Atlas 最「降维打击」的地方。

子弹时间:官方演示里只用 3~5 台普通手机/运动相机从不同角度拍(投篮、草莓掉进牛奶碗),Atlas 就能让时间「冻结」并自由环绕运镜——过去这是需要上百台相机阵列才能做到的《黑客帝国》级效果。

机器人仿真(这才是战略重点):用手机视频的约 24 帧重建空间后,当仿真机器人在里面移动,Atlas 会同步生成机器人传感器「本应看到」的 RGB 图像和深度数据,还能改物体、位置、光照、背景,批量产出训练变体。等于用便宜的手机素材,替代昂贵的激光雷达和深度相机扫描去喂机器人训练。

五、价格与开放:目前只对合作伙伴,没有公开定价

问到价格的朋友得先降预期:Atlas 目前不向公众开放,也没有公开的 API 和定价。 官方口径是「进入早期访问(Early Access),面向部分合作伙伴」,官网上只有一个申请表单。

这跟上一代 Marble 完全不同——Marble 在 2025 年 11 月是对所有人开放的。为什么这次收着卖? 我的判断:Atlas 的想象空间在机器人、影视、游戏这类产业级客户身上,而不是消费级图一乐。先和能出钱、能反馈真实场景的伙伴跑通,比急着对公众开放更符合它的商业化节奏。后续开放时间表官方没说,盯着 World Labs 博客即可。

六、我的点评:它做的是世界的「物理引擎」,不只是视频

说点掏心窝的判断:别把 Atlas 当又一个 AI 视频工具,它真正值钱的是「空间智能」这个底座——能重建世界、能模拟世界的模型。视频生成只是它最热闹的副产品。对普通开发者的影响也分两头:短期你可能用不上(没开放),长期如果这套 real-to-sim 跑通,机器人、自动驾驶、游戏关卡制作的数据成本会被重写。

可能有人会问:Atlas 现在普通人能用吗?什么时候开放?

目前不能。它只对部分合作伙伴早期访问,无公开 API 与定价。官方未公布公众开放时间表,建议关注 World Labs 官方博客与 Marble 的后续更新——Atlas 未来会作为 Marble 等产品的底层模型,普通人更可能先通过 Marble 间接用到它。

(以上为 World Labs 官方 2026-09-01 博客口径;能力演示以官方为准,第三方「全球首个」等说法为媒体标签。)

我是晚安code,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:如果 Atlas 开放了,你最想先拿它重建什么场景?

目录
相关文章
|
4天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1122 0
|
13天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3733 4
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
4天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1350 0
|
4天前
|
人工智能 安全 前端开发
刚刚 GPT-6 Astra 发布,全球最强,AGI 时代到来!
OpenAI 正式推出 GPT-6 Astra 模型,带大家看看这次 GPT 有哪些提升,跟 Claude Fable 5.1 有什么差距?AI 编程能力如何?AGI 真的来了么?
611 0
|
10天前
|
人工智能 并行计算 数据可视化
秋叶ComfyUI-AKI最新整合包|完整部署教程+核心指令手册
秋叶ComfyUI-AKI一键整合包,国内适配最优、稳定性最强的商用/学习级版本:全封装虚拟环境、预装90%常用节点、内置绘世启动器与成熟工作流,免配置、零依赖、解压即用,完美兼顾新手入门与专业批量生产需求。(239字)
|
14天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)