Atlas – World Labs推出的空间智能多模态世界模型

AI模型5天前更新 智小研
124 0

Atlas是一款由李飞飞创立的 World Labs 于 2026 年 9 月推出的面向空间智能的多模态世界模型,采用多模态自回归扩散 Transformer 架构,把文本、图像、相机位姿与 3D 深度图统一锚定在三维空间形成空间上下文,在同一模型内完成图像与视频生成、3D 场景重建、时空模拟与 360 度全景生成。

基础信息内容
开发团队World Labs(李飞飞创立)
发布时间2026 年 9 月 1 日
产品定位面向空间智能的 omni 多模态世界模型
模型架构多模态自回归扩散 Transformer(rectified flow)
原生输入文本、图像、相机位姿、3D 深度图(视频以图像序列表示)
视频生成最长 1 分钟、1440p,支持像素级相机控制
3D 输出点云与 3D Gaussian splats
访问状态早期访问,仅面向部分合作伙伴开放
Atlas – World Labs推出的空间智能多模态世界模型

Atlas 的核心能力

PixVerse R2 这类主打实时生成的世界模型不同,Atlas 的关键词是”空间”:它不满足于生成一段看起来合理的视频,而是要求每一帧都与三维空间中的位置和相机姿态对得上,这也是它能同时承担生成、重建与模拟三类任务的前提。

多模态、自回归、扩散、Transformer 四者叠加

Atlas 是 omni 模型,从零预训练,原生处理文本、图像、相机位姿与 3D 深度图,视频则被表示为图像序列;每张图像与深度图都绑定显式相机位姿,使空间控制成为架构的中心组件而非附加功能。作为自回归模型,它像大语言模型一样可复用 KV 缓存与分离式服务;作为 rectified flow 扩散模型,又能通过改变去噪步数在速度与质量间权衡。

四项核心能力

  • 像素级相机控制生成:以精确相机几何为原生输入,从 1 至 6 张输入图生成最长 1 分钟、1440p 的视频
  • 稀疏视角 3D 重建:通常 2 至 25 张照片即可重建场景(也可从单张图生成新视角,并扩展到上百张输入),输出点云与 3D Gaussian splats
  • 时空模拟:仅用 3 至 5 个手机视角即可重建场景并任意重新构图,支持机器人导航与操作的 Real-to-Sim 仿真
  • 图像与 360 度全景生成:支持从文本或图像生成 360 度等距圆柱投影全景,可渲染文字并覆盖多种视觉风格

把两张不相关的参考图放入空间上下文,Atlas 会生成在两者之间平滑过渡的世界,例如从车站走廊自然衔接到宴会厅,自动补出门道、走廊与角落。这种”在三维空间里插值”的能力,是普通视频模型难以做到的。官方表示 Atlas 将驱动 Marble 及 World Labs 其他产品的未来版本,且训练过程中每提升一级算力都会解锁新能力,扩展路径仍在延续。

Atlas 与 Genie 3、Zing-0.5 等世界模型对比

World Labs 把 Atlas 定位为「空间智能」世界模型,与 Google DeepMind 的 Genie 3、Loopit 的 Zing-0.5 同属可交互世界模型赛道,但技术路线不同:Atlas 把相机几何做成原生输入,并额外具备 3D 场景重建能力。以下对照基于各模型官方公开规格。

对比维度AtlasGenie 3Zing-0.5
发布方与时间World Labs(2026-09-01)Google DeepMind(2026-01-29 公开)Loopit(2026-08)
实时交互是,可导航生成的世界是,720p、可探索数分钟的实时可交互世界是,实时交互视频
相机与运镜控制原生相机几何输入,像素级控制promptable world events(可改天气等条件)键盘空间操作与自然语言语义改写联合控制
3D 场景重建2 至 25 张普通照片即可重建点云与 3D Gaussian(也可从单张图生成新视角,上下文可扩展至上百张)不生成 3D不生成 3D
输出规格最长 1 分钟、1440p 视频720p 视频实时交互视频
开放方式早期访问(部分合作伙伴)Google AI Ultra(美国)Apache 2.0 开源(代码与权重)

注:以上规格来自 World Labs 官方博客(2026-09-01)、Google DeepMind Genie 3 官方说明(2026-01-29)与 Zing-0.5 官方开源页(Loopit,2026-08)。Atlas 官方在相机控制生成与 3D 重建两项任务上给出了优于 Sora、Runway 等视频生成模型与 Nerfstudio 等 3D 重建模型的结论,但相关图表未以文本形式公布具体分数,因此本表仅列可公开核实的规格,不引用未公开数值。

从公开规格可以看出,三款世界模型的差异集中在「是否把空间几何做成原生输入」与「是否兼顾 3D 重建」:Genie 3 强在实时可探索,Zing-0.5 强在开源与语义改写,Atlas 则把相机几何与 3D 重建一并纳入,定位更靠近「空间智能」而非单纯视频生成。

作为同赛道产品,Loopit 的 Zing-0.5 以实时交互视频世界模型路线与 Atlas 形成最直接对照。

Atlas 的应用场景与适用人群

Atlas 目前处于早期访问阶段,场景集中在需要”真实空间关系”而非”看起来像”的内容生产与仿真任务上。

  • 影视预演与视觉特效:用少量参考图生成带精确运镜的 1 分钟 1440p 镜头,或用 3 至 5 台手机把实拍改造成子弹时间多视角
  • 机器人仿真与训练:从手机视频的少量帧重建环境,生成机器人视角的 RGB 与深度数据,覆盖刚体、铰接与可变形物体
  • 3D 内容生产与场景搭建:用 2 至 25 张照片重建真实场景并导出 3D Gaussian splats,可直接在设备端高帧率渲染

适用人群:做影视预演与视觉特效的创作者、需要低成本生成机器人训练数据的具身智能团队、从事 3D 场景重建与空间内容生产的工作室,以及研究世界模型与空间智能的高校与实验室。由于尚未开放自助注册,个人开发者短期内难以直接试用。

如何使用 Atlas

申请前的准备

  • 准备机构背景与应用场景说明,说明计划将 Atlas 用于哪类生成、重建或模拟任务
  • 目前仅面向部分合作伙伴开放早期访问,需通过官方申请入口提交并等待联系

申请与使用步骤

  1. 提交申请:通过 Atlas 官网 的 World Labs 早期访问表单填写机构信息与使用场景
  2. 等待邀约:官方表示会与入选的合作伙伴逐一联系,当前不提供自助开通
  3. 准备输入:按任务准备参考图像与相机路径,2 至 3 张图即可起步,视频任务可准备 1 至 6 张
  4. 生成与导出:生成视频、新视角图像或 3D 输出(点云 / 3D Gaussian splats),按需要导入后续生产流程

早期访问申请入口、技术细节与最新示例请参考 Atlas 官网。

Atlas 的价格与开源情况

Atlas 为闭源商业模型,World Labs 未开放模型权重,也未公布商业化定价——官方博客仅说明模型正与部分合作伙伴进入早期访问阶段,有意使用的一方需通过官方表单申请,由团队逐一联系。

这意味着当前阶段 Atlas 的获取成本主要体现在合作门槛而非调用费用上:它既没有公开的按量计费标准,也不提供自助注册。对希望提前布局空间智能的团队,更现实的路径是关注其与 Marble 产品线的整合——官方明确 Atlas 将驱动 Marble 及 World Labs 其他产品的未来版本,届时能力可能以产品形态释放,而不必单独申请模型访问。

Atlas 常见问题

Atlas 与普通的视频生成模型有什么本质区别?

Atlas 把图像、深度图与相机位姿统一锚定在三维空间形成空间上下文,相机几何是原生输入而非文本描述,因此能做到像素级相机控制,并输出点云与 3D Gaussian splats 等显式 3D 结果,而不只是生成一段平面视频。

Atlas 做 3D 重建需要多少张照片?

官方称通常 2 至 3 张图像即可给出忠实重建并超越专门为 3D 重建训练的 SOTA 模型,也可扩展到超过一百张输入图以更忠实地重建真实环境,且不需要特殊采集设备。

Atlas 的基准测试成绩具体是多少?

World Labs 官方在相机控制生成与 3D 重建两项任务上给出了优于Sora、Runway 等视频生成模型与 Nerfstudio 等 3D 重建模型的结论,但相关图表未以文本形式公布具体分数,因此目前没有可引用的公开数值。

个人开发者现在能用上 Atlas 吗?

暂时不能。Atlas 目前处于早期访问阶段,仅面向部分合作伙伴开放,需通过官方表单申请并等待联系;官方表示它将驱动 Marble 及 World Labs 其他产品的未来版本。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章