LingBot-World 2.0 – 蚂蚁灵波科技开源的实时交互世界模型

AI模型14小时前更新 智小研
17 0

LingBot-World 2.0是一款由蚂蚁灵波科技(Robbyant)于2026年9月进一步开源的实时交互世界模型,主要用于在本地实时生成可长时间演化、可被操作干预的虚拟环境,支持相机位姿与文本提示两类输入,适用于游戏原型验证、具身智能训练与交互式内容创作。

基础信息内容
产品定位实时交互世界模型(World Model)
出品方蚂蚁灵波科技(Robbyant,蚂蚁集团旗下)
发布时间2026 年 9 月 10 日
本次新增模型Small 1.3B、Bidirectional、Causal Pretrain
首发主模型14B(2026 年 7 月开源)
实时规格最高 720P、60FPS
生成时长小时级连续生成不漂移
输入方式相机位姿、文本提示、角色动作与环境事件
开放程度代码、权重与技术报告全套开放
LingBot-World 2.0 – 蚂蚁灵波科技开源的实时交互世界模型

LingBot-World 2.0 的核心能力

把实时运行门槛压到消费级单卡

本次开源的 LingBot-World 2.0 Small 采用 1.3B 参数规模,面向消费级单卡 GPU 设计,可以在单卡上实现实时世界生成。参数变小带来的不只是一组数字变化:过去开发者更多是通过公开视频或在线 Demo 观察世界模型的能力,现在可以在本地直接运行模型,观察连续生成过程、修改输入方式、测试不同交互设计并搭建应用原型。对个人开发者、高校实验室与小型团队来说,能跑起来和只能看演示,是两种完全不同的研究起点。

小时级连续生成与 720P、60FPS 实时输出

LingBot-World 2.0 的主模型在 2026 年 7 月开源时就已实现小时级连续生成,可响应攻击、射箭、施法、射击等角色动作,以及下雪、下雨等环境事件;在更高算力与相应推理配置下可达到 720P、60FPS 的高清实时体验。注意力放在「画面不漂移」上:世界模型一旦在长时序里崩掉纹理与几何结构,交互体验就无法成立,这正是这一版把长时稳定性当作主线的原因。

因果预训练与 MoBA 的长时稳定性

在 LingBot-World 2.0 里,当前世界状态只依赖过去的视觉观察与截至当前时刻的用户输入,不能访问未来信息,这种因果性模拟了真实交互——你往前走一步,世界才生成下一步。为兼顾自回归生成与视觉质量,团队引入了 Mixture of Bidirectional and Autoregressive Attention Mask(MoBA),在 Teacher Forcing 掩码里加入双向注意力组件,缓解纯 Teacher Forcing 带来的过拟合与画质下降,并帮助模型从双向生成过渡到自回归生成,配套的因果交叉注意力则用于防止未来语义泄漏。技术报告中的定性对比显示,在 5 秒至 60 秒的长时生成中,它在纹理细节、几何结构与场景连贯性上保持得更稳。

两阶段蒸馏压缩单帧成本

高质量生成通常需要多步去噪,计算成本难以满足实时交互,团队因此结合一致性蒸馏与分布匹配蒸馏:前者把 Teacher 的多步生成轨迹压缩到少步 Student,后者让 Student 在自身长时 self-rollout 的轨迹上继续训练,抑制长时自回归过程里不断累积的误差。通过开放 Bidirectional 双向 Teacher 模型,研究者可以拿到更完整的蒸馏起点,用于训练更轻、更快或更适合特定场景的 Student 模型。

双 Agent 驱动的世界演化

LingBot-World 2.0 由 Pilot Agent 与 Director Agent 组成的 Agentic Interaction Harness 协同工作,前者负责角色行为、后者负责环境内容生成,让世界在探索过程中继续演化,而不是把玩家困在一段固定视频里。这条路线与通用 AI 智能体 的思路一致:把「持续推进一件事」的职责交给 Agent 层,模型层专注把当前一步生成好。

完整开源体系与本地部署路径

这一轮开放的三款模型让开发者既可以直接运行 1.3B 小模型,也可以从 Causal Pretrain 或 Bidirectional 出发继续做后训练、评测、蒸馏、压缩与推理加速。同厂的 LingBot 系列此前已有多个方向的开源落地,例如面向视觉动作的 LingBot-VA 2.0 把同一套世界建模能力延伸到机器人动作领域,本次 World 线的轻量化则补上了「能本地跑起来」这一环。

LingBot-World 2.0 与同类实时世界模型的对比

下表把 LingBot-World 2.0 与 Genie 3、Zing-0.5、ABot-World Studio 在实时规格、长时一致性与开放程度上并列,便于判断各自的可用边界。

对比维度LingBot-World 2.0Genie 3Zing-0.5ABot-World Studio
出品方蚂蚁灵波科技谷歌 DeepMindLoopit(涌跃智能)高德(阿里巴巴集团)
参数规模14B 主模型与 1.3B Small 两档官方未公布5B(基于 Wan2.2-TI2V-5B)官方未公布
实时规格最高 720P、60FPS720p、24fps单卡 RTX 5090 实时超 24 FPS官方未公布
长时一致性小时级连续生成不漂移约 1 分钟画面一致官方未公布超 1 小时稳定推理
交互方式角色动作、环境事件、相机位姿与文本提示键鼠控制角色与环境交互键盘操控与自然语言改写文本或图片驱动的交互视频与 3D 场景
技术路线因果预训练、MoBA 加两阶段蒸馏自回归扩散与可扩展潜空间基于 Wan2.2 的因果扩散架构连续世界建模架构
开放程度代码、权重与技术报告开放闭源,随 Gemini Ultra 体验Apache 2.0 开放代码与权重系列模型已开源
本地部署门槛1.3B 版单张消费级 GPU依赖云端服务单张消费级 GPU单张 RTX 5090

四者的差别主要在开放程度与运行时长的取舍上:Genie 3 把体验放在云端订阅里,Zing-0.5 与 LingBot-World 2.0 都选择开源到消费级单卡,ABot-World Studio 则在超一小时稳定推理与 3D 场景生成上做文章。如果要自己改训练链路或做蒸馏实验,能拿到因果预训练底座与双向 Teacher 的路线更实用。

如果想顺带看看世界模型在空间智能方向上的另一种做法,可以参考 Atlas(World Labs 推出的多模态世界模型,把文本、图像、相机位姿与深度图统一锚定在三维空间,与本文讨论的实时交互路线属同一赛道)。

LingBot-World 2.0 的应用场景与适用人群

LingBot-World 2.0 的价值集中在「需要可交互、可长时间演化、且要被反复修改」的场景,以下四类最能体现它的用途。

  • 游戏原型与关卡预演:用文本提示与镜头控制快速生成可探索场景,先验证玩法与节奏,再进入美术生产环节。
  • 具身智能与机器人训练:世界模型提供可交互环境,开发者可基于因果预训练底座做后训练与场景适配。
  • 交互式内容创作:小时级连续生成让长时间直播式演示、互动短片与虚拟场景漫游具备可行性。
  • 研究与教学:1.3B 版可在高校实验室与个人单卡环境里复现、改造并测试新的交互设计。

适用人群:个人开发者、高校实验室与小型团队,具身智能与机器人方向的研究者,以及需要低成本验证交互式内容创意的游戏与影视团队。

LingBot-World 2.0 的使用方法

  1. 获取权重与代码:在 LingBot-World 2.0 官方仓库 查看说明,并从 Hugging Face 或魔搭社区下载 Small 1.3B、Bidirectional 或 Causal Pretrain 权重。
  2. 准备本地环境:Small 版面向消费级单卡 GPU,按仓库文档配置推理依赖后即可尝试实时生成。
  3. 选择输入方式:相机位姿用于控制移动与视角,文本提示用于改变局部事件与世界状态。
  4. 继续训练与蒸馏:从 Causal Pretrain 或 Bidirectional 出发做后训练、蒸馏与压缩,适配具体场景。

LingBot-World 2.0的官方资源

  • 项目官网:https://technology.robbyant.com/lingbot-world-v2
  • GitHub仓库:https://github.com/robbyant/lingbot-world-v2
  • HuggingFace模型库:https://huggingface.co/robbyant/lingbot-world-v2-14b-causal-fast
  • arXiv技术论文:https://arxiv.org/pdf/2607.07534

LingBot-World 2.0 的价格与开源情况

LingBot-World 2.0 以开源方式免费提供,官方未对模型本身设置调用费用,实际投入主要是本地部署所需的 GPU 算力与显存。1.3B 小模型把门槛压到单张消费级显卡,14B 主模型要跑出高清实时体验则仍需更高规格的推理配置,算力预算需要按目标分辨率与帧率来估。

LingBot-World 2.0 的代码、权重与技术报告在本轮开源中一并开放,项目主页、GitHub 仓库、Hugging Face 与魔搭社区均已提供入口,官方公告暂未逐项列出许可证与商用条款,落地到商业项目之前需要以仓库与模型卡上的许可说明为准。

LingBot-World 2.0 的常见问题

LingBot-World 2.0 的 1.3B 版需要什么显卡?

官方把 Small 1.3B 定位为面向消费级单卡 GPU 的版本,可在单卡上实现实时世界生成;14B 主模型要达到 720P、60FPS 需要更高规格的推理配置。

1.3B 和 14B 版本应该怎么选?

以本地体验、改造与教学为目的选 1.3B;需要更高画质与更完整的实时交互体验选 14B。两者不冲突,1.3B 也可以配合 Bidirectional 与 Causal Pretrain 做蒸馏与后训练。

LingBot-World 2.0 与 Genie 3 有什么区别?

主要差别在开放程度与时长表现:LingBot-World 2.0 开放代码、权重与技术报告并支持本地部署,长时生成可达小时级;Genie 3 为闭源服务,通过 Gemini Ultra 订阅体验,画面一致性约 1 分钟。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章