LingBot-World 2.0是一款由蚂蚁灵波科技(Robbyant)于2026年9月进一步开源的实时交互世界模型,主要用于在本地实时生成可长时间演化、可被操作干预的虚拟环境,支持相机位姿与文本提示两类输入,适用于游戏原型验证、具身智能训练与交互式内容创作。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 实时交互世界模型(World Model) |
| 出品方 | 蚂蚁灵波科技(Robbyant,蚂蚁集团旗下) |
| 发布时间 | 2026 年 9 月 10 日 |
| 本次新增模型 | Small 1.3B、Bidirectional、Causal Pretrain |
| 首发主模型 | 14B(2026 年 7 月开源) |
| 实时规格 | 最高 720P、60FPS |
| 生成时长 | 小时级连续生成不漂移 |
| 输入方式 | 相机位姿、文本提示、角色动作与环境事件 |
| 开放程度 | 代码、权重与技术报告全套开放 |

LingBot-World 2.0 的核心能力
把实时运行门槛压到消费级单卡
本次开源的 LingBot-World 2.0 Small 采用 1.3B 参数规模,面向消费级单卡 GPU 设计,可以在单卡上实现实时世界生成。参数变小带来的不只是一组数字变化:过去开发者更多是通过公开视频或在线 Demo 观察世界模型的能力,现在可以在本地直接运行模型,观察连续生成过程、修改输入方式、测试不同交互设计并搭建应用原型。对个人开发者、高校实验室与小型团队来说,能跑起来和只能看演示,是两种完全不同的研究起点。
小时级连续生成与 720P、60FPS 实时输出
LingBot-World 2.0 的主模型在 2026 年 7 月开源时就已实现小时级连续生成,可响应攻击、射箭、施法、射击等角色动作,以及下雪、下雨等环境事件;在更高算力与相应推理配置下可达到 720P、60FPS 的高清实时体验。注意力放在「画面不漂移」上:世界模型一旦在长时序里崩掉纹理与几何结构,交互体验就无法成立,这正是这一版把长时稳定性当作主线的原因。
因果预训练与 MoBA 的长时稳定性
在 LingBot-World 2.0 里,当前世界状态只依赖过去的视觉观察与截至当前时刻的用户输入,不能访问未来信息,这种因果性模拟了真实交互——你往前走一步,世界才生成下一步。为兼顾自回归生成与视觉质量,团队引入了 Mixture of Bidirectional and Autoregressive Attention Mask(MoBA),在 Teacher Forcing 掩码里加入双向注意力组件,缓解纯 Teacher Forcing 带来的过拟合与画质下降,并帮助模型从双向生成过渡到自回归生成,配套的因果交叉注意力则用于防止未来语义泄漏。技术报告中的定性对比显示,在 5 秒至 60 秒的长时生成中,它在纹理细节、几何结构与场景连贯性上保持得更稳。
两阶段蒸馏压缩单帧成本
高质量生成通常需要多步去噪,计算成本难以满足实时交互,团队因此结合一致性蒸馏与分布匹配蒸馏:前者把 Teacher 的多步生成轨迹压缩到少步 Student,后者让 Student 在自身长时 self-rollout 的轨迹上继续训练,抑制长时自回归过程里不断累积的误差。通过开放 Bidirectional 双向 Teacher 模型,研究者可以拿到更完整的蒸馏起点,用于训练更轻、更快或更适合特定场景的 Student 模型。
双 Agent 驱动的世界演化
LingBot-World 2.0 由 Pilot Agent 与 Director Agent 组成的 Agentic Interaction Harness 协同工作,前者负责角色行为、后者负责环境内容生成,让世界在探索过程中继续演化,而不是把玩家困在一段固定视频里。这条路线与通用 AI 智能体 的思路一致:把「持续推进一件事」的职责交给 Agent 层,模型层专注把当前一步生成好。
完整开源体系与本地部署路径
这一轮开放的三款模型让开发者既可以直接运行 1.3B 小模型,也可以从 Causal Pretrain 或 Bidirectional 出发继续做后训练、评测、蒸馏、压缩与推理加速。同厂的 LingBot 系列此前已有多个方向的开源落地,例如面向视觉动作的 LingBot-VA 2.0 把同一套世界建模能力延伸到机器人动作领域,本次 World 线的轻量化则补上了「能本地跑起来」这一环。
LingBot-World 2.0 与同类实时世界模型的对比
下表把 LingBot-World 2.0 与 Genie 3、Zing-0.5、ABot-World Studio 在实时规格、长时一致性与开放程度上并列,便于判断各自的可用边界。
| 对比维度 | LingBot-World 2.0 | Genie 3 | Zing-0.5 | ABot-World Studio |
|---|---|---|---|---|
| 出品方 | 蚂蚁灵波科技 | 谷歌 DeepMind | Loopit(涌跃智能) | 高德(阿里巴巴集团) |
| 参数规模 | 14B 主模型与 1.3B Small 两档 | 官方未公布 | 5B(基于 Wan2.2-TI2V-5B) | 官方未公布 |
| 实时规格 | 最高 720P、60FPS | 720p、24fps | 单卡 RTX 5090 实时超 24 FPS | 官方未公布 |
| 长时一致性 | 小时级连续生成不漂移 | 约 1 分钟画面一致 | 官方未公布 | 超 1 小时稳定推理 |
| 交互方式 | 角色动作、环境事件、相机位姿与文本提示 | 键鼠控制角色与环境交互 | 键盘操控与自然语言改写 | 文本或图片驱动的交互视频与 3D 场景 |
| 技术路线 | 因果预训练、MoBA 加两阶段蒸馏 | 自回归扩散与可扩展潜空间 | 基于 Wan2.2 的因果扩散架构 | 连续世界建模架构 |
| 开放程度 | 代码、权重与技术报告开放 | 闭源,随 Gemini Ultra 体验 | Apache 2.0 开放代码与权重 | 系列模型已开源 |
| 本地部署门槛 | 1.3B 版单张消费级 GPU | 依赖云端服务 | 单张消费级 GPU | 单张 RTX 5090 |
四者的差别主要在开放程度与运行时长的取舍上:Genie 3 把体验放在云端订阅里,Zing-0.5 与 LingBot-World 2.0 都选择开源到消费级单卡,ABot-World Studio 则在超一小时稳定推理与 3D 场景生成上做文章。如果要自己改训练链路或做蒸馏实验,能拿到因果预训练底座与双向 Teacher 的路线更实用。
如果想顺带看看世界模型在空间智能方向上的另一种做法,可以参考 Atlas(World Labs 推出的多模态世界模型,把文本、图像、相机位姿与深度图统一锚定在三维空间,与本文讨论的实时交互路线属同一赛道)。
LingBot-World 2.0 的应用场景与适用人群
LingBot-World 2.0 的价值集中在「需要可交互、可长时间演化、且要被反复修改」的场景,以下四类最能体现它的用途。
- 游戏原型与关卡预演:用文本提示与镜头控制快速生成可探索场景,先验证玩法与节奏,再进入美术生产环节。
- 具身智能与机器人训练:世界模型提供可交互环境,开发者可基于因果预训练底座做后训练与场景适配。
- 交互式内容创作:小时级连续生成让长时间直播式演示、互动短片与虚拟场景漫游具备可行性。
- 研究与教学:1.3B 版可在高校实验室与个人单卡环境里复现、改造并测试新的交互设计。
适用人群:个人开发者、高校实验室与小型团队,具身智能与机器人方向的研究者,以及需要低成本验证交互式内容创意的游戏与影视团队。
LingBot-World 2.0 的使用方法
- 获取权重与代码:在 LingBot-World 2.0 官方仓库 查看说明,并从 Hugging Face 或魔搭社区下载 Small 1.3B、Bidirectional 或 Causal Pretrain 权重。
- 准备本地环境:Small 版面向消费级单卡 GPU,按仓库文档配置推理依赖后即可尝试实时生成。
- 选择输入方式:相机位姿用于控制移动与视角,文本提示用于改变局部事件与世界状态。
- 继续训练与蒸馏:从 Causal Pretrain 或 Bidirectional 出发做后训练、蒸馏与压缩,适配具体场景。
LingBot-World 2.0的官方资源
- 项目官网:https://technology.robbyant.com/lingbot-world-v2
- GitHub仓库:https://github.com/robbyant/lingbot-world-v2
- HuggingFace模型库:https://huggingface.co/robbyant/lingbot-world-v2-14b-causal-fast
- arXiv技术论文:https://arxiv.org/pdf/2607.07534
LingBot-World 2.0 的价格与开源情况
LingBot-World 2.0 以开源方式免费提供,官方未对模型本身设置调用费用,实际投入主要是本地部署所需的 GPU 算力与显存。1.3B 小模型把门槛压到单张消费级显卡,14B 主模型要跑出高清实时体验则仍需更高规格的推理配置,算力预算需要按目标分辨率与帧率来估。
LingBot-World 2.0 的代码、权重与技术报告在本轮开源中一并开放,项目主页、GitHub 仓库、Hugging Face 与魔搭社区均已提供入口,官方公告暂未逐项列出许可证与商用条款,落地到商业项目之前需要以仓库与模型卡上的许可说明为准。
LingBot-World 2.0 的常见问题
LingBot-World 2.0 的 1.3B 版需要什么显卡?
官方把 Small 1.3B 定位为面向消费级单卡 GPU 的版本,可在单卡上实现实时世界生成;14B 主模型要达到 720P、60FPS 需要更高规格的推理配置。
1.3B 和 14B 版本应该怎么选?
以本地体验、改造与教学为目的选 1.3B;需要更高画质与更完整的实时交互体验选 14B。两者不冲突,1.3B 也可以配合 Bidirectional 与 Causal Pretrain 做蒸馏与后训练。
LingBot-World 2.0 与 Genie 3 有什么区别?
主要差别在开放程度与时长表现:LingBot-World 2.0 开放代码、权重与技术报告并支持本地部署,长时生成可达小时级;Genie 3 为闭源服务,通过 Gemini Ultra 订阅体验,画面一致性约 1 分钟。
浙公网安备33010202004812号