UnifoLM-WLA-1.0是一款由宇树科技于2026年9月推出的通用人形机器人基座模型,主要用于机器人桌面精细操作与全身移动操作的统一策略学习,支持跨末端执行器泛化与端侧闭环推理,适用于科研实验、家庭服务与人形机器人落地等方向。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 通用人形机器人基座模型(VLA,视觉-语言-动作) |
| 出品方 | 宇树科技(Unitree) |
| 发布时间 | 2026年9月10日(宣布全面开源) |
| 参数规模 | 6B(UnifoLM-ER-Flow 主干 + MMDiT 动作专家) |
| 开源协议 | 权重 + 代码 + 数据集同步开放(科研可免费使用) |
| 训练数据 | 约 2500 小时高质量真机数据 + 500 万+ ER 样本 |
| 任务覆盖 | 单模型统筹 64 项任务(54 项桌面 + 10 项全身) |
| 推理延迟 | 约 106ms 端侧闭环,无需云端 |

UnifoLM-WLA-1.0 的核心能力
一模驱动全身协同
UnifoLM-WLA-1.0 用单一策略检查点统一桌面精细操作与全身移动操作,在宇树 G1 人形机器人上真机验证可完成 64 项任务(54 项桌面 + 10 项全身),不再把导航、抓取拆成两套独立策略,降低了多任务协同的复杂度。桌面任务涵盖叠毛巾、从传送带分拣零件、插拔电源插头等;全身移动任务则包括倒垃圾、把衣物投入洗衣机、铺床、物品上架等居家与后勤动作。在 AI模型 体系中,它属于具身智能方向的机器人基座,与通用对话基座形成能力分工。
跨末端执行器泛化
同一套模型可适配普通两指平行夹爪与两类不同的多指灵巧手,更换末端执行器时无需重新采集数据或重训策略。跨末端执行器泛化此前是机器人开发的主要壁垒——换装五指手通常会破坏策略表征、需要全面重采数据,而 UnifoLM-WLA-1.0 通过统一动作空间与跨本体迁移先验解决了这一问题,兼顾了具身操作实力与通用多模态感知推理水平。
交互式世界建模
WLA(World-Language-Action)在同一多模态框架内整合具身推理、未来动态区域预测与离散动作学习三大能力,并融入以交互为核心的世界建模机制,让模型不仅能看懂图像与文本,还能预测物体交互后的场景变化、建立物理空间常识,从而提升长任务执行的鲁棒性。训练数据包含宇树自有开源数据与 BitRobot-HIW-500 等公开资源,适配多款机器人本体与作业环境。
端侧闭环与低延迟
模型在机器人端侧算力上实现约 106ms 的闭环推理,无需依赖云端连接,适合对实时性要求高的操作场景;统一的多模态表征底座也为后续 WLA 系列模型的训练提供了可复用的接口。它承接宇树早前 UnifoLM-X2 动态世界模型的探索,X2 侧重低延迟、强接触的行走控制,而 WLA-1.0 把重心放在人形系统长期薄弱的工业与居家操作任务上。
UnifoLM-WLA-1.0 与同类具身智能模型的对比
| 对比维度 | UnifoLM-WLA-1.0 | LingBot-VLA 2.0 | Xiaomi-Robotics-0 | Qwen-Robot Suite |
| 开发方 | 宇树科技 | 蚂蚁灵波科技 | 小米 | 阿里通义 |
| 参数规模 | 6B(UnifoLM-ER-Flow 主干 + MMDiT 动作专家) | 6.38B(lingbot-vla-v2-6b) | 4.7B(Qwen3-VL + DiT + Flow Matching) | 套件(RobotNav / RobotManip / RobotWorld),参数未逐一公开 |
| 任务类型 | 桌面 + 全身移动统一 | 具身操作(20 种机器人构型) | 实时 VLA(双臂精细) | 物理世界套件(导航 / 操作 / 世界模型) |
| 开源情况 | 权重 + 代码 + 数据集全开 | Apache-2.0 开源 | 完整开源 + HF 部署 | 开源(部分模块) |
| 末端执行器 | 夹爪 + 两类灵巧手 | 未公开 | 未公开 | 未公开 |
| 真机任务数 | 64 项(54 桌面 + 10 全身) | 未公开 | 未公开 | 未公开 |
| 实时性(推理延迟) | 端侧 ~106ms 闭环,无需云端 | RTX 4090D 单次 ~130ms | 异步实时(边执行边推理) | 未公开 |
| 训练数据 | 约 2500h 真机 + 500 万+ ER 样本 | 约 60000h | 200M 轨迹 + 80M VL 数据 | 未公开(覆盖 15+ 平台) |
UnifoLM-WLA-1.0 的突出特点是「一模驱动、全身协同」:单模型覆盖桌面与全身移动共 64 项真机任务,并开放权重、代码与数据集,准入门槛显著低于闭源路线。LingBot-VLA 2.0、Xiaomi-Robotics-0、Qwen-Robot Suite 同属国产开源具身路线;GPT-6 Astra 作为闭源通用多模态旗舰,在具身专项上未专门优化,仅作能力参考。在特斯拉 Optimus、Figure 等头部厂商多将核心模型闭源的背景下,宇树把基座模型全开源,是其「硬件平价 + 开源生态」打法在模型层的复刻,也标志其从整机厂商向「硬件 + AI 模型」双轮驱动转型。
如果想了解宇树上一代的视觉语言动作模型,可以参考 宇树 UnifoLM-VLA-0:它是 UnifoLM-WLA-1.0 的前作,同样以开源形式开放,奠定了宇树通用人形基础模型的早期体系。
UnifoLM-WLA-1.0 的应用场景与适用人群
UnifoLM-WLA-1.0 的端侧闭环与跨执行器泛化,使它在以下场景中最易落地:
- 家庭服务操作:倒垃圾、洗衣、铺床、收纳餐具与整理厨房等居家精细与移动操作。
- 科研与二次开发:高校与中小团队基于开放权重做垂直场景迁移,构建具身数据飞轮。
- 商业后勤辅助:货架摆放、物料上架、办公环境整理等公寓、酒店与工厂辅助任务。
适用人群:高校与科研机构的具身智能团队、人形机器人厂商与系统集成商,以及希望基于开源基座做场景定制与二次开发的开发者。
UnifoLM-WLA-1.0 的使用方法
UnifoLM-WLA-1.0 以代码、权重与数据集形式开放,可按以下步骤在宇树 G1 / H1 等机器人上跑通:
- 获取代码:访问 UnifoLM-WLA-1.0 官方仓库 或项目主页 unigen-x.github.io/unifolm-wla.github.io,按 README 克隆代码并安装依赖环境。
- 下载权重:用 huggingface-cli download 从 HuggingFace 拉取已开放的 UnifoLM-ER-1 与 UnifoLM-ER-Flow 两款权重,科研用途可免费使用。
- 跑通感知推理:用项目推理脚本加载 ER-1,输入机器人当前画面与任务描述,验证目标定位、空间关系理解等感知推理输出是否正常。
- 接入动作预测:加载 ER-Flow,输入当前图像、任务指令与候选动作,模型输出离散动作 token 与未来动态区域预测,需按官方 RVQ 解码方式还原为连续控制信号。
- 适配真机控制:将解码后的动作指令接入宇树 G1 / H1 的运动控制接口,先在仿真或小规模真机上验证,再正式部署——模型权重本身不含完整机器人控制系统。
UnifoLM-WLA-1.0 的价格与开源情况
UnifoLM-WLA-1.0 以开放权重、推理代码与训练数据集的形式完全开源,高校与科研机构可免费用于研究与二次开发,无需支付授权费用;主要成本来自机器人本体(如宇树 G1)与端侧算力采购,模型本身零授权门槛,显著降低了中小团队进入具身智能的准入成本。这一做法延续了宇树在硬件层「平价 + 开源」的一贯路线,把可复现、可检查的能力下沉到研究机构。
宇树同步开放了 BitRobot-HIW-500 等数据集与完整推理链路,提供从感知到动作的全链路基准,延续其 UnifoLM-VLA-0、UnifoLM-WMA-0 的开源体系,与特斯拉 Optimus、Figure 的闭源路线形成鲜明对照;随着国内具身开源体系成型,「人形机器人安卓时刻」的落地进程有望加速。
UnifoLM-WLA-1.0 的常见问题
UnifoLM-WLA-1.0 是开源的吗,能商用吗?
是。宇树科技将 UnifoLM-WLA-1.0 的权重、推理代码与训练数据集同步开放,高校与科研机构可免费用于研究与二次开发;具体商用条款以宇树官方开源协议为准。
它和宇树之前的 UnifoLM-VLA-0 有什么区别?
UnifoLM-WLA-1.0 升级为统一桌面与全身移动操作的单模型策略,可统筹 64 项真机任务并支持跨末端执行器泛化;UnifoLM-VLA-0 是更早的视觉语言动作模型,WLA-1.0 在其体系上扩展了全身协同与世界建模能力。
UnifoLM-WLA-1.0 需要云端吗,延迟多少?
不需要云端。模型在机器人端侧算力上实现约 106ms 的闭环推理,适合实时操作场景,断网也可正常运行。
模型支持哪些机器人本体与末端执行器?
模型在宇树 G1 人形机器人上完成真机验证,兼容普通两指平行夹爪与两类不同的多指灵巧手,通过统一动作空间与跨本体迁移先验适配多种末端执行器。
UnifoLM-WLA-1.0 在哪些评测上领先?
据宇树公布,该模型在 7 项开源空间与具身推理评测中取得第一,单模型统筹 64 项真机任务的表现刷新了开源具身模型的 SOTA,部分指标可对标主流闭源模型。
浙公网安备33010202004812号