UnifoLM-WLA-1.0 – 宇树科技推出的通用人形机器人基座模型

AI模型5天前更新 老高
51 0

UnifoLM-WLA-1.0是一款由宇树科技2026年9月推出的通用人形机器人基座模型,主要用于机器人桌面精细操作与全身移动操作的统一策略学习,支持跨末端执行器泛化与端侧闭环推理,适用于科研实验、家庭服务与人形机器人落地等方向。

基础信息内容
产品定位通用人形机器人基座模型(VLA,视觉-语言-动作)
出品方宇树科技(Unitree)
发布时间2026年9月10日(宣布全面开源)
参数规模6B(UnifoLM-ER-Flow 主干 + MMDiT 动作专家)
开源协议权重 + 代码 + 数据集同步开放(科研可免费使用)
训练数据约 2500 小时高质量真机数据 + 500 万+ ER 样本
任务覆盖单模型统筹 64 项任务(54 项桌面 + 10 项全身)
推理延迟约 106ms 端侧闭环,无需云端
UnifoLM-WLA-1.0 – 宇树科技推出的通用人形机器人基座模型

UnifoLM-WLA-1.0 的核心能力

一模驱动全身协同

UnifoLM-WLA-1.0 用单一策略检查点统一桌面精细操作与全身移动操作,在宇树 G1 人形机器人上真机验证可完成 64 项任务(54 项桌面 + 10 项全身),不再把导航、抓取拆成两套独立策略,降低了多任务协同的复杂度。桌面任务涵盖叠毛巾、从传送带分拣零件、插拔电源插头等;全身移动任务则包括倒垃圾、把衣物投入洗衣机、铺床、物品上架等居家与后勤动作。在 AI模型 体系中,它属于具身智能方向的机器人基座,与通用对话基座形成能力分工。

跨末端执行器泛化

同一套模型可适配普通两指平行夹爪与两类不同的多指灵巧手,更换末端执行器时无需重新采集数据或重训策略。跨末端执行器泛化此前是机器人开发的主要壁垒——换装五指手通常会破坏策略表征、需要全面重采数据,而 UnifoLM-WLA-1.0 通过统一动作空间与跨本体迁移先验解决了这一问题,兼顾了具身操作实力与通用多模态感知推理水平。

交互式世界建模

WLA(World-Language-Action)在同一多模态框架内整合具身推理、未来动态区域预测与离散动作学习三大能力,并融入以交互为核心的世界建模机制,让模型不仅能看懂图像与文本,还能预测物体交互后的场景变化、建立物理空间常识,从而提升长任务执行的鲁棒性。训练数据包含宇树自有开源数据与 BitRobot-HIW-500 等公开资源,适配多款机器人本体与作业环境。

端侧闭环与低延迟

模型在机器人端侧算力上实现约 106ms 的闭环推理,无需依赖云端连接,适合对实时性要求高的操作场景;统一的多模态表征底座也为后续 WLA 系列模型的训练提供了可复用的接口。它承接宇树早前 UnifoLM-X2 动态世界模型的探索,X2 侧重低延迟、强接触的行走控制,而 WLA-1.0 把重心放在人形系统长期薄弱的工业与居家操作任务上。

UnifoLM-WLA-1.0 与同类具身智能模型的对比

对比维度UnifoLM-WLA-1.0LingBot-VLA 2.0Xiaomi-Robotics-0Qwen-Robot Suite
开发方宇树科技蚂蚁灵波科技小米阿里通义
参数规模6B(UnifoLM-ER-Flow 主干 + MMDiT 动作专家)6.38B(lingbot-vla-v2-6b)4.7B(Qwen3-VL + DiT + Flow Matching)套件(RobotNav / RobotManip / RobotWorld),参数未逐一公开
任务类型桌面 + 全身移动统一具身操作(20 种机器人构型)实时 VLA(双臂精细)物理世界套件(导航 / 操作 / 世界模型)
开源情况权重 + 代码 + 数据集全开Apache-2.0 开源完整开源 + HF 部署开源(部分模块)
末端执行器夹爪 + 两类灵巧手未公开未公开未公开
真机任务数64 项(54 桌面 + 10 全身)未公开未公开未公开
实时性(推理延迟)端侧 ~106ms 闭环,无需云端RTX 4090D 单次 ~130ms异步实时(边执行边推理)未公开
训练数据约 2500h 真机 + 500 万+ ER 样本约 60000h200M 轨迹 + 80M VL 数据未公开(覆盖 15+ 平台)

UnifoLM-WLA-1.0 的突出特点是「一模驱动、全身协同」:单模型覆盖桌面与全身移动共 64 项真机任务,并开放权重、代码与数据集,准入门槛显著低于闭源路线。LingBot-VLA 2.0、Xiaomi-Robotics-0、Qwen-Robot Suite 同属国产开源具身路线;GPT-6 Astra 作为闭源通用多模态旗舰,在具身专项上未专门优化,仅作能力参考。在特斯拉 Optimus、Figure 等头部厂商多将核心模型闭源的背景下,宇树把基座模型全开源,是其「硬件平价 + 开源生态」打法在模型层的复刻,也标志其从整机厂商向「硬件 + AI 模型」双轮驱动转型。

如果想了解宇树上一代的视觉语言动作模型,可以参考 宇树 UnifoLM-VLA-0:它是 UnifoLM-WLA-1.0 的前作,同样以开源形式开放,奠定了宇树通用人形基础模型的早期体系。

UnifoLM-WLA-1.0 的应用场景与适用人群

UnifoLM-WLA-1.0 的端侧闭环与跨执行器泛化,使它在以下场景中最易落地:

  • 家庭服务操作:倒垃圾、洗衣、铺床、收纳餐具与整理厨房等居家精细与移动操作。
  • 科研与二次开发:高校与中小团队基于开放权重做垂直场景迁移,构建具身数据飞轮。
  • 商业后勤辅助:货架摆放、物料上架、办公环境整理等公寓、酒店与工厂辅助任务。

适用人群:高校与科研机构的具身智能团队、人形机器人厂商与系统集成商,以及希望基于开源基座做场景定制与二次开发的开发者。

UnifoLM-WLA-1.0 的使用方法

UnifoLM-WLA-1.0 以代码、权重与数据集形式开放,可按以下步骤在宇树 G1 / H1 等机器人上跑通:

  1. 获取代码:访问 UnifoLM-WLA-1.0 官方仓库 或项目主页 unigen-x.github.io/unifolm-wla.github.io,按 README 克隆代码并安装依赖环境。
  2. 下载权重:用 huggingface-cli download 从 HuggingFace 拉取已开放的 UnifoLM-ER-1 与 UnifoLM-ER-Flow 两款权重,科研用途可免费使用。
  3. 跑通感知推理:用项目推理脚本加载 ER-1,输入机器人当前画面与任务描述,验证目标定位、空间关系理解等感知推理输出是否正常。
  4. 接入动作预测:加载 ER-Flow,输入当前图像、任务指令与候选动作,模型输出离散动作 token 与未来动态区域预测,需按官方 RVQ 解码方式还原为连续控制信号。
  5. 适配真机控制:将解码后的动作指令接入宇树 G1 / H1 的运动控制接口,先在仿真或小规模真机上验证,再正式部署——模型权重本身不含完整机器人控制系统。

UnifoLM-WLA-1.0 的价格与开源情况

UnifoLM-WLA-1.0 以开放权重、推理代码与训练数据集的形式完全开源,高校与科研机构可免费用于研究与二次开发,无需支付授权费用;主要成本来自机器人本体(如宇树 G1)与端侧算力采购,模型本身零授权门槛,显著降低了中小团队进入具身智能的准入成本。这一做法延续了宇树在硬件层「平价 + 开源」的一贯路线,把可复现、可检查的能力下沉到研究机构。

宇树同步开放了 BitRobot-HIW-500 等数据集与完整推理链路,提供从感知到动作的全链路基准,延续其 UnifoLM-VLA-0、UnifoLM-WMA-0 的开源体系,与特斯拉 Optimus、Figure 的闭源路线形成鲜明对照;随着国内具身开源体系成型,「人形机器人安卓时刻」的落地进程有望加速。

UnifoLM-WLA-1.0 的常见问题

UnifoLM-WLA-1.0 是开源的吗,能商用吗?

是。宇树科技将 UnifoLM-WLA-1.0 的权重、推理代码与训练数据集同步开放,高校与科研机构可免费用于研究与二次开发;具体商用条款以宇树官方开源协议为准。

它和宇树之前的 UnifoLM-VLA-0 有什么区别?

UnifoLM-WLA-1.0 升级为统一桌面与全身移动操作的单模型策略,可统筹 64 项真机任务并支持跨末端执行器泛化;UnifoLM-VLA-0 是更早的视觉语言动作模型,WLA-1.0 在其体系上扩展了全身协同与世界建模能力。

UnifoLM-WLA-1.0 需要云端吗,延迟多少?

不需要云端。模型在机器人端侧算力上实现约 106ms 的闭环推理,适合实时操作场景,断网也可正常运行。

模型支持哪些机器人本体与末端执行器?

模型在宇树 G1 人形机器人上完成真机验证,兼容普通两指平行夹爪与两类不同的多指灵巧手,通过统一动作空间与跨本体迁移先验适配多种末端执行器。

UnifoLM-WLA-1.0 在哪些评测上领先?

据宇树公布,该模型在 7 项开源空间与具身推理评测中取得第一,单模型统筹 64 项真机任务的表现刷新了开源具身模型的 SOTA,部分指标可对标主流闭源模型。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章