Xiaomi MiMo-V2.6是小米 MiMo 团队于2026年9月推出的原生全模态开源模型系列,主要用于长程智能体任务与全模态理解,支持 100 万 token 上下文与文本、图像、视频、音频四类输入,适用于软件工程、科研辅助与端侧智能体开发。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 原生全模态开源模型系列(Pro / Flash) |
| 出品方 | 小米 MiMo 团队 |
| 发布时间 | 2026年9月21日 |
| 模型版本 | Pro 1.02 万亿总参 / Flash 3090 亿总参 |
| 激活参数 | Pro 42B / Flash 15B(每 token) |
| 上下文窗口 | 1,048,576 tokens |
| 最大输出 | 131,072 tokens |
| 输入模态 | 文本、图像、视频、音频 |
| 开源许可 | MIT 许可,权重发布于 Hugging Face |

Xiaomi MiMo-V2.6 的核心能力
Xiaomi MiMo-V2.6 的改进集中在训练方式:这一代把强化学习算力扩展到长程智能体任务,并以开放权重的方式公开模型、训练过程与配套环境。它在保持 API 定价不变的前提下放开了可自托管能力与宽松商用许可,直接影响 AI 智能体 项目的部署与合规选择。
原生全模态与百万级上下文
Pro 与 Flash 均为原生全模态模型,可直接接收文本、图像、视频与音频输入,上下文窗口为 1,048,576 token。架构采用稀疏混合专家设计:Pro 为 1.02 万亿总参数、每 token 激活 42B,70 层中 60 层为滑动窗口注意力;Flash 为 3090 亿总参数、激活 15B。
规模化强化学习与自我改进
训练采用全异步架构,单次更新使用 1,568 个样本、每样本 16 次 rollout。官方披露 Pro 与 Flash 各完成 30 步强化学习、累计约 75 万条轨迹,训练成本约为 262 万美元与 85 万美元;样本外的 DeepSWE v1.1 基准上,Pro 由 58.4 提升至 72.57,Flash 由 48.8 提升至 65.68。
长程编码、三维构建与具身控制
模型在 Artificial Analysis 智能指数上取得 46 分,官方称其为发布时得分最高的开源模型,并称 Flash 全面超过上一代 MiMo-V2.5-Pro。三维与具身方向上,它按图像、视频或文字输入拆解任务,由多个子智能体协作完成场景搭建与交互逻辑编写,也可在 Blender 中依据参考图建模;具身仿真环境中则以多视角相机画面为输入,通过视觉反馈闭环控制机械臂。
计算机操作与科研辅助
计算机操作能力进一步扩展,模型可理解复杂图形界面,使用常见办公与生产力工具完成信息检索、编辑与数据处理。科研辅助方面,官方给出两个案例:在材料设计中提出金属有机框架材料方案并调用开源工具完成筛选;协助完成《周期三蕴含混沌》主定理在 Lean 4 中的形式化,形成 6000 余行源码。
Xiaomi MiMo-V2.6 与同类旗舰模型的对比
| 对比维度 | Xiaomi MiMo-V2.6-Pro | Qwen3.8-Max | Grok 4.7 |
|---|---|---|---|
| 开发方 | 小米 MiMo 团队 | 阿里云千问团队 | SpaceXAI(xAI) |
| 模型定位 | 原生全模态开源模型 | 编程与协作旗舰大模型 | 面向编码与知识工作的旗舰模型 |
| 参数规模 | 1.02 万亿总参、激活 42B | 2.4 万亿总参(MoE 架构) | 2.1 万亿 |
| 上下文窗口 | 1,048,576 tokens | 约 100 万 tokens(最大输入 991K) | 500,000 tokens |
| 输入模态 | 文本、图像、视频、音频 | 文本、图像、视频 | 文本、图像 |
| 开源情况 | MIT 许可,权重开放下载 | 已承诺开放权重,许可尚未公布 | 闭源,仅通过 API 与产品使用 |
| API 定价(输入 / 输出,每百万 tokens) | 0.435 美元 / 0.87 美元 | 2 美元 / 6 美元 | 2 美元 / 6 美元 |
| 缓存输入(每百万 tokens) | 0.0036 美元 | 0.25 美元 | 0.5 美元 |
上表数值取自各发布方的官方发布页与模型文档。定价差异最直接:MiMo-V2.6-Pro 每百万 token 输入 0.435 美元、输出 0.87 美元,约为同表另两款旗舰的五分之一,缓存命中输入 0.0036 美元。模态上 MiMo-V2.6-Pro 与 Qwen3.8-Max 均支持视频输入,前者另有音频输入,Grok 4.7 当前仅支持文本与图像。许可差异最大:MiMo-V2.6-Pro 已以 MIT 许可开放权重,Qwen3.8-Max 已承诺开放但许可尚未公布,Grok 4.7 为闭源。
如需了解上一代的能力与成本基线,可参考 MiMo-V2.5(小米此前的全模态 Agent 模型系列,支持 100 万 token 上下文,与本次发布的 V2.6 系列形成版本对照)。
Xiaomi MiMo-V2.6 的应用场景与适用人群
该模型面向需要自托管、可微调且覆盖多模态输入的智能体项目,常见落点包括:
- 软件工程与仓库级任务:借助 100 万 token 上下文读取整个代码仓库,完成跨文件修改与长程纠错。
- 三维内容与游戏开发:由文字或参考图驱动场景搭建、资产建模与交互逻辑编写,适合预研与原型阶段。
- 具身仿真与机器人研究:以多视角相机画面为输入闭环控制机械臂,用于抓取与装配类研究验证。
- 计算机操作自动化:理解图形界面并操作办公与生产力工具,完成信息检索、编辑与数据处理流程。
- 科研与形式化验证:辅助材料筛选与数学形式化,官方案例中已完成 Lean 4 环境下 6000 余行证明代码。
适用人群:需要自建推理服务或做领域微调的研究与工程团队、对成本敏感且调用量较大的产品团队,以及关注多模态与具身方向的高校与研究机构;受显存限制的团队可先使用 Flash 版本。
Xiaomi MiMo-V2.6 的使用方法
从获取权重到接入业务,可按以下步骤开始:
- 获取权重:在 Xiaomi MiMo-V2.6 官方仓库 下载 Pro 或 Flash 的权重与模型卡,按显存规模选择版本。
- 选择部署方式:自托管使用 vLLM 等推理框架加载权重,Pro 版本需多卡部署;仅需调用能力时改用官方 API,模型名使用
mimo-v2.6-pro等对应编码。 - 配置上下文:按任务需要开启最长 100 万 token 的上下文,长文档与代码仓库任务建议配合上下文压缩控制显存占用。
- 接入智能体框架:把工具调用、环境反馈与轨迹记录接入既有工作流,模型卡提供推理与工具调用的解析器配置,可在受支持的推理框架中直接启用。
- 验收与灰度:先在只读任务上验证输出质量与幻觉率,再逐步放开写操作;商用场景应确认 MIT 许可的署名与合规要求,并保留人工复核环节。
部署阶段建议先以 Flash 版本验证效果与吞吐,再决定是否为 Pro 版本准备多卡环境;若仅做推理,重点监控批处理规模、缓存命中率与平均输出长度。
Xiaomi MiMo-V2.6 的价格与开源情况
Xiaomi MiMo-V2.6 沿用上一代的 API 定价:Pro 版本每百万 token 输入 0.435 美元、输出 0.87 美元,缓存命中输入 0.0036 美元,折扣超过 99 个百分点;Flash 版本为输入 0.14 美元、输出 0.28 美元,缓存命中输入 0.0028 美元。官方另提供 Pro-UltraSpeed 服务档,按 Pro 标准费率的 10 倍计费,对应最高 20 倍的生成速度。
Xiaomi MiMo-V2.6 以 MIT 许可开放权重,模型卡、定价页与技术报告同步公开,权重已发布于 Hugging Face,vLLM 在发布当日提供 FP8 原生权重、推理与工具调用解析器及投机解码支持。MIT 许可允许修改、再分发与商用且无需单独授权,企业既可以按 API 调用,也可以自建推理服务并把权重纳入内部微调流程;自托管的实际成本主要由显存占用与批处理效率决定。
Xiaomi MiMo-V2.6 的常见问题
Xiaomi MiMo-V2.6 有几个版本?
包含 Pro 与 Flash 两个开放权重版本,均为原生全模态模型。Pro 为 1.02 万亿总参数、每 token 激活 42B,面向复杂项目与长程任务;Flash 为 3090 亿总参数、激活 15B,面向高频调用。官方 API 另提供 Pro-UltraSpeed 服务档。
Xiaomi MiMo-V2.6 的开源许可是什么?
采用 MIT 许可开放模型权重,允许修改、再分发与商用且无需单独授权,权重已发布于 Hugging Face,官方同时公开技术报告、训练框架与任务环境。
Xiaomi MiMo-V2.6 可以本地部署吗?
可以。模型以 MIT 许可开放权重,可通过 vLLM 等推理框架自托管,Pro 版本需要多卡环境,Flash 版本对显存要求更低;发布当日已提供 FP8 原生权重与相关解析器支持。
浙公网安备33010202004812号