MiniCPM5-2B是一款由面壁智能联合 OpenBMB 在 2026 年 9 月推出的2B 参数端侧语言基座模型,主要用于本地设备上的语言推理与 Agentic 任务,支持英特尔、瑞芯微、Arm 等平台 Day0 适配与 Apache 2.0 商用,适用于移动端与边缘设备部署场景,也适合想在手机、开发板等端侧设备本地部署大模型的开发者。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 2B 参数端侧语言基座模型 |
| 出品方 | 面壁智能 × OpenBMB |
| 发布时间 | 2026 年 9 月 8 日 |
| 参数规模 | 2B |
| 核心能力 | 端侧推理、Agentic 能力、多平台 Day0 适配 |
| 开源情况 | Apache 2.0 协议,端侧可商用 |
| 支持平台 | 英特尔 CPU、瑞芯微 NPU、Arm 移动端 SoC |

MiniCPM5-2B 的核心能力
AA 榜 4B 以下全球第一的端侧基座
AA 榜是端侧模型权威评测,覆盖推理、对话、代码、Agentic 四个维度。MiniCPM5-2B 综合 23 分,超越 4B 以下所有开源模型,与 7B 同档模型的差距缩小到 2 分以内。这意味着开发者可以放心用 2B 模型替代 4B-7B 模型做边缘部署,硬件成本与功耗显著下降。作为一款开源的端侧 大语言模型,它在离线、数据不出设备的前提下也能完成可靠推理。
Agentic Index 20 分约为同档十倍
Agentic Index 衡量模型在多轮工具调用、API 路由、复杂任务规划上的稳定性。MiniCPM5-2B 拿到 20 分,同档 2B-3B 模型平均仅 2 分,提升约 10 倍。这让 AI Agent 在本地设备上的稳定运行成为可能——比如手机端的语音助手、IoT 设备的本地决策节点,都不再依赖云端推理。
Day0 多平台硬件适配
MiniCPM5-2B 在发布当天就完成了英特尔 CPU、瑞芯微 NPU、Arm 移动端 SoC 的 Day0 适配。开发者无需自己做量化与算子优化,可直接用官方提供的 llama.cpp / MNN 推理后端在不同硬件上跑通。瑞芯微 RK3588、英特尔 Lunar Lake、Arm Cortex-A 系列都已纳入官方 benchmark。
UltraData 数据与 Meshy 框架开源
随 MiniCPM5-2B 一起开源的还有 UltraData 训练数据列表、Meshy 多模态训练框架与 JustRL II 强化学习工具。这些开源组件让研究者和二次开发者能在 MiniCPM5-2B 基础上做垂直领域微调,比如行业术语、垂直场景对话流。
MiniCPM5-2B 与同类端侧模型的对比
下面把 MiniCPM5-2B 与端侧代表(蚂蚁 Ling-3.0-tiny)、国际端侧代表(Meta Llama 3.2 3B)做横向比较。
| 对比维度 | MiniCPM5-2B | Ling-3.0-tiny | Llama 3.2 3B |
|---|---|---|---|
| 开发方 | 面壁智能 × OpenBMB | 蚂蚁百灵 | Meta |
| 参数规模 | 2B | 轻量混合推理架构 | 3B |
| 核心定位 | 端侧语言基座 + Agentic 强 | 端侧轻量混合推理 | 端侧多模态轻量模型 |
| 关键基准 | AA 榜 4B 以下全球第一 / Agentic Index 20 | 轻量推理 + 工具调用 | 端侧多模态基线 |
| 上下文能力 | 32K | 8K | 128K |
| 开源程度 | Apache 2.0 | 蚂蚁开源协议 | Llama 3.2 Community License |
| 硬件适配 | 英特尔 / 瑞芯微 / Arm Day0 | SoC | 移动芯片 |
| 生态集成 | llama.cpp / Ollama / MNN | MNN 端侧推理 | llama.cpp / Ollama |
整体来看,MiniCPM5-2B 在 2B 体量上做出 4B 以下全球第一的成绩,并把 Agentic 能力拉到同档十倍;Ling-3.0-tiny 偏重混合推理与工具调用;Llama 3.2 3B 强在多模态与生态成熟度。
如果想了解另一款国产端侧轻量模型在工具调用与混合推理上的能力,可以参考下面这篇 Ling-3.0-tiny(蚂蚁百灵推出的端侧轻量模型,与 MiniCPM5-2B 在端侧部署上形成互补)。
MiniCPM5-2B 的应用场景与适用人群
- 移动端本地 Agent:手机、平板上的本地语音助手、文档总结、即时翻译,云端依赖降到最低
- 边缘设备 AI 部署:工业 IoT、车机、智能家居网关的本地决策节点,弱网或离线场景可用
- 低成本 SaaS 推理后端:中小团队用 2B 模型替代 7B 模型,月推理成本可降至 1/3
适用人群:端侧 AI 产品经理、移动端开发者、IoT 设备厂商、需要本地推理能力的 SaaS 团队。其中硬件厂商与 IoT 厂商更适合直接对接 Day0 适配,AI 产品经理建议先做小流量灰度验证再放量。
MiniCPM5-2B 的使用方法
本地部署 MiniCPM5-2B 只需 GitHub 拉权重 + llama.cpp 或 MNN 推理,下面给出四步流程。
- 下载模型权重:通过 MiniCPM 官方仓库 拉取 2B 权重与配置文件,单次下载约 4GB
- 选择推理后端:通用 CPU 选 llama.cpp,移动端 NPU 选 MNN,x86 量化版可直接在 CPU 上跑
- 配置量化方案:根据硬件选择 Q4_K_M(4GB 显存)或 Q8_0(6GB 显存),平衡速度与精度
- 部署到目标设备:通过 llama.cpp server 或 MNN 部署到手机/边缘设备,调用 OpenAI 兼容 API
MiniCPM5-2B 的价格与开源情况
MiniCPM5-2B 完全开源免费,权重采用 Apache 2.0 协议,开发者可在本地或自有云上零成本部署;商用产品集成也无需授权费,仅需保留协议声明。对比同等能力的 7B 模型推理成本(按云端 API 估算),MiniCPM5-2B 单次 token 成本可降至约 1/3。
面壁智能与 OpenBMB 同步放出了完整训练数据(UltraData)、多模态训练框架(Meshy)与强化学习工具(JustRL II),开发者可在 2B 基座上做垂直领域微调。官方推荐的部署路径是 llama.cpp(通用 CPU/GPU)或 MNN(移动端 NPU),两个后端都已纳入官方 benchmark 与 CI 流水线。
MiniCPM5-2B 的常见问题
MiniCPM5-2B 与上一代 MiniCPM 系列的差异?
主要差异在 Agentic 能力与硬件适配。MiniCPM5-2B 把 Agentic Index 拉到 20 分(约为同档十倍),并完成英特尔、瑞芯微、Arm 三大平台 Day0 适配;上一代主要面向 PC 与服务器级硬件。
2B 参数够用吗?
在端侧场景够用。AA 榜单上 MiniCPM5-2B 综合 23 分,与 7B 模型差距缩小到 2 分以内;端侧场景对极致能力要求不高,更看重功耗、成本与隐私,2B 是当前端侧甜点位。
需要什么样的硬件才能跑起来?
最低配置:4GB 内存的 Arm 手机或 RK3588 边缘设备可跑 Q4 量化版;推荐配置:8GB 内存 + NPU 加速的设备可跑 Q8 量化版,体验更佳。
支持多模态输入吗?
当前版本以纯文本基座为主,多模态能力由 Meshy 训练框架提供;如需图像+文本混合输入,建议配合 MiniCPM-V 系列多模态版本使用。
商业产品集成有什么限制?
Apache 2.0 协议允许商用,集成时只需保留协议声明;建议保留面壁智能与 OpenBMB 的归属标识,并在产品文档中注明模型版本号,便于后续升级追溯。
浙公网安备33010202004812号