Ling-3.0-tiny-base是蚂蚁百灵inclusionAI于2026年8月20日正式开源的Ling-3.0系列轻量基座模型,总参数7.9B、每token仅激活1.3B,128路由专家稀疏MoE,同步开放预训练、中期训练与WSM合并3个训练节点权重,MIT许可证,适合继续预训练与MoE消融研究等低成本场景。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 开源语言基座模型(Base Model训练节点权重) |
| 开发团队 | 蚂蚁百灵inclusionAI |
| 开源时间 | 2026年8月20日(6个基座checkpoint同日开源) |
| 模型规模 | 总参数7.9B,激活参数1.3B |
| 架构 | Hybrid-linear MoE:128路由专家+1共享专家,每token激活8专家 |
| 开放权重 | 预训练base-30T、中期base-midtrain、WSM合并base共3个checkpoint |
| 许可证 | MIT License |

Ling-3.0-tiny-base核心能力
三个训练节点权重全开放
此次开源最特殊的地方在于,蚂蚁百灵把tiny尺寸训练过程的关键节点checkpoint全部开放,共3个权重:
- 预训练检查点base-30T:完成大规模预训练,未经历中期训练、WSM合并与后训练
- 中期训练检查点base-midtrain:完成中期训练,未做WSM合并与后训练
- WSM合并检查点base:完成加权检查点合并,即最终基座模型
WSM(Warmup-Stable and Merge)策略用加权检查点合并取代传统学习率衰减,让基座更适合持续预训练与动态数据扩展,技术细节见arXiv:2507.17634。
高度稀疏MoE与原生混合线性注意力
Ling-3.0-tiny-base采用高度稀疏的混合专家架构:128个路由专家与1个共享专家,每个token仅激活8个路由专家,总参数7.9B但激活参数只有1.3B。同时在预训练一开始就原生采用KDA与Gated MLA结合的混合线性注意力以兼顾长上下文效率,这与站内介绍过的推理版Ling-3.0-tiny一脉相承。
开发时间线:从推理版到基座权重
按官方发布信息,Ling-3.0系列在2026年7月至8月的开源节奏如下:
- 2026年7月24日:Ling-3.0-flash推理版(124B/A5.1B)正式发布
- 2026年8月7日:Ling-3.0-flash推理版权重开源,fp8、fp4量化版随后推出
- 2026年8月11日:Ling-3.0-tiny推理版及量化版权重开源
- 2026年8月20日:蚂蚁百灵正式开源tiny-base与flash-base,6个基座checkpoint全部开放
尺寸无缝扩展的实验路径
Ling-3.0-tiny-base与同日开源的Ling-3.0-flash-base共享同一套训练配方,可以先在7.9B的tiny上低成本验证策略,再扩展到124B的flash。
Ling-3.0-tiny-base与同类轻量基座模型对比
| 对比维度 | Ling-3.0-tiny-base | Ling-2.5-mini-base | Qwen3.5-9B-base |
|---|---|---|---|
| 总参数/激活参数 | 7.9B / 1.3B | 16B / 1.4B | 9B(稠密) |
| HumanEval-Plus(Pass@1) | 79.27 | 76.22 | 52.44 |
| LiveCodeBench(Pass@1) | 24.23 | 22.91 | 18.06 |
| BigCodeBench(Pass@1) | 42.89 | 42.54 | 29.39 |
| MATH500(Acc) | 65.60 | 68.40 | 55.20 |
| 许可证 | MIT | 开源 | 开源 |
注:以上数据来自HuggingFace官方模型卡的Base Model Evaluation部分,对比模型为Ling-2.5-mini-base(16B/A1.4B)与Qwen3.5-9B-base。
从官方数据可以看出,Ling-3.0-tiny-base的代码能力是最突出的长板:HumanEval-Plus、LiveCodeBench、BigCodeBench等代码基准全部领先,HumanEval-Plus对Qwen3.5-9B-base优势接近27个百分点;知识与数学基准上互有胜负。官方明确基座不适合直接部署,正式对话与智能体能力需用后训练完成的Ling-3.0-tiny推理版,这与蚂蚁百灵开源Ling-2.6-1T、Ling-2.6-flash的基座先行策略一致。
Ling-3.0-tiny-base应用场景与适用人群
Ling-3.0-tiny-base面向需要自己完成模型定制、又要控制算力成本的研究与工程场景。
- 代码方向后训练研究:多项代码基准领先,适合代码SFT与RL后训练实验
- 继续预训练:WSM合并版未经历学习率衰减,可直接注入领域语料持续预训练
- MoE消融实验:128路由专家的小规模让路由与负载均衡实验成本可控
- 蒸馏研究:官方推荐用途,可结合Ling系列大模型开展知识蒸馏
适用人群:主要是大模型研究者、后训练工程师、开源社区开发者,以及算力有限、希望在Ling-3.0体系内验证训练策略的高校与小团队。
如何使用Ling-3.0-tiny-base
权重托管在HuggingFace与ModelScope,微调示例由官方ling-cookbook仓库提供,免费无需申请。
环境准备
- HuggingFace或ModelScope账号:MIT许可证,无需申请即可下载全部3个checkpoint
- Python环境:按ling-cookbook要求配置独立环境
- GPU资源:7.9B总参可单卡加载,量化版显存更低
- ling-cookbook仓库:官方微调与训练示例代码
快速开始(下载与微调)
- 下载权重:从HuggingFace的inclusionAI组织页获取Ling-3.0-tiny-base,或按阶段选base-30T、base-midtrain
- 获取示例代码:克隆ling-cookbook仓库,内含微调与继续预训练示例
- 选择介入节点:继续预训练用预训练版,后训练用WSM合并版
- 小规模验证:先在tiny-base上验证策略,再扩展到124B的Ling-3.0-flash-base
- 对照推理版评估:用推理版Ling-3.0-tiny检验自训模型效果
微调示例与完整文档见官方仓库:github.com/inclusionAI/ling-cookbook
Ling-3.0-tiny-base开源情况
- 开源时间:2026年8月20日正式开源,与flash-base共6个checkpoint
- 许可证:MIT License,商用与研究均无限制
- 推理版对照:Ling-3.0-tiny推理版权重已于8月11日开源,并上线OpenRouter
- 价格:权重免费,成本仅在训练与部署算力
Ling-3.0-tiny-base和Ling-3.0-tiny推理版有什么区别?
tiny-base是未经后训练的基座权重,不建议直接对话部署;Ling-3.0-tiny是8月11日开源的推理版本,具备对话与工具调用能力,可直接部署。
Ling-3.0-tiny-base是什么时候开源的?
2026年8月20日。当天蚂蚁百灵把tiny-base与flash-base各3个训练节点checkpoint共6个权重一次性开放,托管在HuggingFace与ModelScope。
为什么同时开源3个checkpoint?
预训练、中期训练、WSM合并三个节点对应不同研究介入点,多节点开放便于对比介入效果,也支持MoE消融与蒸馏研究。
Ling-3.0-tiny-base的代码能力真实水平如何?
官方模型卡显示其HumanEval-Plus取得79.27 Pass@1,领先Ling-2.5-mini-base与Qwen3.5-9B-base,代码是基座最突出的能力方向。
使用这些权重需要付费或申请吗?
不需要。全部权重采用MIT许可证公开下载,商用无需授权,成本仅在算力。
浙公网安备33010202004812号