Ling-3.0-flash-base是蚂蚁百灵inclusionAI于2026年8月20日正式开源的Ling-3.0系列大尺寸基座模型,总参数124B、每token仅激活5.1B,512路由专家稀疏度约1/64,开放预训练、中期训练与WSM合并3个权重,MIT许可证,MATH500、LongBench等多项基座基准第一。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 开源语言基座模型(Base Model训练节点权重) |
| 开发团队 | 蚂蚁百灵inclusionAI |
| 开源时间 | 2026年8月20日(6个基座checkpoint同日开源) |
| 模型规模 | 总参124B,激活5.1B |
| 架构 | Hybrid-linear MoE:512路由专家+1共享专家,每token激活8专家,稀疏度约1/64 |
| 开放权重 | 预训练base-30T、中期midtrain、WSM合并base共3个checkpoint |
| 许可证 | MIT License |

Ling-3.0-flash-base核心能力
三个训练节点权重全开放
Ling-3.0-flash-base此次开源把flash尺寸的关键节点checkpoint全部开放,共3个权重:
- 预训练检查点base-30T:完成大规模预训练,未经历中期训练、WSM合并与后训练
- 中期训练检查点base-midtrain:完成中期训练,未做WSM合并与后训练
- WSM合并检查点base:完成加权检查点合并,即最终基座模型
WSM(Warmup-Stable and Merge)策略用加权检查点合并取代学习率衰减,让基座更适合持续预训练与动态数据扩展,详见arXiv:2507.17634。
高度稀疏MoE与原生混合线性注意力
Ling-3.0-flash-base采用官方称为”高度稀疏”的混合专家架构:512个路由专家与1个共享专家,每token仅激活8个路由专家,稀疏度约1/64,总参124B但激活仅5.1B,并原生采用KDA与Gated MLA混合线性注意力,LongBench、LEval长文基准大幅领先。
开发时间线:从推理版到基座权重
按官方发布信息,Ling-3.0系列在2026年7月至8月的开源节奏如下:
- 2026年7月24日:Ling-3.0-flash推理版(124B/A5.1B)正式发布
- 2026年8月7日:Ling-3.0-flash推理版权重开源,量化版随后推出
- 2026年8月11日:Ling-3.0-tiny推理版及量化版权重开源
- 2026年8月20日:蚂蚁百灵正式开源flash-base与tiny-base,6个基座checkpoint全部开放
与tiny-base同配方的放大版
Ling-3.0-flash-base与同日开源的Ling-3.0-tiny-base共享同一套训练配方,官方建议先在tiny上验证策略再放大到flash,这与蚂蚁百灵开源Ling-2.6-1T、Ling-2.6-flash的路线一致。
Ling-3.0-flash-base与同类大尺寸基座模型对比
| 对比维度 | Ling-3.0-flash-base | Ling-2.5-flash-base | Hy3-preview-base |
|---|---|---|---|
| 总参数/激活参数 | 124B / 5.1B | 104B / 7.4B | 295B / 21B |
| HumanEval-Plus(Pass@1) | 81.10 | 80.49 | 79.27 |
| LiveCodeBench(Pass@1) | 40.09 | 33.04 | 35.90 |
| MMLU-Pro(EM) | 67.74 | 61.36 | 66.44 |
| MATH500(Acc) | 79.00 | 74.00 | 60.60 |
| LongBench(Acc) | 52.62 | 42.81 | 20.58 |
| 许可证 | MIT | 开源 | 开源 |
注:以上数据来自HuggingFace官方模型卡的Base Model Evaluation部分,对比模型为Ling-2.5-flash-base(104B/A7.4B)与Hy3-preview-base(295B/A21B)。
从官方数据可以看出,Ling-3.0-flash-base以最少的激活参数(5.1B)拿下知识、数学、代码、长文多数第一:MMLU-Pro、MATH500、LiveCodeBench、LongBench全面领先,LongBench优势超过32个百分点,”少激活、大容量”的稀疏优势非常直接。基座不适合直接部署,对话与智能体能力需用8月7日开源的Ling-3.0-flash推理版,轻量场景可参考站内介绍过的Ling-3.0-tiny。
Ling-3.0-flash-base应用场景与适用人群
Ling-3.0-flash-base面向需要在大尺寸基座上完成模型定制的研究与工程场景。
- 大规模继续预训练:WSM合并版未经历学习率衰减,可注入领域语料
- 代码方向后训练:多项代码基准领先,适合代码SFT与RL实验
- 长上下文研究:LongBench、LEval大幅领先,适合长文任务选型
- MoE系统研究:512路由专家、1/64稀疏度是研究负载均衡的典型样本
- 蒸馏教师模型:124B容量可作知识蒸馏教师,向小模型输出能力
适用人群:大模型研究者、后训练工程师、开源社区开发者,以及有多卡算力、要在开源基座上做领域定制的团队。
如何使用Ling-3.0-flash-base
权重托管在HuggingFace与ModelScope,微调示例由官方ling-cookbook提供,免费无需申请。
环境准备
- HuggingFace或ModelScope账号:MIT许可证,无需申请即可下载全部3个checkpoint
- Python环境:按ling-cookbook要求配置独立环境
- GPU资源:124B总参需多卡环境
- ling-cookbook仓库:官方微调与训练示例
快速开始(下载与微调)
- 下载权重:从HuggingFace的inclusionAI组织页获取Ling-3.0-flash-base,或按阶段选base-30T、midtrain
- 获取示例代码:克隆ling-cookbook仓库,内含微调与继续预训练示例
- 选择介入节点:继续预训练用预训练版,后训练用合并版
- 先小后大:先在tiny-base验证策略,再放大到flash-base
- 对照推理版评估:用推理版Ling-3.0-flash检验效果
微调示例与完整文档见官方仓库:github.com/inclusionAI/ling-cookbook
Ling-3.0-flash-base开源情况
- 开源时间:2026年8月20日正式开源,与tiny-base共6个checkpoint
- 许可证:MIT License,商用与研究均无限制
- 附带版本:flash系另有fp8/fp4量化版与dspark变体
- 推理版对照:Ling-3.0-flash推理版8月7日开源,已上线OpenRouter
- 价格:权重免费,成本仅在算力
Ling-3.0-flash-base和Ling-3.0-flash推理版有什么区别?
flash-base是未经后训练的基座权重,不建议直接对话部署;Ling-3.0-flash是8月7日开源的推理版,具备对话与工具调用能力,可直接部署。
Ling-3.0-flash-base是什么时候开源的?
2026年8月20日。当天蚂蚁百灵把flash-base与tiny-base各3个checkpoint共6个权重一次性开放。
部署Ling-3.0-flash-base需要多少算力?
总参124B、激活5.1B,训练微调需多卡,推理负载低于同总参稠密模型;算力有限可先用tiny-base。
Ling-3.0-flash-base的真实水平如何?
官方模型卡显示其MATH500取得79.00、LongBench 52.62、MMLU-Pro 67.74,多数基准第一,长文与数学最突出。
使用这些权重需要付费或申请吗?
不需要。全部权重MIT许可证公开下载,商用无需授权,成本仅在算力。
浙公网安备33010202004812号