Ling-3.0-flash-base – 蚂蚁百灵开源的124B稀疏MoE基座模型

AI模型11小时前更新 智小研
11 0

Ling-3.0-flash-base蚂蚁百灵inclusionAI2026年8月20日正式开源的Ling-3.0系列大尺寸基座模型,总参数124B、每token仅激活5.1B,512路由专家稀疏度约1/64,开放预训练、中期训练与WSM合并3个权重,MIT许可证,MATH500、LongBench等多项基座基准第一。

基础信息内容
产品定位开源语言基座模型(Base Model训练节点权重)
开发团队蚂蚁百灵inclusionAI
开源时间2026年8月20日(6个基座checkpoint同日开源)
模型规模总参124B,激活5.1B
架构Hybrid-linear MoE:512路由专家+1共享专家,每token激活8专家,稀疏度约1/64
开放权重预训练base-30T、中期midtrain、WSM合并base共3个checkpoint
许可证MIT License
Ling-3.0-flash-base – 蚂蚁百灵开源的124B稀疏MoE基座模型

Ling-3.0-flash-base核心能力

三个训练节点权重全开放

Ling-3.0-flash-base此次开源把flash尺寸的关键节点checkpoint全部开放,共3个权重:

  • 预训练检查点base-30T:完成大规模预训练,未经历中期训练、WSM合并与后训练
  • 中期训练检查点base-midtrain:完成中期训练,未做WSM合并与后训练
  • WSM合并检查点base:完成加权检查点合并,即最终基座模型

WSM(Warmup-Stable and Merge)策略用加权检查点合并取代学习率衰减,让基座更适合持续预训练与动态数据扩展,详见arXiv:2507.17634。

高度稀疏MoE与原生混合线性注意力

Ling-3.0-flash-base采用官方称为”高度稀疏”的混合专家架构:512个路由专家与1个共享专家,每token仅激活8个路由专家,稀疏度约1/64,总参124B但激活仅5.1B,并原生采用KDA与Gated MLA混合线性注意力,LongBench、LEval长文基准大幅领先。

开发时间线:从推理版到基座权重

按官方发布信息,Ling-3.0系列在2026年7月至8月的开源节奏如下:

  • 2026年7月24日:Ling-3.0-flash推理版(124B/A5.1B)正式发布
  • 2026年8月7日:Ling-3.0-flash推理版权重开源,量化版随后推出
  • 2026年8月11日:Ling-3.0-tiny推理版及量化版权重开源
  • 2026年8月20日:蚂蚁百灵正式开源flash-base与tiny-base,6个基座checkpoint全部开放

与tiny-base同配方的放大版

Ling-3.0-flash-base与同日开源的Ling-3.0-tiny-base共享同一套训练配方,官方建议先在tiny上验证策略再放大到flash,这与蚂蚁百灵开源Ling-2.6-1TLing-2.6-flash的路线一致。

Ling-3.0-flash-base与同类大尺寸基座模型对比

对比维度Ling-3.0-flash-baseLing-2.5-flash-baseHy3-preview-base
总参数/激活参数124B / 5.1B104B / 7.4B295B / 21B
HumanEval-Plus(Pass@1)81.1080.4979.27
LiveCodeBench(Pass@1)40.0933.0435.90
MMLU-Pro(EM)67.7461.3666.44
MATH500(Acc)79.0074.0060.60
LongBench(Acc)52.6242.8120.58
许可证MIT开源开源

注:以上数据来自HuggingFace官方模型卡的Base Model Evaluation部分,对比模型为Ling-2.5-flash-base(104B/A7.4B)与Hy3-preview-base(295B/A21B)。

从官方数据可以看出,Ling-3.0-flash-base以最少的激活参数(5.1B)拿下知识、数学、代码、长文多数第一:MMLU-Pro、MATH500、LiveCodeBench、LongBench全面领先,LongBench优势超过32个百分点,”少激活、大容量”的稀疏优势非常直接。基座不适合直接部署,对话与智能体能力需用8月7日开源的Ling-3.0-flash推理版,轻量场景可参考站内介绍过的Ling-3.0-tiny

Ling-3.0-flash-base应用场景与适用人群

Ling-3.0-flash-base面向需要在大尺寸基座上完成模型定制的研究与工程场景。

  • 大规模继续预训练:WSM合并版未经历学习率衰减,可注入领域语料
  • 代码方向后训练:多项代码基准领先,适合代码SFT与RL实验
  • 长上下文研究:LongBench、LEval大幅领先,适合长文任务选型
  • MoE系统研究:512路由专家、1/64稀疏度是研究负载均衡的典型样本
  • 蒸馏教师模型:124B容量可作知识蒸馏教师,向小模型输出能力

适用人群:大模型研究者、后训练工程师、开源社区开发者,以及有多卡算力、要在开源基座上做领域定制的团队。

如何使用Ling-3.0-flash-base

权重托管在HuggingFace与ModelScope,微调示例由官方ling-cookbook提供,免费无需申请。

环境准备

  • HuggingFace或ModelScope账号:MIT许可证,无需申请即可下载全部3个checkpoint
  • Python环境:按ling-cookbook要求配置独立环境
  • GPU资源:124B总参需多卡环境
  • ling-cookbook仓库:官方微调与训练示例

快速开始(下载与微调)

  • 下载权重:从HuggingFace的inclusionAI组织页获取Ling-3.0-flash-base,或按阶段选base-30T、midtrain
  • 获取示例代码:克隆ling-cookbook仓库,内含微调与继续预训练示例
  • 选择介入节点:继续预训练用预训练版,后训练用合并版
  • 先小后大:先在tiny-base验证策略,再放大到flash-base
  • 对照推理版评估:用推理版Ling-3.0-flash检验效果

微调示例与完整文档见官方仓库:github.com/inclusionAI/ling-cookbook

Ling-3.0-flash-base开源情况

  • 开源时间:2026年8月20日正式开源,与tiny-base共6个checkpoint
  • 许可证:MIT License,商用与研究均无限制
  • 附带版本:flash系另有fp8/fp4量化版与dspark变体
  • 推理版对照:Ling-3.0-flash推理版8月7日开源,已上线OpenRouter
  • 价格:权重免费,成本仅在算力

Ling-3.0-flash-base和Ling-3.0-flash推理版有什么区别?

flash-base是未经后训练的基座权重,不建议直接对话部署;Ling-3.0-flash是8月7日开源的推理版,具备对话与工具调用能力,可直接部署。

Ling-3.0-flash-base是什么时候开源的?

2026年8月20日。当天蚂蚁百灵把flash-base与tiny-base各3个checkpoint共6个权重一次性开放。

部署Ling-3.0-flash-base需要多少算力?

总参124B、激活5.1B,训练微调需多卡,推理负载低于同总参稠密模型;算力有限可先用tiny-base。

Ling-3.0-flash-base的真实水平如何?

官方模型卡显示其MATH500取得79.00、LongBench 52.62、MMLU-Pro 67.74,多数基准第一,长文与数学最突出。

使用这些权重需要付费或申请吗?

不需要。全部权重MIT许可证公开下载,商用无需授权,成本仅在算力。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章