Ling-3.0-tiny-base – 蚂蚁百灵开源的7.9B轻量MoE基座模型

AI模型10小时前更新 智小研
10 0

Ling-3.0-tiny-base蚂蚁百灵inclusionAI2026年8月20日正式开源的Ling-3.0系列轻量基座模型,总参数7.9B、每token仅激活1.3B,128路由专家稀疏MoE,同步开放预训练、中期训练与WSM合并3个训练节点权重,MIT许可证,适合继续预训练与MoE消融研究等低成本场景。

基础信息内容
产品定位开源语言基座模型(Base Model训练节点权重)
开发团队蚂蚁百灵inclusionAI
开源时间2026年8月20日(6个基座checkpoint同日开源)
模型规模总参数7.9B,激活参数1.3B
架构Hybrid-linear MoE:128路由专家+1共享专家,每token激活8专家
开放权重预训练base-30T、中期base-midtrain、WSM合并base共3个checkpoint
许可证MIT License
Ling-3.0-tiny-base – 蚂蚁百灵开源的7.9B轻量MoE基座模型

Ling-3.0-tiny-base核心能力

三个训练节点权重全开放

此次开源最特殊的地方在于,蚂蚁百灵把tiny尺寸训练过程的关键节点checkpoint全部开放,共3个权重:

  • 预训练检查点base-30T:完成大规模预训练,未经历中期训练、WSM合并与后训练
  • 中期训练检查点base-midtrain:完成中期训练,未做WSM合并与后训练
  • WSM合并检查点base:完成加权检查点合并,即最终基座模型

WSM(Warmup-Stable and Merge)策略用加权检查点合并取代传统学习率衰减,让基座更适合持续预训练与动态数据扩展,技术细节见arXiv:2507.17634。

高度稀疏MoE与原生混合线性注意力

Ling-3.0-tiny-base采用高度稀疏的混合专家架构:128个路由专家与1个共享专家,每个token仅激活8个路由专家,总参数7.9B但激活参数只有1.3B。同时在预训练一开始就原生采用KDA与Gated MLA结合的混合线性注意力以兼顾长上下文效率,这与站内介绍过的推理版Ling-3.0-tiny一脉相承。

开发时间线:从推理版到基座权重

按官方发布信息,Ling-3.0系列在2026年7月至8月的开源节奏如下:

  • 2026年7月24日:Ling-3.0-flash推理版(124B/A5.1B)正式发布
  • 2026年8月7日:Ling-3.0-flash推理版权重开源,fp8、fp4量化版随后推出
  • 2026年8月11日:Ling-3.0-tiny推理版及量化版权重开源
  • 2026年8月20日:蚂蚁百灵正式开源tiny-base与flash-base,6个基座checkpoint全部开放

尺寸无缝扩展的实验路径

Ling-3.0-tiny-base与同日开源的Ling-3.0-flash-base共享同一套训练配方,可以先在7.9B的tiny上低成本验证策略,再扩展到124B的flash。

Ling-3.0-tiny-base与同类轻量基座模型对比

对比维度Ling-3.0-tiny-baseLing-2.5-mini-baseQwen3.5-9B-base
总参数/激活参数7.9B / 1.3B16B / 1.4B9B(稠密)
HumanEval-Plus(Pass@1)79.2776.2252.44
LiveCodeBench(Pass@1)24.2322.9118.06
BigCodeBench(Pass@1)42.8942.5429.39
MATH500(Acc)65.6068.4055.20
许可证MIT开源开源

注:以上数据来自HuggingFace官方模型卡的Base Model Evaluation部分,对比模型为Ling-2.5-mini-base(16B/A1.4B)与Qwen3.5-9B-base。

从官方数据可以看出,Ling-3.0-tiny-base的代码能力是最突出的长板:HumanEval-Plus、LiveCodeBench、BigCodeBench等代码基准全部领先,HumanEval-Plus对Qwen3.5-9B-base优势接近27个百分点;知识与数学基准上互有胜负。官方明确基座不适合直接部署,正式对话与智能体能力需用后训练完成的Ling-3.0-tiny推理版,这与蚂蚁百灵开源Ling-2.6-1TLing-2.6-flash的基座先行策略一致。

Ling-3.0-tiny-base应用场景与适用人群

Ling-3.0-tiny-base面向需要自己完成模型定制、又要控制算力成本的研究与工程场景。

  • 代码方向后训练研究:多项代码基准领先,适合代码SFT与RL后训练实验
  • 继续预训练:WSM合并版未经历学习率衰减,可直接注入领域语料持续预训练
  • MoE消融实验:128路由专家的小规模让路由与负载均衡实验成本可控
  • 蒸馏研究:官方推荐用途,可结合Ling系列大模型开展知识蒸馏

适用人群:主要是大模型研究者、后训练工程师、开源社区开发者,以及算力有限、希望在Ling-3.0体系内验证训练策略的高校与小团队。

如何使用Ling-3.0-tiny-base

权重托管在HuggingFace与ModelScope,微调示例由官方ling-cookbook仓库提供,免费无需申请。

环境准备

  • HuggingFace或ModelScope账号:MIT许可证,无需申请即可下载全部3个checkpoint
  • Python环境:按ling-cookbook要求配置独立环境
  • GPU资源:7.9B总参可单卡加载,量化版显存更低
  • ling-cookbook仓库:官方微调与训练示例代码

快速开始(下载与微调)

  • 下载权重:从HuggingFace的inclusionAI组织页获取Ling-3.0-tiny-base,或按阶段选base-30T、base-midtrain
  • 获取示例代码:克隆ling-cookbook仓库,内含微调与继续预训练示例
  • 选择介入节点:继续预训练用预训练版,后训练用WSM合并版
  • 小规模验证:先在tiny-base上验证策略,再扩展到124B的Ling-3.0-flash-base
  • 对照推理版评估:用推理版Ling-3.0-tiny检验自训模型效果

微调示例与完整文档见官方仓库:github.com/inclusionAI/ling-cookbook

Ling-3.0-tiny-base开源情况

  • 开源时间:2026年8月20日正式开源,与flash-base共6个checkpoint
  • 许可证:MIT License,商用与研究均无限制
  • 推理版对照:Ling-3.0-tiny推理版权重已于8月11日开源,并上线OpenRouter
  • 价格:权重免费,成本仅在训练与部署算力

Ling-3.0-tiny-base和Ling-3.0-tiny推理版有什么区别?

tiny-base是未经后训练的基座权重,不建议直接对话部署;Ling-3.0-tiny是8月11日开源的推理版本,具备对话与工具调用能力,可直接部署。

Ling-3.0-tiny-base是什么时候开源的?

2026年8月20日。当天蚂蚁百灵把tiny-base与flash-base各3个训练节点checkpoint共6个权重一次性开放,托管在HuggingFace与ModelScope。

为什么同时开源3个checkpoint?

预训练、中期训练、WSM合并三个节点对应不同研究介入点,多节点开放便于对比介入效果,也支持MoE消融与蒸馏研究。

Ling-3.0-tiny-base的代码能力真实水平如何?

官方模型卡显示其HumanEval-Plus取得79.27 Pass@1,领先Ling-2.5-mini-base与Qwen3.5-9B-base,代码是基座最突出的能力方向。

使用这些权重需要付费或申请吗?

不需要。全部权重采用MIT许可证公开下载,商用无需授权,成本仅在算力。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章