Ling-3.1-flash是一款由蚂蚁百灵于2026年9月推出的长上下文通用大模型,主要用于通用智能体、搜索与日常办公等真实工作任务,支持约 100 万 tokens 的上下文上限与稀疏激活架构,适用于软件研发、长文档处理与专业领域分析等方向。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 长上下文通用与智能体模型 |
| 出品方 | 蚂蚁百灵(InclusionAI) |
| 发布时间 | 2026年9月30日 |
| 参数规模 | 约 560B 总参数,激活约 25B |
| 上下文窗口 | 上限 100 万 tokens |
| 体验期长度 | 256K,免费两周 |
| 知识工作评测 | GDPval-AA v2.1 得 1,673 Elo |
| 软件工程评测 | FrontierSWE 75.16 |
| 医疗专业评测 | HealthBench Professional 65.35 |
| 开源情况 | 转付费后计划开源权重 |

Ling-3.1-flash 的核心能力
蚂蚁百灵把 Ling-3.1-flash 定位为面向真实任务的通用模型,优化方向集中在通用智能体、搜索、日常办公与软件研发四类工作流,并在医疗、金融与材料科学研究等场景持续迭代。对需要把长文档、代码仓库与多轮任务记录一并交给模型的场景而言,上下文长度与激活参数规模共同决定了它能否进入 AI模型 的选型清单。
约 560B 总参数与约 25B 激活参数
Ling-3.1-flash 采用稀疏激活设计:总参数约 560B,生成每个 token 时约有 25B 参数参与计算。这一组合的含义是模型容量与单步推理成本分离——参数总量决定可容纳的知识与专家容量,激活量更接近单步实际动用的算力量。对部署方而言,前者影响能力上限,后者影响吞吐与成本,两者不能互相换算。
上下文上限 100 万 tokens 与体验期 256K 的差别
模型标称的上下文窗口上限为 100 万 tokens,可容纳更长的文档、代码与任务历史。但这一上限并非即刻可用:自发布之日起两周的免费体验期内,服务长度限制为 256K;免费体验期结束、转为付费服务后,团队才计划开放 1M 上下文。也就是说,当前可验证的是 256K 档位的长文档与代码片段处理能力,百万级窗口的实际开销与效果仍需等待付费阶段验证。
面向通用智能体、搜索与日常办公
官方说明中提到,研发过程中围绕通用智能体、搜索、日常办公与软件研发等任务做了持续优化。这类优化体现为多步骤任务的执行稳定性:模型需要在检索、汇总、写入与复核之间切换,并对中间结果做取舍,而不是停留在单轮问答。对办公自动化流程而言,能否在长链路中保持任务目标一致,比单点能力更能决定可用性。
医疗、金融与材料科学的专业场景
在通用能力之外,Ling-3.1-flash 在医疗、金融与材料科学研究等场景持续提升模型能力。专业场景的价值来自长上下文与专业语料的结合:把研究报告、检查数据与历史记录一并纳入上下文后,模型可以减少跨文档拼接造成的遗漏。这类输出仍属于初稿性质,涉及专业结论的部分需要由专业人员复核。
多步骤任务中的工具调用与结果收敛
通用智能体任务的难点在于多轮调用后的结果收敛。Ling-3.1-flash 面向搜索、办公与工程任务做优化,意味着它需要在一次会话中反复调用检索、计算与写入类工具,并在上下文内维护中间状态。对构建智能体产品的团队而言,上下文窗口与工具调用稳定性的组合,决定了单条链路可以延伸多长。
Ling-3.1-flash 与同类通用大模型的对比
| 对比维度 | Ling-3.1-flash | Kimi K3 | Claude Opus 5 |
|---|---|---|---|
| 开发方 | 蚂蚁百灵 | 月之暗面 | Anthropic |
| 模型定位 | 通用智能体与长上下文模型 | 智能体与超长上下文模型 | 高性能旗舰模型 |
| 参数规模 | 约 560B 总参数,激活约 25B | 2.8T(开放权重) | 官方未公布 |
| 权重开放 | 转付费后计划开源 | 开放权重 | 闭源 |
| 高级软件工程(FrontierSWE) | 75.16 | 81.2 | 官方未公布 |
| 知识工作(GDPval-AA) | v2.1 得 1,673 Elo | 官方未公布 | v2 得 1,861 |
| 医疗任务(HealthBench) | 65.35 | 官方未公布 | 59.8% |
上表 Ling-3.1-flash 与 Kimi K3 两列取自各自官方发布材料,Claude Opus 5 一列取自 Anthropic 官方发布材料。三款产品的定位接近,差异集中在权重开放节奏与专业评测覆盖:Ling-3.1-flash 与 Kimi K3 都计划或已经开放权重,Claude Opus 5 保持闭源;在公开的高级软件工程评测上,Kimi K3 的 FrontierSWE 成绩为 81.2,高于 Ling-3.1-flash 的 75.16;知识工作与医疗任务两项上,Ling-3.1-flash 的 GDPval-AA v2.1 得分为 1,673,低于 Claude Opus 5 的 1,861,HealthBench Professional 则为 65.35,高于后者的 59.8%。另据 Design Arena 榜单,Ling-3.1-flash 以 1,207 Elo 位列总榜第 17。
如果需要先了解该系列的开源基座,可以参考 Ling-3.0-flash-base(蚂蚁百灵 2026 年 8 月开源的 124B 稀疏 MoE 语言基座模型,采用 MIT 许可证,适合本地部署与二次训练)。
Ling-3.1-flash 的应用场景与适用人群
该模型面向需要一次性处理大量上下文的多步骤任务,常见场景包括:
- 长文档与代码库分析:把仓库片段与需求文档一并纳入上下文,做跨文件的依赖梳理与改动评估。
- 通用智能体任务:在检索、汇总、写入与复核之间连续切换,完成端到端的办公自动化流程。
- 专业领域辅助:在医疗、金融与材料科学场景中做资料整理与初稿生成,结论交由专业人员复核。
- 搜索与信息整合:把多来源资料压缩为结构化结论,减少人工拼接与转述成本。
适用人群:需要处理超长上下文的研发团队、构建通用智能体产品的工程团队,以及把专业资料整理前置到模型侧的机构。由于百万级上下文与权重开放均排在付费阶段之后,当前阶段更适合先验证 256K 档位下的效果。
Ling-3.1-flash 的使用方法
Ling-3.1-flash 目前以官方在线体验为主,按以下顺序接入:
- 进入官方体验入口:在 Ling-3.1-flash 官方体验页 中选择该模型并确认当前服务长度。
- 控制输入规模:免费体验期内单次上下文限制为 256K,长文档需要先做分段或摘要压缩。
- 验证任务链路:先用检索与汇总类任务测试多步骤执行的稳定性,再扩展到代码与专业场景。
- 跟踪开放节奏:付费阶段开放 1M 上下文与模型权重后,再评估自部署与长窗口任务的可行性。
- 保留人工复核:涉及专业结论与对外输出的环节,保留人工确认点后再落地。
接入初期建议用真实业务文档验证长上下文下的检索准确性,再决定是否扩大调用规模。
Ling-3.1-flash 的价格与开源情况
Ling-3.1-flash 自发布之日起提供为期两周的免费体验,体验期内模型服务长度为 256K;免费体验期结束并转为付费服务后,计划开放 1M 上下文。官方表示具体定价与计费方式随付费服务上线时公布,目前尚未给出价格数字。对以长上下文为核心的应用,输入规模与计费方式的组合比单价本身更影响实际支出。
Ling-3.1-flash 的模型权重尚未开放。团队表示将在免费体验期结束、转为付费服务后计划同步开源,并继续更新模型性能。在权重开放前,使用方式以官方在线服务与后续接口为主,自托管部署暂不可行。
Ling-3.1-flash 的常见问题
Ling-3.1-flash 的上下文窗口有多大?
模型标称的上下文窗口上限为 100 万 tokens;免费体验期内服务长度限制为 256K,免费体验期结束并转为付费服务后,团队计划开放 1M 上下文。
Ling-3.1-flash 会开源吗?
官方表示将在免费体验期结束、转为付费服务后计划同步开放模型权重,并继续更新模型性能。截至目前权重尚未开放,使用方式以官方在线服务为主。
Ling-3.1-flash 与 Ling-3.0-flash 是什么关系?
Ling-3.1-flash 属于 Ling 系列的新一代通用模型,参数规模由上一代的 124B 总参数、5.1B 激活参数提升到约 560B 总参数、约 25B 激活参数,上下文上限提升至 1M tokens,并新增医疗、金融与材料科学等专业场景的能力优化。
浙公网安备33010202004812号