Ling-3.1-flash – 蚂蚁百灵推出的长上下文通用大模型

AI模型2天前更新 老高
22 0

Ling-3.1-flash是一款由蚂蚁百灵于2026年9月推出的长上下文通用大模型,主要用于通用智能体、搜索与日常办公等真实工作任务,支持约 100 万 tokens 的上下文上限与稀疏激活架构,适用于软件研发、长文档处理与专业领域分析等方向。

基础信息内容
产品定位长上下文通用与智能体模型
出品方蚂蚁百灵(InclusionAI)
发布时间2026年9月30日
参数规模约 560B 总参数,激活约 25B
上下文窗口上限 100 万 tokens
体验期长度256K,免费两周
知识工作评测GDPval-AA v2.1 得 1,673 Elo
软件工程评测FrontierSWE 75.16
医疗专业评测HealthBench Professional 65.35
开源情况转付费后计划开源权重
Ling-3.1-flash – 蚂蚁百灵推出的长上下文通用大模型

Ling-3.1-flash 的核心能力

蚂蚁百灵把 Ling-3.1-flash 定位为面向真实任务的通用模型,优化方向集中在通用智能体、搜索、日常办公与软件研发四类工作流,并在医疗、金融与材料科学研究等场景持续迭代。对需要把长文档、代码仓库与多轮任务记录一并交给模型的场景而言,上下文长度与激活参数规模共同决定了它能否进入 AI模型 的选型清单。

约 560B 总参数与约 25B 激活参数

Ling-3.1-flash 采用稀疏激活设计:总参数约 560B,生成每个 token 时约有 25B 参数参与计算。这一组合的含义是模型容量与单步推理成本分离——参数总量决定可容纳的知识与专家容量,激活量更接近单步实际动用的算力量。对部署方而言,前者影响能力上限,后者影响吞吐与成本,两者不能互相换算。

上下文上限 100 万 tokens 与体验期 256K 的差别

模型标称的上下文窗口上限为 100 万 tokens,可容纳更长的文档、代码与任务历史。但这一上限并非即刻可用:自发布之日起两周的免费体验期内,服务长度限制为 256K;免费体验期结束、转为付费服务后,团队才计划开放 1M 上下文。也就是说,当前可验证的是 256K 档位的长文档与代码片段处理能力,百万级窗口的实际开销与效果仍需等待付费阶段验证。

面向通用智能体、搜索与日常办公

官方说明中提到,研发过程中围绕通用智能体、搜索、日常办公与软件研发等任务做了持续优化。这类优化体现为多步骤任务的执行稳定性:模型需要在检索、汇总、写入与复核之间切换,并对中间结果做取舍,而不是停留在单轮问答。对办公自动化流程而言,能否在长链路中保持任务目标一致,比单点能力更能决定可用性。

医疗、金融与材料科学的专业场景

在通用能力之外,Ling-3.1-flash 在医疗、金融与材料科学研究等场景持续提升模型能力。专业场景的价值来自长上下文与专业语料的结合:把研究报告、检查数据与历史记录一并纳入上下文后,模型可以减少跨文档拼接造成的遗漏。这类输出仍属于初稿性质,涉及专业结论的部分需要由专业人员复核。

多步骤任务中的工具调用与结果收敛

通用智能体任务的难点在于多轮调用后的结果收敛。Ling-3.1-flash 面向搜索、办公与工程任务做优化,意味着它需要在一次会话中反复调用检索、计算与写入类工具,并在上下文内维护中间状态。对构建智能体产品的团队而言,上下文窗口与工具调用稳定性的组合,决定了单条链路可以延伸多长。

Ling-3.1-flash 与同类通用大模型的对比

对比维度Ling-3.1-flashKimi K3Claude Opus 5
开发方蚂蚁百灵月之暗面Anthropic
模型定位通用智能体与长上下文模型智能体与超长上下文模型高性能旗舰模型
参数规模约 560B 总参数,激活约 25B2.8T(开放权重)官方未公布
权重开放转付费后计划开源开放权重闭源
高级软件工程(FrontierSWE)75.1681.2官方未公布
知识工作(GDPval-AA)v2.1 得 1,673 Elo官方未公布v2 得 1,861
医疗任务(HealthBench)65.35官方未公布59.8%

上表 Ling-3.1-flash 与 Kimi K3 两列取自各自官方发布材料,Claude Opus 5 一列取自 Anthropic 官方发布材料。三款产品的定位接近,差异集中在权重开放节奏与专业评测覆盖:Ling-3.1-flash 与 Kimi K3 都计划或已经开放权重,Claude Opus 5 保持闭源;在公开的高级软件工程评测上,Kimi K3 的 FrontierSWE 成绩为 81.2,高于 Ling-3.1-flash 的 75.16;知识工作与医疗任务两项上,Ling-3.1-flash 的 GDPval-AA v2.1 得分为 1,673,低于 Claude Opus 5 的 1,861,HealthBench Professional 则为 65.35,高于后者的 59.8%。另据 Design Arena 榜单,Ling-3.1-flash 以 1,207 Elo 位列总榜第 17。

如果需要先了解该系列的开源基座,可以参考 Ling-3.0-flash-base(蚂蚁百灵 2026 年 8 月开源的 124B 稀疏 MoE 语言基座模型,采用 MIT 许可证,适合本地部署与二次训练)。

Ling-3.1-flash 的应用场景与适用人群

该模型面向需要一次性处理大量上下文的多步骤任务,常见场景包括:

  • 长文档与代码库分析:把仓库片段与需求文档一并纳入上下文,做跨文件的依赖梳理与改动评估。
  • 通用智能体任务:在检索、汇总、写入与复核之间连续切换,完成端到端的办公自动化流程。
  • 专业领域辅助:在医疗、金融与材料科学场景中做资料整理与初稿生成,结论交由专业人员复核。
  • 搜索与信息整合:把多来源资料压缩为结构化结论,减少人工拼接与转述成本。

适用人群:需要处理超长上下文的研发团队、构建通用智能体产品的工程团队,以及把专业资料整理前置到模型侧的机构。由于百万级上下文与权重开放均排在付费阶段之后,当前阶段更适合先验证 256K 档位下的效果。

Ling-3.1-flash 的使用方法

Ling-3.1-flash 目前以官方在线体验为主,按以下顺序接入:

  1. 进入官方体验入口:在 Ling-3.1-flash 官方体验页 中选择该模型并确认当前服务长度。
  2. 控制输入规模:免费体验期内单次上下文限制为 256K,长文档需要先做分段或摘要压缩。
  3. 验证任务链路:先用检索与汇总类任务测试多步骤执行的稳定性,再扩展到代码与专业场景。
  4. 跟踪开放节奏:付费阶段开放 1M 上下文与模型权重后,再评估自部署与长窗口任务的可行性。
  5. 保留人工复核:涉及专业结论与对外输出的环节,保留人工确认点后再落地。

接入初期建议用真实业务文档验证长上下文下的检索准确性,再决定是否扩大调用规模。

Ling-3.1-flash 的价格与开源情况

Ling-3.1-flash 自发布之日起提供为期两周的免费体验,体验期内模型服务长度为 256K;免费体验期结束并转为付费服务后,计划开放 1M 上下文。官方表示具体定价与计费方式随付费服务上线时公布,目前尚未给出价格数字。对以长上下文为核心的应用,输入规模与计费方式的组合比单价本身更影响实际支出。

Ling-3.1-flash 的模型权重尚未开放。团队表示将在免费体验期结束、转为付费服务后计划同步开源,并继续更新模型性能。在权重开放前,使用方式以官方在线服务与后续接口为主,自托管部署暂不可行。

Ling-3.1-flash 的常见问题

Ling-3.1-flash 的上下文窗口有多大?

模型标称的上下文窗口上限为 100 万 tokens;免费体验期内服务长度限制为 256K,免费体验期结束并转为付费服务后,团队计划开放 1M 上下文。

Ling-3.1-flash 会开源吗?

官方表示将在免费体验期结束、转为付费服务后计划同步开放模型权重,并继续更新模型性能。截至目前权重尚未开放,使用方式以官方在线服务为主。

Ling-3.1-flash 与 Ling-3.0-flash 是什么关系?

Ling-3.1-flash 属于 Ling 系列的新一代通用模型,参数规模由上一代的 124B 总参数、5.1B 激活参数提升到约 560B 总参数、约 25B 激活参数,上下文上限提升至 1M tokens,并新增医疗、金融与材料科学等专业场景的能力优化。

© 版权声明

相关文章