Beam – Reflection AI推出的501B开放权重编码与推理模型

AI模型10小时前更新 老高
8 0

Beam是一款由Reflection AI于2026年10月推出的501B 开放权重编码与推理模型,主要用于编码、推理与智能体任务,支持稀疏混合专家架构与高推理效率,适用于代码生成、终端自动化与智能体工具调用等方向。

基础信息内容
产品定位501B 开放权重编码与推理模型
出品方Reflection AI
发布时间2026年10月5日
模型架构稀疏 MoE(专家混合)
总参数量5010 亿总参数,激活 230 亿
预训练数据23.8 万亿 tokens
强化学习规模1 亿次 rollout,4 周训练
权重发布尚未开放,本月稍后发布
使用方式官网申请早期访问
Beam – Reflection AI推出的501B开放权重编码与推理模型

Beam 的核心能力

Beam 是 Reflection AI 的首款开放权重模型,设计重心落在编码、推理与智能体三类工作负载上。它采用稀疏混合专家(MoE)结构,以 5010 亿总参数承载知识,每次前向计算仅激活其中 230 亿参数,用以在维持能力的同时压低推理阶段的算力占用。以下从架构效率、编码与终端任务、推理与 STEM、智能体与工具调用、训练规模五个方面展开。

稀疏 MoE 架构与训练规模

Beam 的总参数为 5010 亿,单次前向计算激活 230 亿,官方称这一稀疏比例让它在高级推理基准上的表现与 GLM-5.2 相当,而推理所需算力约为对方的三分之一至四分之一。模型预训练使用 23.8 万亿 tokens,来源包括公开网页与经授权的高质量数据集;强化学习阶段在 10500 块 NVIDIA GB300 GPU 上完成超过 1 亿次 rollout,训练周期 4 周。对部署方而言,同等能力下的算力占用直接决定单位请求成本与并发上限,这也是该模型把稀疏结构作为设计核心的原因。

编码与终端任务表现

官方公布的数据中,Beam 在 SWEBench Verified 得 80.9 分、SWE Bench Pro v2-Hard 得 77.2 分、SWEBench Multilingual 得 78.0 分,Terminal Bench v2.1 得 80.1 分。这组结果覆盖真实仓库修错、硬难度补丁与终端命令执行三类任务,反映的是模型在多文件代码库中定位与改动代码的能力,而不仅是单函数补全。对以自动化方式跑持续集成、批量修复缺陷的团队,终端任务的稳定性通常比单点分数更关键。

推理与 STEM 基准

在推理类基准上,Beam 取得 AIME 2026 97.8 分、GPQA Diamond 90.5 分、HLE(无工具)36.2 分、SciCode 49.7 分。AIME 与 GPQA 分别对应竞赛数学与研究生级科学问答,SciCode 则以实际科研代码编写为评测内容。官方给出的结论是,Beam 在高级推理任务上可以用更少的推理算力达到与更大规模开放权重模型接近的水平,这也是它区别于同参数量级模型的定位。

智能体与工具调用

Beam 在 MCP Atlas 得 78.7 分、AutomationBench public 得 37.0 分、tau3 banking 得 38.0 分、BrowseComp(含上下文管理)得 77.4 分、DeepSearchQA(含上下文管理)得 80.1 分。这组评测覆盖工具调用、多步任务编排与检索式问答,对应开放权重模型在 AI 智能体 场景中的落地能力。模型以编码与智能体任务为主攻方向,因此在需要调用外部接口、读写文件或串联多步操作的流程中,其表现更能反映实际可用度。

Beam 与同类开放权重模型的对比

Beam 发布时给出了一组覆盖编码、推理、智能体与通用能力的评测数据,并直接列出了若干同规模开放权重模型作为参照。下表选取其中四项均有公开得分的模型,数值全部取自 Reflection AI 官方发布材料。

对比维度BeamGLM 5.3Kimi K3Qwen 3.8-MaxNemotron 3 Ultra
Terminal Bench v2.180.188.288.386.656.4
GPQA Diamond90.591.793.592.687
HLE(无工具)36.242.346.943.626.7
AA-LCR79.379.788.780.379.3
MCP Atlas78.784.282.384.563.1
SciCode49.759.058.752.144.6

从上表看,Beam 在 GPQA Diamond 与 AA-LCR 两项上接近 GLM 5.3 与 Qwen 3.8-Max,在 SciCode 与 MCP Atlas 上与后两者存在差距,Terminal Bench v2.1 的 80.1 分低于 GLM 5.3 的 88.2 与 Kimi K3 的 88.3。官方对此的表述是:Beam 推进了开放权重的编码与智能体能力边界,在编码与智能体任务上可与规模更大的 GLM-5.2 相比,并逐步接近 Qwen 3.8-Max;在原始能力上 Kimi K3 仍然领先,而 Beam 的优势在于推理阶段的效率。因此这组数值更适合与效率结论结合起来看:如果部署方更在意单位算力承载的请求量,Beam 的稀疏结构值得纳入评估;如果任务本身对极限分数敏感,则应同时比较表中得分更高的对象。上表 Beam 一列取自 Reflection AI 官方发布材料,其余各列同为其官方材料中列出的数值。

若需要先了解同方向上的开源编程与智能体模型,可参考 GLM-5.2(智谱推出的开源编程与智能体开发大模型,也是本次官方材料中作为主要参照的对象)。

Beam 的应用场景与适用人群

Beam 面向的是需要把编码与多步任务交给模型自动执行、同时又要求推理成本可控的场景。常见场景包括:

  • 自动化代码维护:在大型仓库中批量定位缺陷、生成补丁并执行测试,用于持续集成环节的例行修复与依赖升级。
  • 终端与运维脚本编写:根据自然语言描述生成可直接执行的命令与脚本,并在执行结果异常时进行调整,减少人工逐条排查的工作量。
  • 智能体任务编排:通过工具调用串联检索、数据查询与写入操作,支撑研究报告生成、工单处理与内部流程自动化等需要多步执行的任务。

适用人群:需要自行部署与审计模型的工程团队、对推理成本敏感的规模化应用方,以及希望基于开放权重做二次训练与领域适配的研究与开发人员。对于只需通用对话、且不涉及代码与外部工具调用的使用者,采用已开放权重、即开即用的同类模型会更省事。

Beam 的使用方法

Beam 目前尚未开放权重与公开 API,官方给出的获取路径是先申请早期访问。具体流程可概括为三步:

  1. 提交申请:访问 Beam 官方页面,填写早期访问登记表,说明使用场景与规模需求。
  2. 等待权重发布:官方表示权重、技术报告、模型卡与开发者资源将在本月晚些时候一并释出,发布后可按官方文档自行部署,或通过其 API 平台调用。
  3. 按能力配置环境:该模型为 230 亿激活参数的稀疏 MoE 结构,部署时的显存与并行配置需以官方后续公布的要求为准,正式投入前建议先用自有样本做回归测试。

Beam 的价格与开源情况

Reflection AI 尚未公布 Beam 的正式定价,当前阶段也不提供自助付费入口。官方目前仅开放早期访问申请,权重、技术报告与开发者资源计划在本月晚些时候发布,届时才会明确 API 调用与自建部署的成本结构。对预算敏感的团队,建议在官方定价公布后再评估规模化使用的可行性。

Beam 是 Reflection AI 的首款开放权重模型,采用稀疏混合专家架构,面向可检查、可微调与可自主部署的使用方式。需要注意的是,截至发布时官方尚未释出权重文件,模型仍在进行最终的红队测试与评估,因此「开放权重」目前指其既定路线,而非已可下载的现状。官方同时表示会一并发布模型卡与开发者资源,以便使用方在部署前核对许可证条款与使用边界。

Beam 的常见问题

Beam 是开源模型吗?

Beam 采用开放权重路线,但截至发布时权重文件尚未释出。Reflection AI 表示模型正在进行最终的红队测试与评估,权重、技术报告、模型卡与开发者资源计划在本月晚些时候一并发布。

Beam 现在可以直接使用吗?

暂时不能。官方尚未开放权重下载与公开 API,使用方需先在 Reflection AI 官网提交早期访问申请,待权重发布后再按官方文档自行部署或通过其 API 平台调用。

Beam 相比同规模开放权重模型的优势是什么?

官方给出的答案是推理效率。Reflection AI 称 Beam 在高级推理基准上的表现可与 GLM-5.2 相比,而推理所需算力约为其三分之一至四分之一;在原始能力上,Kimi K3 等前沿开放权重模型仍然领先。因此其定位是以更低的推理开销提供接近的编码与智能体能力。

© 版权声明

相关文章