Muse Spark 1.3 – Meta推出的长周期智能体与编程旗舰模型

AI模型4天前更新 智小研
27 0

Muse Spark 1.3是一款由 Meta 超级智能实验室推出的长周期智能体与编程旗舰大模型,主要用于单条长线程内的多工作流协同与编码任务,支持在指令含糊时主动提出澄清问题、执行关键操作前先向用户确认,适用于需要长时间无人值守运行的智能体开发与团队级编码场景。

模型名称Muse Spark 1.3(API 模型名 muse-spark-1.3)
开发方Meta 超级智能实验室(Meta Superintelligence Labs)
发布时间2026年9月2日
核心能力长周期智能体任务、多工作流协同、编码与终端操作
上下文长度1,048,576 token 输入,最大输出 131,072 token
多模态输入文本、图像、MP4 视频、PDF;本次不支持音频输入
API 定价标准层输入 1.25 美元、输出 4.25 美元每百万 token;贡献者层 0.10 / 0.20 美元
开放程度闭源闭权重,仅通过 Muse Code 与 Meta Model API 提供
Muse Spark 1.3 – Meta推出的长周期智能体与编程旗舰模型

Muse Spark 1.3 核心能力

同样的任务,少两成工具调用

1.3 最直观的变化是干活更省:工具调用比 1.2 减 20%、token 用量减 25%,回复也更短。由于推理按输出计费,token 少 25% 等于账单变薄、而官方并未降价。对照起点可参考初代 Muse Spark:2026 年 4 月首款多模态多智能体推理模型,最初仅 meta.ai 可体验,数月后开放 API,如今已迭代到 1.3。

长上下文从够用到真能用

长上下文检索是跨度最大的一项。MRCR 测试中,1.3 在 256K-512K 区间拿 98.5 分(第二名 91.5),512K-1M 区间仍 98.1 分(第二名 73.8,1.2 该区间仅 55.5)。该指标决定智能体能否扛住长任务——任务越长,要记住的越多。

编码与终端操作进入头部区间

在 Meta 基准表中,1.3 于 DeepSWE v1.1 长程编码拿 75.4 分(同表 74.0、73.0);Terminal-Bench 2.1 为 88.8 分,与 GPT-5.6 Sol 持平;JobBench 64.9、OSWorld 2.0 66.9,均高于 GPT-5.6 Sol,但 GDPVal-AA v2、DeepSearchQA 仍落后 Claude Opus 5。它是编码进头部、通用智能体有短板的偏科旗舰。同日 Gemini 3.8 在自有口径 DeepSWE-1.1 上为 73.7%,属同一梯队。

更像同事,而不是只会闷头跑

行为层面三点对长任务最关键:指令含糊先问清而非硬猜;卡住主动求助;强推分支、删库等不可逆操作前先确认。官方称其对提示注入抵抗更强、对自身能力边界判断更准、幻觉更少。这些改动不体现在榜单上,却决定你能不能把仓库权限放心交给它过夜。

Muse Spark 1.3 与同档模型对比

对比维度Muse Spark 1.3Claude Fable 5.1Qwen 3.8-Max
开发方Meta 超级智能实验室Anthropic阿里巴巴通义千问团队
发布时间2026年9月2日2026年9月1日2026年8月3日
核心定位长周期智能体与编码旗舰通用旗舰,偏智能体编程与科研千问旗舰智能体,覆盖编程与办公
上下文长度1,048,576 token官方未标注100 万 token
多模态输入文本、图像、MP4 视频、PDF文本与图像文本、图像,增强视频
终端编码基准Terminal-Bench 2.1 88.8 分Terminal-Bench 4.0 55.8 分(版本不同)Terminal-Bench 2.1 86.6 分
长上下文检索MRCR 512K-1M 98.1 分未公布同口径数据未公布同口径数据
开源程度闭源,开放权重版待发布闭源,仅 API 与云平台Max 系列首开权重
API 定价输入 1.25、输出 4.25 美元每百万 token输入 10、输出 50 美元每百万 token按阿里云渠道计费

注:Muse Spark 1.3 数据来自 Meta 官方基准表(AIBase、cnBeta 转述),另两款取自各自官方发布资料;Terminal-Bench 版本不同(2.1 与 4.0),分数不直接可比。

取舍:1.3 用 1.25 美元输入价把长上下文检索与终端编码推到头部,代价是通用智能体基准仍落后 Claude Opus 5;Claude Fable 5.1 输入价是它八倍,卖点在智能体编程与科研;Qwen 3.8-Max 计划开放 Max 级权重,适合自主可控与中文场景。跑长周期任务又在意 token 账单者,1.3 的效率改进比榜单名次更值钱。

Muse Spark 1.3 的应用场景与适用人群

以下场景具备直接价值:

  • 长周期智能体开发:同一条长线程并行推进多个工作流,中途可改需求、插新问题,适合跨小时甚至跨天的任务。
  • 仓库级编码:结合 Muse Code 完成跨文件重构与测试修复,工具调用减少约 20% 后等待明显变短。
  • 长文档处理:100 万 token 上下文配合 98.1 分检索,适合合同比对、论文综述与代码库全景理解。

适用人群:Muse Spark 1.3 主要面向需长时间运行智能体的开发者、以编码为主的工程团队,以及预算敏感但任务量大的中小团队。个人可先用贡献者层验证;若核心诉求是通用对话与知识问答,更均衡的通用旗舰更划算,长上下文场景也可对照 Kimi K3 这类开源方案。

如何使用 Muse Spark 1.3

模型已上线 Muse Code 与 Meta Model API,按身份选入口:

  • 开发者接入:在 Muse Spark 1.3 官网开发者平台 申请 Meta Model API 密钥,接口兼容 OpenAI SDK,替换 base_url 与模型名即可迁移。
  • 终端编码:安装 Muse Code(Meta 终端编码智能体),1.3 发布当天即成为其默认模型,命令行用自然语言下达仓库级任务。
  • 成本敏感团队:选用 contributor 档位(输入 0.10 美元、输出 0.20 美元每百万 token),代价是允许 Meta 用你的数据改进产品。
  • 普通用户:等待集成到 Instagram、Facebook 与 Meta AI 助手,无需写代码即可体验。

调用时建议显式设 reasoning_effortmax_tokens:推理始终开启且计入输出额度,max 档需官方完成额外安全测试后开放。

Muse Spark 1.3 的价格与开源情况

标准层每百万 token 输入 1.25 美元、缓存命中 0.15 美元、输出 4.25 美元;贡献者层输入 0.10 美元、输出 0.20 美元,低一个数量级,条件是允许 Meta 用你的数据改进产品,涉及敏感代码的团队不应选它。内置网页搜索每查询 0.00825 美元单独计费。开源方面,它是闭源闭权重模型,只能通过 Muse Code 与 Meta Model API 调用;扎克伯格称开放权重版本已在路线图,但未给时间。标准层提示与输出不用于训练,可纳入生产链路;真正要留意的是贡献者层的数据授权条款。

关于 Muse Spark 1.3 的常见问题

Muse Spark 1.3 和 1.2 相比提升了什么?

Meta 实测:同类任务工具调用减少约 20%、token 用量减少约 25%,回复更简短;长上下文检索 MRCR 512K-1M 从 55.5 分升至 98.1 分,价格与上下文长度不变。

多少钱?有便宜的档位吗?

标准层输入 1.25 美元、缓存命中 0.15 美元、输出 4.25 美元每百万 token;贡献者层输入 0.10 美元、输出 0.20 美元,但需允许 Meta 用你的数据改进产品,敏感代码请谨慎。

开源吗?能自己部署吗?

不开源。Muse Spark 1.3 是闭源闭权重模型,只能通过 Muse Code 与 Meta Model API 调用;官方称开放权重版本已在规划,但未公布时间与型号。

和普通大模型相比,它适合干什么?

它专为长周期智能体任务与编码优化:支持 100 万 token 上下文,DeepSWE v1.1 与 Terminal-Bench 2.1 进入头部区间,指令含糊时主动澄清、不可逆操作前请求确认,适合长时间无人值守任务。

推理可以关掉吗?max 档什么时候能用?

推理始终开启且无法关闭,推理 token 计入输出并按输出价计费,可用 reasoning_effort 在 minimal 到 xhigh 间调节强度;max 档需官方完成额外安全测试后开放,其余能力发布当天即可用。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章