Step 5 Preview – 阶跃星辰推出的旗舰基座模型

AI模型4小时前更新 老高
12 0

Step 5 Preview是一款由阶跃星辰(StepFun)于2026年9月推出的旗舰基座模型,主要面向需要长任务链持续执行的 Agentic 任务,采用稀疏 MoE 架构(总参 600B/激活 27B),支持 100 万 Token 上下文与原生文本、视觉输入,适用于 AI 编程、专业知识工作与金融研究等场景。

基础信息内容
产品定位面向 Agentic 任务的旗舰基座模型
出品方阶跃星辰(StepFun)
发布时间2026年9月20日
模型架构稀疏 MoE(600B 总参/27B 激活)
上下文窗口100 万 Token
输入模态原生文本与视觉输入
智能指数44 分(Artificial Analysis)
单任务成本Claude Opus 5 的 1/8
编程评测覆盖 553 个代码仓库、9 类任务、33 种语言
开源计划2026年10月15日释放完整权重
接入方式阶跃开放平台 API 与 Studio 在线体验
Step 5 Preview – 阶跃星辰推出的旗舰基座模型

Step 5 Preview 的核心能力

这一代的着力点不是把单项能力推到最高,而是在能力、成本与效率之间把边界再往外推一档。这类取舍也是 大语言模型 从回答走向执行后,选型标准变化的直接反映。

稀疏 MoE 架构与 100 万 Token 上下文

模型采用稀疏 MoE 架构,总参数 600B、激活参数 27B,推理时只为激活部分付出算力。配合 100 万 Token 的上下文窗口,长任务链里的历史记录可以完整保留,多轮工具调用时不必反复裁剪上下文,也能持续追踪此前的执行结果与运行反馈。

长周期任务的自主迭代能力

官方用两个可量化实验验证持续执行:一是在单张 NVIDIA H100 上给它 24 小时,从零优化一个头维度 512 的 MLA 内核,它在约 22 小时把峰值性能做到 508 TFLOPS;遇到让吞吐下降的候选方案会主动放弃,退回此前最优版本继续。二是给它 24 小时通过自动化后训练提升 Qwen3-30B-A3B 在 AIME24 上的表现,准确率由 53.3% 提升至 60%,消耗的标注 token 比对照方案更少。

AI 编程与软件工程的任务覆盖

面向编程场景,官方构建了 StepCodeBench,覆盖 553 个独立代码仓库、9 类任务、20 个应用领域与 33 种编程语言,考察的是整体任务成功率与跨场景稳定性,而非单题通过率。官方展示的任务里,模型自主阅读开发文档后把一块 ESP32-S3 开发板改成支持蓝牙按键与语音输入的键盘,过程中访问串口、调用摄像头、模拟鼠标操作,并按真实设备返回的报错持续修改调试。

金融研究场景的三类评测

金融被作为重点验证场景,围绕公司研究构建了三项内部评测:信息检索与验证、企业估值建模、完整深度研究流程;外部还使用 FrontierFinance,以 220 道专家设计的问题与 11,543 项评估标准覆盖六类投资应用场景。四项评测中模型均取得较强结果,侧重的是数据口径不一致时借助工具完成严谨分析的能力。

前端设计与 3D 创意内容生成

除代码外,模型可完成网页界面与数据可视化,也能调用 Blender 创建并反复调整 3D 资产,再把资产接入 Three.js 的交互式 Web 应用与游戏。官方示例还从一本 1922 年的铁路旅行指南中提取信息,构建行程查询与路线回放功能。

Step 5 Preview 与同类基础模型的对比

基座模型的取舍集中在能力、成本与效率三点。以下对比数值与口径均取自阶跃星辰官方发布材料,逐格列出。

对比维度Step 5 PreviewClaude Opus 5
研发方阶跃星辰(StepFun)Anthropic
模型架构稀疏 MoE(总参 600B/激活 27B)未在对比项内
智能指数智力指数 44 分(开源前三)未在对比项内
单任务成本基准成本Step 5 Preview 的 8 倍
上下文窗口100 万 Token200K Token
输入模态原生文本+视觉文本+视觉
GPU 内核优化508 TFLOPS493 TFLOPS
AIME24 后训练53.3% → 60%53.3% → 60%
开源情况2026年10月15日释放完整权重闭源,仅 API 提供

九项放在一起看,差别不在单点峰值,而在同一成本下的可用性:单任务成本只有 Claude Opus 5 的 1/8,100 万 Token 的上下文窗口是 200K 的五倍。两项长周期实验更能说明问题——24 小时自主优化 MLA 内核做到 508 TFLOPS,超过 493 TFLOPS;自动化后训练把 Qwen3-30B-A3B 在 AIME24 上从 53.3% 提到 60%,与对照方案持平但消耗的标注 token 更少。表中「未在对比项内」指该模型未参与官方该项对比,未作推测填充。

如果想对照另一条开放权重路线,可参考 Kimi K3(月之暗面推出的旗舰大模型,采用 2.8 万亿参数 MoE 架构,同样支持 100 万 Token 上下文与原生视觉理解)。两者的差别在重心:它更偏通用知识与深度研究,本代把重点放在长周期 Agent 任务的持续执行上。

Step 5 Preview 的应用场景与适用人群

模型的强项在多轮、长时段、需要自己判断下一步做什么的任务,纯问答反而不是它的主场:

  • AI 编程与软件开发:覆盖 Bug 修复、功能开发、代码重构与环境配置,支持 33 种编程语言,可作为团队日常主力编码模型。
  • 长周期科研与工程优化:适合放进 24 小时级别的自主迭代任务,例如内核性能调优与自动化后训练数据流程。
  • 金融分析与投资研究:覆盖金融信息检索验证、企业估值建模与深度研究报告撰写,服务投研与金融专业人士。

适用人群:需要把模型接入长任务链的工程与产品团队;做技术选型、要看真实任务链成本与成功率的算法负责人;以及金融投研、硬件研发等需要模型自主跑完多步流程的专业用户。

Step 5 Preview 的使用方法

模型提供在线体验与 API 两条路径,权重在 10 月 15 日之后才开放下载:

  1. 读官方材料:从 Step 5 Preview 官方发布页 查看完整评测口径与示例任务,确认长周期任务的样本设计。
  2. 在线体验:在 Studio 平台(studio.stepfun.com)选定 Step 5 Preview,先用一个多步任务观察任务规划与工具调用的稳定性。
  3. 接入接口:中国大陆节点走 platform.stepfun.com,国际节点走 platform.stepfun.ai,创建 API Key 后按兼容格式发起调用。
  4. 适配长任务:把中间结果与运行反馈写回上下文,按任务阶段分段清理历史,避免 100 万 Token 窗口被无谓记录占满。

Step 5 Preview 的价格与开源情况

Step 5 Preview 全量开放后通过阶跃开放平台按量计费,官方未给出统一价目表,成本口径来自官方材料给出的相对值:完成同一任务的开销约为 Claude Opus 5 的 1/8。对长周期 Agent 任务而言这个差距会被多轮工具调用放大——单步价格接近时,轮次越多总账差距越大,建议用真实任务链跑通后再比较成本。

权重层面,Step 5 Preview 按开源模型交付,完整权重定于 2026 年 10 月 15 日释放,在此之前只提供 API 与在线体验。这条路径延续了阶跃从 Step 3.5 Flash、Step 3.7 Flash 以来的效率取向:先用 API 验证任务效果,权重开放后再决定是否自建推理集群。

Step 5 Preview 的常见问题

Step 5 Preview 的参数规模是多少?

采用稀疏 MoE 架构,总参数 600B、激活参数 27B,推理时只计算激活部分,以较低的推理成本支撑旗舰级能力。

Step 5 Preview 什么时候开源?

完整权重定于 2026 年 10 月 15 日释放。在此之前可通过阶跃开放平台 API 与 Studio 在线体验使用,需要本地部署的团队可先用 API 完成选型验证。

Step 5 Preview 的上下文窗口有多大?

支持 100 万 Token 上下文,并原生支持文本与视觉输入,适合长任务链中持续保留历史记录与运行反馈。

Step 5 Preview 与 Claude Opus 5 相比如何?

Artificial Analysis 智能指数 44 分、位居全球开源模型前三,单任务成本约为 Claude Opus 5 的 1/8,上下文窗口是对方的五倍。长周期实验里,H100 上优化 MLA 内核达 508 TFLOPS,高于对方的 493 TFLOPS;自动化后训练把 Qwen3-30B-A3B 在 AIME24 上从 53.3% 提到 60%,与对方持平但标注 token 消耗更少。

© 版权声明

相关文章