StepAudio 3是一款由阶跃星辰(StepFun)于2026年9月推出的语音大模型系列,主要用于实时语音交互、语音识别、语音合成与音频内容创作,支持中文、英文、方言及中英混说等多语种输入,适用于智能客服、车载交互、会议转写与音视频内容生产等场景。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 阶跃星辰推出的语音大模型系列,含 Realtime、ASR、TTS、Gen、Music 五款模型 |
| 出品方 | 阶跃星辰(StepFun) |
| 发布时间 | 2026年9月15日 |
| 核心能力 | 实时语音交互、语音识别(ASR)、语音合成(TTS)、音频内容生成、音乐创作 |
| 支持语种 | 中文、英文、方言、中英混说、长音频 |
| 关键成绩 | Artificial Analysis 实时对话 98.9% 综合得分、语音推理 99.7% 准确率均列全球第一;ASR 词错误率 1.7% 并列全球第一 |
| 开源与价格 | 商业 API 服务,非开源 |

StepAudio 3 的核心能力
作为 AI 模型 在音频赛道的重要进展,StepAudio 3 以五款子模型覆盖语音从「听懂」到「表达」再到「创作」的完整链路。
StepAudio 3 Realtime(实时语音交互)
StepAudio 3 Realtime 主打原生全双工实时对话,支持在持续对话中边听边理解、判断接话时机并完成推理与任务执行。在 Artificial Analysis 的 Conversational Dynamics 榜单中以 98.9% 综合得分排名全球第一,Speech Reasoning 语音推理准确率 99.7% 同样位列全球第一。模型可同时理解语义、语气、情绪与副语言,并支持推理与语音生成并行、工具调用与长任务异步执行而不阻塞当前会话,让实时语音助手在倾听、思考与行动之间保持连贯。
StepAudio 3 ASR(语音识别)
StepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识与推理结合,支持中文、英文、方言、中英混说、长音频与专业领域识别,能更准确识别人名、地名与专业术语。在 Artificial Analysis 非流式语音识别准确性榜单中,词错误率(WER)仅 1.7%,并列全球第一,适用于会议纪要、字幕生成、智能客服与车载交互等场景,也能处理低声、快语速与背景音乐等复杂输入。
StepAudio 3 TTS(语音合成)
StepAudio 3 TTS 面向实时交互场景的真人级语音生成,在音色、语调、节奏与气口停顿上贴合人类口语模式,并能还原笑声、迟疑、结巴、改口等副语言表现。模型结合语义理解自主调整情绪与语气,基于流式生成架构实现生成与播放同步,满足实时语音应用对低延迟与自然度的双重需求。
StepAudio 3 Gen(音频内容生成)
StepAudio 3 Gen 将角色配音、环境音、音效与背景音乐统一到一个模型中,基于自然语言描述与参考音频一次生成具备完整声音层次的内容,并支持对多角色音色、语气、方言口音及笑声、喘息等副语言特征精细控制,也可指定对白、音效与背景音乐的出现时间与顺序,适用于影视、动画、游戏与有声书创作,把原本分散的音频生产链路压缩到一次生成。
StepAudio 3 Music(音乐创作)
StepAudio 3 Music 不仅支持从零生成,也支持基于 ABC 记谱法控制的多轮交互创作,可围绕用户已有的歌词、清唱、参考歌曲继续生成与完善作品。模型支持自然语言控制曲风、人声、旋律、节奏、乐器与情绪,并对主歌、副歌、桥段等歌曲结构及跨段落旋律发展建模,产出结构完整、表达连贯的音乐作品。
StepAudio 3 与同类语音大模型的对比
| 对比维度 | StepAudio 3 | 阿里 FunASR | ElevenLabs | MiniMax 语音 | OpenAI Whisper |
|---|---|---|---|---|---|
| 开发方 | 阶跃星辰 | 阿里巴巴达摩院 | ElevenLabs | MiniMax | OpenAI |
| 核心定位 | 语音大模型系列(实时/识别/合成/生成/音乐) | 开源语音识别工具包 | AI 语音合成平台 | 通用语音模型 | 开源语音识别模型 |
| 能力覆盖 | 实时交互+ASR+TTS+音频生成+音乐 | ASR 为主 | TTS 为主 | 语音识别与合成 | ASR 为主 |
| 多语种/方言 | 中/英/方言/中英混说 | 多语种 ASR | 多语种 TTS | 中英及方言 | 多语种 |
| 开源程度 | 否(商业 API) | 是(开源) | 否(商业 SaaS) | 否(商业 API) | 是(开源) |
| 关键基准 | 实时对话 98.9%、ASR WER 1.7% 均全球第一 | 通用 ASR 基线 | TTS 自然度领先 | 中文语音表现优秀 | ASR 广泛采用 |
| 部署方式 | 阶跃星辰开放平台 API | 本地/云端部署 | 云端 API | 云端 API | 本地/云端部署 |
| 价格模式 | 按调用计费(平台定价) | 免费开源 | 订阅制 | 按调用计费 | 免费开源 |
整体来看,StepAudio 3 的优势在于以单一系列打通实时交互、识别、合成、生成与音乐五大方向,并在 Artificial Analysis 多项权威榜单登顶;相比之下,多数同类语音模型仍聚焦单一环节,覆盖广度是其主要差异点,对需要「一套模型解决多种语音任务」的团队尤为友好。
对更看重「开箱即用」而非自建模型的创作者,也可以关注成熟的语音生成平台。例如 Fish Audio 提供面向内容创作的 AI 语音生成服务,体验门槛更低。
StepAudio 3 的应用场景与适用人群
- 智能客服与车载交互:基于实时语音交互能力,支撑低延迟、可打断的对话式服务,适配客服热线与车载语音助手。
- 会议与媒体转写:依托 ASR 的高精度与专业术语识别,生成会议纪要、视频字幕与直播文稿。
- 音视频内容创作:借助 TTS 与 Gen,批量产出配音、音效、环境音与背景音乐,缩短内容生产链路。
适用人群:需要语音能力的企业开发者、智能硬件与车载厂商、媒体与短视频创作者,以及希望低成本接入通话级语音交互的创业团队。
StepAudio 3 的使用方法
- 获取接入入口:访问 StepAudio 3 官网(阶跃星辰开放平台),注册并开通 StepAudio 3 系列模型的 API 权限。
- 选择子模型:根据场景在 Realtime、ASR、TTS、Gen、Music 中选用对应模型,阅读对应 API 文档确定请求参数。
- 集成调用:通过平台 SDK 或 HTTP 接口传入音频/文本,处理实时对话、转写或语音合成等任务,并按需开启流式输出。
- 评估与上线:在测试环境验证时延、识别率与音质,达标后接入生产服务并按调用量计费。
StepAudio 3 的价格与开源情况
StepAudio 3 以商业 API 形式在阶跃星辰开放平台提供,按调用量计费,具体单价以平台公示为准;Realtime、ASR、TTS、Gen、Music 各子模型独立计价,开发者可按实际场景选用,无需一次性采购授权。
StepAudio 3 目前未开源,不提供权重或本地部署版本,仅通过官方 API 与开放平台使用;对需要自托管或私有化部署的团队,可参考 FunASR 等开源语音方案作为替代,但其在实时交互与音乐创作上的覆盖不及本系列。
StepAudio 3 的常见问题
StepAudio 3 包含哪些模型?
StepAudio 3 是系列模型,包含 Realtime(实时语音交互)、ASR(语音识别)、TTS(语音合成)、Gen(音频内容生成)与 Music(音乐创作)五款,分别面向不同语音任务。
StepAudio 3 支持哪些语言?
支持中文、英文、方言、中英混说与长音频识别,并能处理低声、快语速、含糊连读及背景音乐等复杂输入。
StepAudio 3 是开源模型吗?
不是。StepAudio 3 目前以商业 API 形式提供,未开放权重或本地部署版本,仅可通过阶跃星辰开放平台调用。
StepAudio 3 与 FunASR 有什么区别?
FunASR 是阿里巴巴开源的语音识别工具包,以 ASR 为主;StepAudio 3 是阶跃星辰的商业语音大模型系列,覆盖实时交互、识别、合成、生成与音乐,能力更广但以 API 形式提供。
浙公网安备33010202004812号