Spark-Audio-1.0-Preview是一款由科大讯飞于2026年9月推出的全国产语音基座大模型,主要用于直接理解语音中的语义、情绪与场景,支持 99 种语言与 202 种方言识别,并基于纯国产算力集群完成训练,适用于语音转写、多语言翻译、方言识别与语音智能体等方向。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 全国产算力训练的语音基座大模型 |
| 出品方 | 科大讯飞 |
| 发布时间 | 2026年9月16日 |
| 模型架构 | 0.65B 音频编码器 + 30B-A3B MoE |
| 训练数据 | 1300 万小时音频与大量文本 |
| 语言覆盖 | 99 种语言、202 种方言 |
| 关键成绩 | Fleurs 中文测试集取得 SOTA |
| 开源与价格 | 暂未开源,官方体验中心试用 |

Spark-Audio-1.0-Preview 的核心能力
作为 AI 模型 中少见地以纯国产算力集群完成训练的语音基座,它的技术路径很明确:不让语音先变成文字,而是让模型直接听懂语音本身。
从级联方案到端到端语音理解
传统语音处理多采用级联方案:先把语音转写成文字,再交给大语言模型理解。这条链路有两个短板——文字只记录说了什么,会丢掉语气、情绪与背景环境音;语音转写、声纹识别、翻译等模块独立串联,断点既累积错误又带来延迟。该模型直接对语音做语义、情绪与场景理解,把割裂的链路收进同一个模型。
纯国产算力训练下的架构设计
模型采用 0.65B(Dense 结构)音频编码器搭配 30B-A3B(MoE 结构)大语言模型,基于纯国产算力集群训练完成,训练侧使用 1300 万小时音频与大量文本数据,因此在通用知识、数学与代码等文本任务上没有明显降智。对语音基座来说这点尤为关键:不少语音方案转向音频后,文本推理能力会同步下滑。
多语言与多方言识别能力
模型支持 99 种语言与 202 种方言识别。官方发布材料给出的对比基线中,它与同尺寸的 Qwen3.5-omni-flash(35B-A3B)相比在多语言、多方言识别上占优,并与尺寸高一个数量级的 Qwen3.5-omni-plus 效果接近,参数效率是这一代的主要优化方向。对覆盖方言地区或出海多语种的产品,这层覆盖度直接决定可用性。
复杂场景下的真实环境表现
在 Fleurs、Kespeech、LibriSpeech 等中英文与多方言识别评测中,模型得分高于 Gemini-3.1 Pro,Fleurs 中文测试集取得 SOTA。面向真实应用时,它在大噪声、小音量等条件下的优势更明显——这恰是级联方案最易失效之处:环境音与语气一旦丢弃,后续理解便无从补救。
单模型多任务与微调扩展
同一模型内可输入文本与语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析与音频问答等任务。与讯飞星火大模型的 1+N 体系类似,语音基座上同样支持微调,可派生语音识别、语音同传、语音交互等专用模型。
Spark-Audio-1.0-Preview 与同类语音模型的对比
| 对比维度 | Spark-Audio-1.0-Preview | StepAudio 3 | Qwen-Audio-3.0-Realtime | Voxtral Transcribe 2 |
|---|---|---|---|---|
| 开发方 | 科大讯飞 | 阶跃星辰 | 阿里通义 | Mistral AI |
| 产品形态 | 语音基座大模型 | 五款语音模型系列 | 实时双工语音大模型 | 语音转写模型家族 |
| 参数规模 | 0.65B 音频编码器 + 30B-A3B MoE | Realtime 约 196B 总参、11B 激活 | 官方未公开 | Realtime 4B |
| 开源程度 | 暂未开源 | 暂未开源 | 未开源 | Realtime 权重 Apache 2.0 开源 |
| 语言覆盖 | 99 种语言、202 种方言 | 中/英/方言/中英混说/长音频 | 多语种实时交互 | 13 种语言 |
| 上下文 | 官方未公开 | 128K | 40K,最多 50 轮 / 300 秒音频 | 单次最长 3 小时音频 |
| 关键成绩 | Fleurs 中文测试集 SOTA | ASR 非流式 WER 1.7%,并列全球第一 | 语音对话评测综合排名第一 | FLEURS 约 4% WER |
| 价格模式 | 体验中心试用,价格未公布 | TTS 每万字符 2.5 元起 | 音频输入 40 元/百万 tokens | 批量版 0.003 美元/分钟 |
整体看,Spark-Audio-1.0-Preview 的差异集中在两点:训练算力完全国产化,以及把语音理解压进单一模型而非级联链路。StepAudio 3 以五款模型覆盖识别、合成、实时交互与音乐创作,走系列化路线;Qwen-Audio-3.0-Realtime 侧重低延迟双工交互与工具调用;Voxtral Transcribe 2 以开源实时版权重和按分钟计费切入批量转写与实时字幕。表中数值均取自各方官方发布材料与技术文档。
如果需要目标说话人场景的识别能力,可以关注 Xiaomi-CocktailASR-1(小米推出的目标说话人语音识别大模型),它在多人对话中聚焦特定说话人的语音识别,与本文模型的通用语音理解方向互补。
Spark-Audio-1.0-Preview 的应用场景与适用人群
- 语音转写与会议记录:把会议、访谈与课堂长音频直接转成文字,并借助说话人识别区分发言人。
- 多语言与方言场景:覆盖 99 种语言与 202 种方言,适合出海客服、跨境内容与方言地区语音输入。
- 复杂环境拾音:在高噪声、小音量等真实条件下完成识别,适配车载、工业现场与户外记录场景。
- 语音智能体与专用模型:在语音基座上微调出语音识别、语音同传或语音交互系统,接入业务闭环。
适用人群:需要语音识别与音频理解能力的开发者与企业团队、对训练算力与数据合规有国产化要求的企业,以及出海客服、媒体转写与语音智能体方向的从业者。
Spark-Audio-1.0-Preview 的使用方法
- 进入体验中心:访问 Spark-Audio-1.0-Preview 体验中心,在网页端直接试听与验证语音识别、翻译等能力。
- 明确任务类型:判断需求落在语音转写、多语言翻译、方言识别、环境音识别还是说话人识别,再确定输入形态与评估指标。
- 准备真实样本:按落地场景录制含噪声、多人对话或小音量的音频,用于验证复杂条件下的识别表现。
- 规划微调与接入:若需要专用模型,可在语音基座上微调派生语音识别、同传或交互系统,接入业务链路。
Spark-Audio-1.0-Preview 的价格与开源情况
Spark-Audio-1.0-Preview 目前通过科大讯飞官方体验中心开放试用,官方尚未公布 API 计费单价与免费额度,商业化定价与配额以官方公示为准。
Spark-Audio-1.0-Preview 暂未开源,官方未发布模型权重与许可证说明,现阶段只能通过官方体验中心验证能力,无法本地部署。对要求私有化部署的团队,需持续关注后续是否开放权重。
Spark-Audio-1.0-Preview 的常见问题
Spark-Audio-1.0-Preview 是什么?
Spark-Audio-1.0-Preview 是科大讯飞推出的全国产语音基座大模型,采用 0.65B 音频编码器搭配 30B-A3B MoE 语言模型,基于纯国产算力集群与 1300 万小时音频数据训练,支持 99 种语言与 202 种方言识别。
它和「先转写再理解」的方案有什么区别?
级联方案先把语音转成文字再交给大模型,会丢掉语气、情绪与背景环境音,各模块串联还容易累积错误并带来延迟。Spark-Audio-1.0-Preview 直接对语音做语义、情绪与场景理解,把整条链路收进同一个模型。
它支持哪些语言和方言?
支持 99 种语言与 202 种方言的识别;同一模型内可输入文本与语音两个模态,覆盖语音转写、多语言翻译、环境音识别、说话人识别、情感分析与音频问答等任务。
现在可以下载模型权重吗?
暂不能。Spark-Audio-1.0-Preview 尚未开源,官方未公布模型权重与许可证说明,当前仅能通过科大讯飞官方体验中心试用,暂不支持本地部署。
它和星火X2.5 有什么区别?
两者在科大讯飞 1+N 体系里分工不同:星火X2.5 是主打全国产算力的文本旗舰大模型,侧重通用语言理解与智能体构建;Spark-Audio-1.0-Preview 面向语音模态,负责让模型听懂语音本身,二者可组合使用。
浙公网安备33010202004812号