Spark-Audio-1.0-Preview – 科大讯飞推出的全国产语音基座大模型

AI模型3天前更新 老高
30 0

Spark-Audio-1.0-Preview是一款由科大讯飞于2026年9月推出的全国产语音基座大模型,主要用于直接理解语音中的语义、情绪与场景,支持 99 种语言与 202 种方言识别,并基于纯国产算力集群完成训练,适用于语音转写、多语言翻译、方言识别与语音智能体等方向。

基础信息内容
产品定位全国产算力训练的语音基座大模型
出品方科大讯飞
发布时间2026年9月16日
模型架构0.65B 音频编码器 + 30B-A3B MoE
训练数据1300 万小时音频与大量文本
语言覆盖99 种语言、202 种方言
关键成绩Fleurs 中文测试集取得 SOTA
开源与价格暂未开源,官方体验中心试用
Spark-Audio-1.0-Preview – 科大讯飞推出的全国产语音基座大模型

Spark-Audio-1.0-Preview 的核心能力

作为 AI 模型 中少见地以纯国产算力集群完成训练的语音基座,它的技术路径很明确:不让语音先变成文字,而是让模型直接听懂语音本身。

从级联方案到端到端语音理解

传统语音处理多采用级联方案:先把语音转写成文字,再交给大语言模型理解。这条链路有两个短板——文字只记录说了什么,会丢掉语气、情绪与背景环境音;语音转写、声纹识别、翻译等模块独立串联,断点既累积错误又带来延迟。该模型直接对语音做语义、情绪与场景理解,把割裂的链路收进同一个模型。

纯国产算力训练下的架构设计

模型采用 0.65B(Dense 结构)音频编码器搭配 30B-A3B(MoE 结构)大语言模型,基于纯国产算力集群训练完成,训练侧使用 1300 万小时音频与大量文本数据,因此在通用知识、数学与代码等文本任务上没有明显降智。对语音基座来说这点尤为关键:不少语音方案转向音频后,文本推理能力会同步下滑。

多语言与多方言识别能力

模型支持 99 种语言与 202 种方言识别。官方发布材料给出的对比基线中,它与同尺寸的 Qwen3.5-omni-flash(35B-A3B)相比在多语言、多方言识别上占优,并与尺寸高一个数量级的 Qwen3.5-omni-plus 效果接近,参数效率是这一代的主要优化方向。对覆盖方言地区或出海多语种的产品,这层覆盖度直接决定可用性。

复杂场景下的真实环境表现

在 Fleurs、Kespeech、LibriSpeech 等中英文与多方言识别评测中,模型得分高于 Gemini-3.1 Pro,Fleurs 中文测试集取得 SOTA。面向真实应用时,它在大噪声、小音量等条件下的优势更明显——这恰是级联方案最易失效之处:环境音与语气一旦丢弃,后续理解便无从补救。

单模型多任务与微调扩展

同一模型内可输入文本与语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析与音频问答等任务。与讯飞星火大模型的 1+N 体系类似,语音基座上同样支持微调,可派生语音识别、语音同传、语音交互等专用模型。

Spark-Audio-1.0-Preview 与同类语音模型的对比

对比维度Spark-Audio-1.0-PreviewStepAudio 3Qwen-Audio-3.0-RealtimeVoxtral Transcribe 2
开发方科大讯飞阶跃星辰阿里通义Mistral AI
产品形态语音基座大模型五款语音模型系列实时双工语音大模型语音转写模型家族
参数规模0.65B 音频编码器 + 30B-A3B MoERealtime 约 196B 总参、11B 激活官方未公开Realtime 4B
开源程度暂未开源暂未开源未开源Realtime 权重 Apache 2.0 开源
语言覆盖99 种语言、202 种方言中/英/方言/中英混说/长音频多语种实时交互13 种语言
上下文官方未公开128K40K,最多 50 轮 / 300 秒音频单次最长 3 小时音频
关键成绩Fleurs 中文测试集 SOTAASR 非流式 WER 1.7%,并列全球第一语音对话评测综合排名第一FLEURS 约 4% WER
价格模式体验中心试用,价格未公布TTS 每万字符 2.5 元起音频输入 40 元/百万 tokens批量版 0.003 美元/分钟

整体看,Spark-Audio-1.0-Preview 的差异集中在两点:训练算力完全国产化,以及把语音理解压进单一模型而非级联链路。StepAudio 3 以五款模型覆盖识别、合成、实时交互与音乐创作,走系列化路线;Qwen-Audio-3.0-Realtime 侧重低延迟双工交互与工具调用;Voxtral Transcribe 2 以开源实时版权重和按分钟计费切入批量转写与实时字幕。表中数值均取自各方官方发布材料与技术文档。

如果需要目标说话人场景的识别能力,可以关注 Xiaomi-CocktailASR-1(小米推出的目标说话人语音识别大模型),它在多人对话中聚焦特定说话人的语音识别,与本文模型的通用语音理解方向互补。

Spark-Audio-1.0-Preview 的应用场景与适用人群

  • 语音转写与会议记录:把会议、访谈与课堂长音频直接转成文字,并借助说话人识别区分发言人。
  • 多语言与方言场景:覆盖 99 种语言与 202 种方言,适合出海客服、跨境内容与方言地区语音输入。
  • 复杂环境拾音:在高噪声、小音量等真实条件下完成识别,适配车载、工业现场与户外记录场景。
  • 语音智能体与专用模型:在语音基座上微调出语音识别、语音同传或语音交互系统,接入业务闭环。

适用人群:需要语音识别与音频理解能力的开发者与企业团队、对训练算力与数据合规有国产化要求的企业,以及出海客服、媒体转写与语音智能体方向的从业者。

Spark-Audio-1.0-Preview 的使用方法

  1. 进入体验中心:访问 Spark-Audio-1.0-Preview 体验中心,在网页端直接试听与验证语音识别、翻译等能力。
  2. 明确任务类型:判断需求落在语音转写、多语言翻译、方言识别、环境音识别还是说话人识别,再确定输入形态与评估指标。
  3. 准备真实样本:按落地场景录制含噪声、多人对话或小音量的音频,用于验证复杂条件下的识别表现。
  4. 规划微调与接入:若需要专用模型,可在语音基座上微调派生语音识别、同传或交互系统,接入业务链路。

Spark-Audio-1.0-Preview 的价格与开源情况

Spark-Audio-1.0-Preview 目前通过科大讯飞官方体验中心开放试用,官方尚未公布 API 计费单价与免费额度,商业化定价与配额以官方公示为准。

Spark-Audio-1.0-Preview 暂未开源,官方未发布模型权重与许可证说明,现阶段只能通过官方体验中心验证能力,无法本地部署。对要求私有化部署的团队,需持续关注后续是否开放权重。

Spark-Audio-1.0-Preview 的常见问题

Spark-Audio-1.0-Preview 是什么?

Spark-Audio-1.0-Preview 是科大讯飞推出的全国产语音基座大模型,采用 0.65B 音频编码器搭配 30B-A3B MoE 语言模型,基于纯国产算力集群与 1300 万小时音频数据训练,支持 99 种语言与 202 种方言识别。

它和「先转写再理解」的方案有什么区别?

级联方案先把语音转成文字再交给大模型,会丢掉语气、情绪与背景环境音,各模块串联还容易累积错误并带来延迟。Spark-Audio-1.0-Preview 直接对语音做语义、情绪与场景理解,把整条链路收进同一个模型。

它支持哪些语言和方言?

支持 99 种语言与 202 种方言的识别;同一模型内可输入文本与语音两个模态,覆盖语音转写、多语言翻译、环境音识别、说话人识别、情感分析与音频问答等任务。

现在可以下载模型权重吗?

暂不能。Spark-Audio-1.0-Preview 尚未开源,官方未公布模型权重与许可证说明,当前仅能通过科大讯飞官方体验中心试用,暂不支持本地部署。

它和星火X2.5 有什么区别?

两者在科大讯飞 1+N 体系里分工不同:星火X2.5 是主打全国产算力的文本旗舰大模型,侧重通用语言理解与智能体构建;Spark-Audio-1.0-Preview 面向语音模态,负责让模型听懂语音本身,二者可组合使用。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章