Hy ASR 3.0 preview – 腾讯混元推出的新一代语音识别模型

AI模型1个月前更新 老高
149 0

Hy ASR 3.0 preview快速摘要

Hy ASR 3.0 preview是腾讯混元于2026年8月发布的新一代语音识别模型,基于Hy3大语言模型语言理解能力,融合高精度语音识别、上下文理解和复杂环境转写能力,适用于语音转文字、智能客服、会议记录、语音搜索等场景。

  • 开发公司:腾讯混元
  • 模型定位:语音识别模型
  • 发布时间:2026年8月4日
  • 使用要求:当前内测版通过腾讯云API调用,仅支持实时语音识别、1分钟以内音频和16k单声道PCM输入
  • 开源情况:目前未公开模型权重,主要通过腾讯云API提供服务
  • 技术特点:采用MoE架构,结合Hy3语言理解能力、自研语音Encoder和大规模语音训练数据
  • 价格:腾讯元宝支持免费体验,腾讯云API按照相关语音识别服务规则计费
Hy ASR 3.0 preview – 腾讯混元推出的新一代语音识别模型

Hy ASR 3.0 preview的核心优势

  • 语义理解增强:基于Hy3大语言模型和语音识别融合架构,增强上下文理解能力。中文普通话WER达到3.34%,英语WER达到2.62%,提升语音转文字准确性。
  • 方言识别能力:通过大规模多来源语音数据训练,支持普通话、英语、粤语及20种方言,覆盖10大方言片区,提升多口音场景识别效果。
  • 复杂环境适应:针对高噪、耳语等声学场景优化,降低环境干扰导致的错误识别,提升会议记录、智能客服等场景稳定性。
  • 上下文纠错能力:结合Context上下文建模技术,识别同音词和专业术语时参考语义环境,提高AI语音识别结果可读性。
  • 专业场景适配:支持热词注入功能,可增强品牌、人名和行业词汇识别,适合企业语音转文字API应用。

Hy ASR 3.0 preview的主要功能

  • 实时语音转文字:通过腾讯云WebSocket接口实时接收语音流并返回文本,适用于语音助手、客服转写和在线字幕场景。
  • 多语言语音识别:支持中文普通话、英语、粤语及多方言识别,可处理中英混说输入,适用于视频字幕生成和语音搜索。
  • 上下文智能纠错:利用Hy3语言理解能力分析上下文,对同音词、歧义表达进行优化,提高会议记录AI工具输出质量。
  • 热词增强识别:支持专业词汇配置,可提升产品名称、企业术语和行业关键词识别效果,降低业务适配成本。
  • 复杂场景转写:针对高噪音、耳语和低音量输入优化,在真实环境中保持较稳定的语音识别表现。

Hy ASR 3.0 preview的技术原理

  • MoE架构设计:采用MoE模型架构并升级Hy3语言基座,通过专家网络协同处理语音和文本信息,增强推理能力。
  • 语音Encoder训练:采用自研无监督语音Encoder,利用数千万小时级语音数据训练,提取复杂音频中的声学特征。
  • 联合训练机制:语音Encoder与大语言模型联合训练,引入多来源语音数据,提升上下文理解和多语言识别能力。
  • 后训练优化:通过SFT和多阶段强化学习优化通用转写、Context理解及复杂场景表现,降低错误识别率。
  • 方言能力增强:训练数据覆盖10大方言片区和20余个二级小片区,提升方言语音转文字效果和应用范围。

Hy ASR 3.0 preview与主流模型对比

对比维度Hy ASR 3.0 previewWhisper large-v3Doubao-Seed-ASR
模型定位语音识别+语义理解模型通用语音识别模型语音识别模型
中文WER3.34%公开测试约4%左右第三方整理约3.70%
英语WER2.62%公开测试表现稳定第三方整理约5.65%
方言能力支持20种方言有限支持中文语音场景
上下文理解支持Context语义理解主要依靠识别模型结合大模型能力
API支持腾讯云API开源部署/API服务平台API

从技术路线来看,Hy ASR 3.0 preview与传统语音识别模型的主要区别在于融合了大语言模型理解能力。Whisper large-v3主要依靠端到端语音识别架构,在多语言识别方面具有较强通用能力;Hy ASR 3.0 preview则通过Hy3语言模型增强上下文理解,更适合需要语义纠错和专业词汇处理的场景。不同模型测试结果会受到数据集、音频环境和评测标准影响,因此WER数据不能完全代表所有实际体验。对于普通语音转文字需求,可根据部署方式选择;对于中文场景、方言识别、智能客服和会议记录等需求,Hy ASR 3.0 preview提供了更针对性的能力。

如何使用Hy ASR 3.0 preview

  • 普通用户:可打开腾讯元宝,按住语音输入即可免费体验方言识别、上下文纠错和实时语音转文字功能。
  • 开发者:可通过腾讯云语音识别API接入,创建密钥并调用实时语音识别接口,将模型参数设置为Hy-ASR-3.0-preview即可使用;

Hy ASR 3.0 preview相关资源

Hy ASR 3.0 preview的应用场景

  • 智能客服:用于客服通话实时转写,结合热词识别品牌和业务术语,帮助企业提升客服质检和服务分析效率。
  • 会议记录:支持会议语音实时转文字,结合上下文理解生成更准确的会议内容,减少人工整理成本。
  • 视频字幕生成:适用于短视频、课程和访谈内容处理,将语音快速转换为字幕文本,提高内容制作效率。
  • 语音搜索:支持用户通过语音完成搜索操作,结合方言识别能力,降低不同口音用户的使用门槛。
  • 智能终端:可应用于车载设备、智能家居等场景,通过稳定语音识别提升人机交互体验。

Hy ASR 3.0 preview常见问题

Hy ASR 3.0 preview怎么用?

Hy ASR 3.0 preview可以通过腾讯云API调用,也可以在腾讯元宝中免费体验。开发者需配置API密钥并调用实时语音识别接口,当前内测版支持实时转写和16k单声道PCM音频输入。

Hy ASR 3.0 preview如何计费?

腾讯云API按照语音识别服务规则计费,具体价格需查看当前计费方案。普通用户可通过腾讯元宝免费体验语音输入功能,企业使用建议根据调用量评估成本。

Hy ASR 3.0 preview和Whisper哪个好?

两者定位不同,Whisper偏向通用开源语音识别,Hy ASR 3.0 preview结合Hy3大语言模型增强上下文理解,更适合中文、方言和专业场景语音转文字需求。

Hy ASR 3.0 preview支持实时转写吗?

支持实时转写,目前通过腾讯云实时语音识别WebSocket接口提供服务。不过内测版本存在限制,仅支持1分钟以内语音输入,部分高级功能尚未开放。

Hy ASR 3.0 preview支持哪些语言?

Hy ASR 3.0 preview支持中文普通话、英语、粤语以及多种方言识别,目前覆盖20种方言,可用于多语言语音转写和复杂口音识别场景。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章