Confucius4-R2T2是一款由网易有道于2026年9月推出的真流式语音识别模型,主要用于把连续语音实时转为稳定文本,支持 80 毫秒至 2 秒可配置的解码块与不回改的输出方式,适用于实时字幕、会议记录与语音智能体等场景。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 真流式语音识别模型 |
| 出品方 | 网易有道(子曰 Live 系列) |
| 发布时间 | 2026年9月16日 |
| 模型规模 | 约 20 亿参数(2.04B) |
| 基座模型 | Qwen3-ASR-1.7B |
| 流式方式 | 真流式 append-only,已输出文本不再改写 |
| 解码块 | 80 毫秒至 2 秒可配置 |
| 平均延迟 | 约 200 至 600 毫秒 |
| 支持语言 | 以中文与英文为重点,兼容多语言 |
| 上下文与热词 | 原生支持上下文与热词提示 |
| 部署方式 | vLLM 与 Transformers 双后端 |
| 开源情况 | 权重适用网易模型使用许可协议 |

Confucius4-R2T2 的核心能力
Confucius4-R2T2 针对的是流式语音识别长期存在的一处矛盾:出字快,但前文识别结果仍在变化。传统流式方案为了保证延迟,会先给出临时文本再反复修正,下游的语言模型与业务系统很难在句子尚未说完时介入处理。对关注 AI智能体 语音入口的团队而言,文本能否尽早稳定下来,直接决定后续链路能提前多少。
append-only 输出与最长稳定前缀机制
模型采用真流式输出,遵循 append-only 原则:已经提交的文本永久保留,不因后续音频而改写。支撑这一点的是 Longest Stable Prefix 机制,模型在解码过程中判断哪一段语音内容已经足够稳定、可以安全提交,哪一段还需要更多音频上下文。只暴露稳定前缀,既保证了已输出内容不再变化,也让后续预测建立在可靠的上下文之上。
80 毫秒至 2 秒可配置解码块与 200 至 600 毫秒延迟
流式接口的解码块可在 80 毫秒至 2 秒之间配置,用来在延迟与准确率之间取舍:块越小,出字越快,留给模型的上下文也越少;块越大,准确率更稳,延迟相应上升。官方给出的平均识别延迟约为 200 至 600 毫秒,指每个字说出口到被识别出来的平均耗时。加入流式支持并未牺牲离线识别准确率,同一套权重在离线转写任务上保持原有表现。
官方评测中的识别质量表现
官方在英文与中文多个公开测试集上给出了流式与离线的对比结果。以英文会议语音集 AMI 为例,在 160 毫秒解码块设置下,模型录得 11.37% 的词错误率,优于同设置下的 X-ASR、Nemotron 与 Voxtral,也接近 200 毫秒设置下 WhisperRT 的表现。官方同时说明,在延迟与识别质量两项上,该模型在开源模型中处于领先位置,与部分闭源系统相比也具备竞争力。
与下游语音链路的衔接
稳定的增量文本让下游可以边接收边处理:语音智能体在用户尚未说完时就开始理解上下文,不必等整句结束再启动;实时字幕可以直接上屏,不需要在末尾做一次整段替换。模型原生支持上下文与热词提示,接入业务词表后可以改善专有名词与行业术语的识别效果。官方提供的 WebSocket 服务把增量音频推送与文本返回封装为一条持续连接,便于接入现有系统。
Confucius4-R2T2 与同类实时语音识别模型的对比
| 对比维度 | Confucius4-R2T2 | GPT-Realtime-Whisper | Fun-ASR-Realtime |
|---|---|---|---|
| 开发方 | 网易有道 | OpenAI | 阿里巴巴通义实验室 |
| 产品性质 | 开源真流式语音识别模型,可私有化与二次开发 | 托管的实时语音转写接口,按分钟计费 | 开源流式语音识别模型,可本地部署 |
| 流式输出方式 | 真流式 append-only,已输出文本不再改写 | 边输入边输出文本 | 流式转写,持续返回中间结果 |
| 延迟口径 | 解码块 80 毫秒至 2 秒可配置,平均约 200 至 600 毫秒 | 官方强调低延迟 | 约 600 毫秒级 |
| 识别精度 | 官方给出中英文多测试集结果,英文 AMI 在 160 毫秒下词错误率 11.37% | 官方未公布 | 官方未公布 |
| 语言覆盖 | 以中文与英文为重点,兼容多语言 | 多语言语音转写 | 31 种语言,含中文方言 |
| 热词与上下文 | 原生支持上下文与热词提示 | 官方未公布 | 支持热词增强与语境纠错 |
| 部署与开源 | 权重开源,vLLM 与 Transformers 双后端,另提供 WebSocket 服务 | 闭源,仅通过实时接口调用 | Apache 2.0 开源,支持本地与私有云部署 |
上表 Confucius4-R2T2 一列取自其官方模型卡与发布材料,GPT-Realtime-Whisper 与 Fun-ASR-Realtime 两列取自各自的官方文档与项目资料。三款方案的分野首先在交付形态:一款交付可下载的权重,一款交付按分钟计费的托管接口,另一款交付可本地部署的开源项目。输出稳定性是第二处差异,本项目采用不回改的提交方式,另外两款公开资料中未给出同口径说明。延迟口径也不完全可比,本项目给出的是解码块与平均识别延迟,另外两款分别以服务端表现与实时倍率描述。需要把识别结果直接喂给下游系统的团队,应重点比较已提交文本的稳定性与失败提示是否明确。
如需对照另一条通用语音识别路线,可参考 Hy ASR 3.0 preview(腾讯混元推出的新一代语音识别模型,面向通用语音转写场景,与本文的实时流式路线在侧重上有所不同)。
Confucius4-R2T2 的应用场景与适用人群
该模型面向需要边接收语音边产出文本的任务,常见场景包括:
- 实时字幕与直播转写:把讲话内容持续上屏,字幕不会在末尾整段替换。
- 会议记录与速记:多人交替发言时持续输出文本,配合热词提升专有名词准确率。
- 语音智能体入口:把稳定的增量文本交给下游模型,让理解与执行同步开始。
- 同声传译上游:为流式翻译模型提供可立即消费的文本,组成实时跨语言链路。
适用人群:开发语音智能体与实时字幕产品的工程团队,需要把会议、客服通话转成可用文本的业务方,以及希望在本机或私有环境处理音频、不愿把语音送到外部接口的机构。对准确率优先、可以接受整段转写的离线场景,模型同样可用,但流式能力不会被用上。
Confucius4-R2T2 的使用方法
模型权重已上架 Hugging Face 与 ModelScope,本地部署流程如下:
- 获取权重:在 Confucius4-R2T2 官方仓库 查看安装说明并下载模型权重。
- 准备运行环境:仓库提供 Conda 与 uv 两种环境配置方式,同时给出可直接运行的官方 Docker 镜像。
- 选择推理模式:离线转写使用
onetime_vllm,实时转写使用stream_vllm。 - 设置解码块:通过
CHUNK_SIZE_MS在 80 毫秒至 2 秒之间调整,延迟与准确率随之变化。 - 接入业务链路:通过
/asr_stream_api_v1的 WebSocket 接口持续推送音频增量并接收文本。
上线前建议固定两项目标:解码块大小与可接受的字错误率上限,再用自有音频集跑一轮对比。音频采样率与声道数也需与部署环境保持一致,否则会影响实时链路的稳定性。
R2T2的官方资源
- 项目官网:https://r2t2.ai/
- GitHub仓库:https://github.com/netease-youdao/Confucius4-R2T2
- HuggingFace模型库:https://huggingface.co/netease-youdao/Confucius4-R2T2
Confucius4-R2T2 的价格与开源情况
Confucius4-R2T2 以开源方式发布,权重可免费下载用于自建服务,成本集中在推理硬件与运维投入。官方未设置单独的调用费用,也没有托管接口计价。
该模型的权重适用网易自有的模型使用许可协议,并非 Apache 2.0。同一批次发布的 Confucius4-T3PO 采用 Apache 2.0 许可,两者条款不同,商用前需要分别核对许可范围与二次分发要求。社区已推出多个量化版本,可在消费级设备上以更低显存运行,但量化后的识别表现需要自行实测确认。
Confucius4-R2T2 的常见问题
Confucius4-R2T2 是什么?
它是网易有道开源的实时流式语音识别模型,基于 Qwen3-ASR 训练,采用 append-only 输出与最长稳定前缀机制,已提交的文本不再改写,解码块可在 80 毫秒至 2 秒之间配置。
Confucius4-R2T2 的延迟有多低?
官方给出的平均识别延迟约为 200 至 600 毫秒,指每个字说出口到被识别出来的平均耗时;解码块越小延迟越低,留给模型的上下文也越少,可按场景在 80 毫秒至 2 秒之间调整。
Confucius4-R2T2 可以商用吗?
权重可免费下载自建服务,但适用的是网易自有的模型使用许可协议,而非 Apache 2.0。商用前需要核对许可条款;同批发布的 Confucius4-T3PO 采用 Apache 2.0,两者范围不同。
浙公网安备33010202004812号