Qwen3.8-LiveTranslate – 阿里通义推出的实时同声传译大模型

AI模型28分钟前更新 老高
5 0

Qwen3.8-LiveTranslate是一款由阿里通义千问于2026年9月推出的端到端实时同声传译大模型,主要用于边听边译的跨语言实时交流,字均延迟(LAAL)降至 2.3 秒、支持 60 种语言音频输入与 29 种语言语音输出,适用于跨国会议、跨境直播与视频本地化等场景。

基础信息内容
产品定位端到端实时同声传译大模型
出品方阿里通义千问(Qwen)
发布时间2026年9月18日
核心架构Hybrid MoE 的 Thinker–Talker 双模块
字均延迟2.3 秒(LAAL)
语言覆盖60 种语言输入 / 29 种语音输出
新增能力说话人分离、双语同帧、长上下文消歧
输入模态音频、视频 / 图像(辅助消歧)
模型编码qwen3.8-livetranslate-flash-realtime
接入方式DashScope WebSocket 实时 API
开源情况未开放权重,仅云端 API
Qwen3.8-LiveTranslate – 阿里通义推出的实时同声传译大模型

Qwen3.8-LiveTranslate 的核心能力

本代改动集中在一条主线上:把「还在听」和「已经在译」压进同一条流。这类端到端模型也是 AI 大模型 从通用能力走向垂直场景的典型落点。

Interleave 单流架构与 2.3 秒字均延迟

模型把同传重构为音频与文本交织的单流:已听到的音频与已生成的译文可缓存复用,不必每句从头重算。底层是基于 Hybrid MoE 的 Thinker–Talker 双模块——Thinker 把视频、音频、原文与译文编排进同一条因果序列并端到端产出;Talker 结合译文与源音频,合成保留原说话人音色的语音。官方给出的字均延迟(LAAL)为 2.3 秒。

实时说话人分离与音色复刻

多人交替发言时,模型先做说话人分离,把每句话归属到具体参与者,并据此为同一位说话人复刻音色。在覆盖 14 个语向的 Omnilingua-MSpeaker 评测中,其流式说话人分离错误率(DER)为 9.7%;译文语音不再是单一音色朗读,「谁在说」这条信息被保留了下来。

双语同帧输出与长上下文消歧

原文与译文在同一条交织序列中对齐生成,天然支持同帧输出:双语字幕、会议速记与内容检索都不必再做时间轴对齐。模型同时把历史对话纳入上下文,跨轮关联前文来确定当前译法,缓解专有名词与人名指代在长会话中前后不一致的问题。

60 种语言覆盖与视觉辅助输入

模型支持 60 种语言的音频输入与文本输出,其中 29 种可输出译文语音,其余语种返回文本。输入侧除音频外还可选传视频或图像帧,画面中的文字与手势可作为消歧线索,在嘈杂环境或同音词场景下补足声学信息。

Qwen3.8-LiveTranslate 与同类同声传译模型的对比

同传模型的取舍集中在延迟、翻译质量与多人长会话的一致性。以下对比数值取自千问官方发布材料的 FLEURS 评测图表(19 种语言、70 个语向),逐格列出。

对比维度Qwen3.8-LiveTranslateQwen3.5-LiveTranslateGPT-Realtime-TranslateGemini 3.5 Live Translate
开发方阿里通义千问阿里通义千问OpenAI谷歌
产品定位端到端同声传译模型上代实时语音翻译模型实时语音翻译与对话实时语音翻译与沟通
字均延迟(秒)2.32.52.83.1
翻译质量xCOMET-XXL 85.7xCOMET-XXL 83.0xCOMET-XXL 73.5xCOMET-XXL 65.2
语音识别ASR WER 6.6%ASR WER 7.0%未在对比项内未在对比项内
语音自然度UTMOS 4.0UTMOS 3.9UTMOS 3.4UTMOS 3.0

把四项指标放在一起看,Qwen3.8-LiveTranslate 在延迟、翻译质量、识别准确率与语音自然度上同时超过上一代:2.3 秒对 2.5 秒、xCOMET-XXL 85.7 对 83.0、ASR WER 6.6% 对 7.0%、UTMOS 4.0 对 3.9。拉开最大距离的是识别准确率——6.6% 的字错率比 73.5 分的 GPT-Realtime-Translate、65.2 分的 Gemini 3.5 Live Translate 低了十几个点,说明延迟下降未牺牲识别质量。多人长音频线上,9.7% 的流式 DER 也低于 GPT-4o-transcribe-diarize 的 18.0% 与Gemini-3.5-transcribe-preview 的 26.7%;后两者为离线系统,与流式口径不完全可比。

如果想了解同门在实时语音方向的其他路线,可参考 Qwen-Audio-3.0-Realtime(阿里通义推出的实时语音交互模型,主打端到端语音对话与低延迟响应)。两者都处理流式音频,区别在输出目标:本模型产出另一种语言的译文,它面向的则是同一语言内的对话。

Qwen3.8-LiveTranslate 的应用场景与适用人群

该模型面向有真实跨语言沟通压力的场景,价值集中在多人、长时间、需要即时反馈的会话里:

  • 跨国会议与商务谈判:多人交替发言时说话人分离能把每句话归属到参与者,译文语音保留各自音色,听感更接近真人同传。
  • 跨境直播与在线教育:原文与译文同帧输出,双语字幕可直接投屏,下游无需再做时间轴对齐。
  • 视频本地化与涉外服务:支持视频与图像输入,画面文字与手势可作消歧线索;长上下文消歧保证人名与术语前后一致。

适用人群:需要把跨语言沟通接进产品的工程与产品团队;跨国会议、跨境直播与涉外服务的运营方;以及正在做技术选型、需要实测同传延迟与质量基线的算法工程师。

Qwen3.8-LiveTranslate 的使用方法

模型提供在线体验与 API 两条路径,生产接入以流式会话为主:

  1. 在线体验:从 Qwen3.8-LiveTranslate 官方发布页 进入演示页,授权麦克风并选定源语言与目标语言,即可看到双语字幕与译文语音。
  2. 开通接口:在阿里云百炼(DashScope)控制台创建 API Key 与业务空间,确认可访问 qwen3.8-livetranslate-flash-realtime 模型。
  3. 建立 WebSocket 会话:连接 wss://{workspace_id}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime,用 session.updateinput_audio_format 设为 pcm,并选择 output_modalitiestexttext+audio
  4. 开启增强能力:在会话配置里打开源语言识别与说话人标识,服务端会在返回译文的同时给出说话人标记与原文,不必再单独调用 ASR。

会话结束前必须发送 session.finish,否则最后一段译文会丢失;音频输入默认 16 kHz、输出 24 kHz。

Qwen3.8-LiveTranslate 的价格与开源情况

Qwen3.8-LiveTranslate 通过阿里云百炼(DashScope)按实时会话计费,官方发布材料未给出统一价目,单价随地域与音频输入输出时长浮动,落地前建议以百炼控制台的实时计费页为准。译文语音输出比纯文本输出消耗更多额度,长会议与直播建议先小流量试跑,量出输入与输出的时长比例再决定是否开启语音输出。

权重方面,本代模型未开放下载,只提供云端 API 调用,模型编码为 qwen3.8-livetranslate-flash-realtime。实时同传强依赖服务端的流式调度与音频编解码链路,目前仍以闭源商用服务交付,需要私有化部署的团队需自行串联语音识别、翻译与语音合成三段链路。

Qwen3.8-LiveTranslate 的常见问题

Qwen3.8-LiveTranslate 的字均延迟是多少?

官方对比图表给出的平均 LAAL 为 2.3 秒,为同批对比模型中的最低值,且是在翻译质量同步提升的前提下取得的:其 xCOMET-XXL 为 85.7,高于 GPT-Realtime-Translate 的 73.5 与 Gemini 3.5 Live Translate 的 65.2。

Qwen3.8-LiveTranslate 怎么处理多人发言?

模型在翻译前先完成实时说话人分离,把每句话归属到具体说话人,再据此为每位说话人复刻音色生成译文语音。在覆盖 14 个语向的 Omnilingua-MSpeaker 评测中,其流式 DER 为 9.7%。

Qwen3.8-LiveTranslate 能本地部署吗?

不能。本代未开放模型权重,只能通过阿里云百炼(DashScope)的实时 API 调用。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章