Qwen3.8-Omni-Flash – 阿里千问推出的原生全模态大模型

AI模型2天前更新 老高
31 0

Qwen3.8-Omni-Flash是一款由阿里千问(通义千问)于2026年9月推出的原生全模态大模型,主要用于音视频理解、视频剪辑与会议纪要等端到端长程任务,支持文本、图像、音频、视频四模态原生输入与 1M 长上下文,适用于视频内容生产、会议效率与企业级音视频智能体等方向。

基础信息内容
产品定位原生全模态大模型
出品方阿里千问(通义千问)
发布时间2026年9月18日
底层架构Qwen3.8-Flash-Next
输入模态文本/图像/音频/视频(输出仅文本)
上下文窗口1M tokens(输入 991K / 输出 131K)
音频能力支持 2 通道与 4 通道空间音频
接入方式DashScope,兼容 OpenAI 协议
Qwen3.8-Omni-Flash – 阿里千问推出的原生全模态大模型

Qwen3.8-Omni-Flash 的核心能力

Qwen3.8-Omni-Flash 把文本、图像、音频、视频压进同一套原生架构,目标不再是「能看懂视频」,而是「能把视频里的活干完」。过去处理长视频要先用 ASR 转写、再抽帧做视觉理解、最后交给文本模型规划任务,三步之间信息大量流失;原生全模态让同一个模型同时听见和看见,判断「谁在什么时候说了什么」既依赖音频也依赖画面的口型与出镜状态,跨模态取证因此更稳。

原生全模态统一架构

模型在单一架构内联合建模四种模态,通过模态对齐编码与统一表示空间做跨模态理解,同时保持与同尺寸文本模型相当的能力。1M token 上下文让它能原生容纳数小时音视频,避免分段处理导致的信息割裂(同类做法可参考 Gemini Omni 1.1 Flash)——两小时的会议录像可整段输入,长程依赖任务的一致性更好。

Agentic 按需感知与多说话人取证

模型先粗粒度扫描定位候选片段,再细粒度调取音画内容核对,把 token 预算集中在真正相关的片段上,官方数据显示这让长视频理解的 token 消耗降低约 45.7%。多人交替发言、声音重叠时纯音频方案容易混淆说话人,模型联合建模画面与音频流辅助消解歧义,多说话人识别 AliMeeting DER 仅 3.4%,并支持 39 种中文方言。

长会议理解与端到端执行

模型原生支持一小时量级音视频输入,可端到端完成说话人切分、转录、身份对齐、纪要生成与待办执行,也能一句话完成短剧翻译的台词识别、口语化翻译、音色克隆配音与音轨重混;Video2Note 则把数小时视频转为带时间戳的图文 PDF 笔记。这类「感知—规划—执行」链路与 AI 智能体 的工作方式一致,差别在于输入侧从文本换成音视频。长视频推理仍非全面领先:音视频推理基准为 63.4,略低于 Gemini 3.8 Flash 的 65.2;同门的 Qwen3.8-Flash 在纯文本与图文任务上更划算。

Qwen3.8-Omni-Flash 与同类多模态模型的对比

对比维度Qwen3.8-Omni-FlashGemini 3.8 Flash
开发方阿里千问谷歌
模型定位原生全模态大模型原生全模态 Flash 模型
上下文窗口1M tokens1M tokens
音视频理解(DailyOmni)85.184.0
音视频推理(OmniVideo)63.465.2
多说话人识别(DER)3.4%72.6%
音频理解(MMAU)81.876.9
音频定位(SpotSound)67.239.7
音视频 Agent(WildClaw)71.058.9
音频输入成本较上代降超 98%定价明显更高

按官方逐项对比,Qwen3.8-Omni-Flash 的强项集中在音频与多说话人场景:多说话人识别 DER 3.4%,远优于 Gemini 3.8 Flash 的 72.6%;音频定位 67.2 对 39.7,音频理解 81.8 对 76.9,音视频理解 85.1 对 84.0,音视频 Agent 基准 71.0 对 58.9,均小幅或大幅领先。音频输入价较上代降超 98%,长音视频的成本大头在音频轨,降幅直接体现在账单上。代价是音视频推理 63.4 低于对手的 65.2,需要深度画面情节推理的任务对手更稳。选型上,会议录音、短剧译制、长视频解说、多说话人取证这类场景优先评估它。

如果需要了解音视频全双工方向的落地,可参考 SeedRealtime(字节跳动推出的音视频全双工大模型,主打实时双向的音视频对话);它偏重实时双向交互,Qwen3.8-Omni-Flash 偏重长音视频素材的理解与端到端交付,两者常串在同一条音视频自动化链路里。

Qwen3.8-Omni-Flash 的应用场景与适用人群

该模型面向以音视频为核心素材、需要端到端交付成果的场景,建议先从「素材已经存在、只差处理」的流程切入:

  • 视频内容生产:影视与短剧团队用它完成解说文案、译制配音与 MV 制作,把多道后期工序压成一次对话式交付。
  • 会议效率工具:上传一小时会议录像即可产出纪要、待办与执行项,适合需要留痕与分工的团队协作场景。
  • 学习知识沉淀:把发布会、课程等长视频转为带时间戳的图文笔记,方便检索、引用与二次整理。
  • 实时交互服务:实时口语陪练、智能客服与听声辨位等高时效场景,依赖其低延迟流式能力。

适用人群:影视与短视频内容团队、需要处理长会议与培训录像的企业、做音视频智能体的开发者,以及希望把音视频素材转为结构化知识的内容运营团队。只处理纯文本或纯图像的业务,同门的 Qwen3.8-Flash 性价比更高。

Qwen3.8-Omni-Flash 的使用方法

按使用深度不同,可从网页体验到 API 集成推进:

  1. 网页直接体验:打开千问 AI 平台搜索 qwen3.8-omni-flash,上传视频、音频或图片即可开始对话,适合先验证效果再决定是否接入。
  2. API 调用:在阿里云百炼控制台申请 DashScope 的 API Key,通过兼容 OpenAI 的接口调用,在 messages 中传入图片、音频、视频链接加文字问题即可。
  3. 接入 Agent 框架:在 Claude Code、Qwen Code 等工具中安装 Qwen-MM-Plugins,让现有 Agent 获得原生音视频感知与工作流执行能力。
  4. 按需选档:常规音视频理解直接用标准版;需要边说边出结果的实时场景,选用支持流式的 Realtime 变体以降低首包延迟。

建议先用免费额度跑通一条真实素材,再按调用量评估成本。会议与客服录音含个人信息,需按当地法规留存与脱敏。

Qwen3.8-Omni-Flash 的价格与开源情况

Qwen3.8-Omni-Flash 的 API 定价为输入 ¥0.8/百万 tokens、输出 ¥2.7/百万 tokens,缓存命中输入降至 ¥0.1/百万 tokens。结合官方披露的音视频输入降价超 98%、音频输入降价超 93%,长音视频批处理的单次成本较此前方案大幅下降;缓存命中价与输入价相差 8 倍,对反复引用同一段长素材的任务,把公共前缀放进缓存能显著压低账单。

模型本体通过 DashScope 以 API 形式提供,官方同步开源的 Qwen-MM-Plugins 为 Agent 框架提供按需感知与工具调用能力,可接入 Claude Code、OpenClaw 等主流框架;模型权重是否开放以官方后续公告为准。API 兼容 OpenAI 协议,已有调用代码的团队改造成本极低。

Qwen3.8-Omni-Flash 的常见问题

Qwen3.8-Omni-Flash 支持哪些输入模态?

支持文本、图像、音频、视频四种模态的原生输入,输出为纯文本。1M token 上下文可原生容纳数小时音视频,音频侧支持 2 通道与 4 通道空间音频解析。

Qwen3.8-Omni-Flash 与 Qwen3.8-Flash 有什么区别?

Qwen3.8-Flash 侧重图文理解与通用任务;Qwen3.8-Omni-Flash 是新一代原生全模态模型,在音频与视频理解上做了原生支持,并强化了音视频到交付物的端到端能力。

Qwen3.8-Omni-Flash 能处理多长的视频?

最大输入 991K tokens、最大输出 131K tokens,可原生容纳数小时音视频,无需分段即可保持整体连贯性;实际时长受码率与分辨率影响,建议按自己素材折算量做压测。

Qwen3.8-Omni-Flash 在哪些基准上领先?

按官方对比口径,多说话人识别 DER 仅 3.4%、音频理解 MMAU 为 81.8、音视频 Agent 基准 71.0,均领先 Gemini 3.8 Flash;在音视频推理 63.4 对 65.2 上仍有差距。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章