Qwen3.8-Flash – 阿里通义千问推出的多模态MoE大模型

AI模型16小时前更新 智小研
17 0

Qwen3.8-Flash是阿里通义千问2026年8月推出的多模态MoE大模型,主要用于承载长上下文与多模态任务,主模型125B叠加51B N-gram Embedding、每token激活6B,原生262K上下文、可YaRN扩1M,适用于编码、办公及高并发API场景。

基础信息内容
开发公司/团队阿里通义千问团队
发布时间2026年8月26日
产品定位多模态MoE大模型,主打极致效率与编码办公强能力
主模型参数125B(每token激活6B)
N-gram Embedding51B(可卸载到Host Memory)
上下文长度原生262K;YaRN扩展1M
API定价每百万Tokens输入0.8元、输出2.7元、缓存命中0.1元
训练成本约为Qwen3.7-Plus的1/9
同步动态首发上线千问办公;提前释出Qwen3.8-Flash-Next作为Qwen4雏形
Qwen3.8-Flash – 阿里通义千问推出的多模态MoE大模型

Qwen3.8-Flash的核心能力

Qwen3.8-Flash围绕四个方向系统升级:优化计算效率与训练稳定性,同时提升模型能力。既是可立即上线的主力API服务,也是Qwen4架构雏形的技术预告。

开发时间线

2026年8月26日20:36,阿里通义千问团队正式发布Qwen3.8-Flash,同日首发上线「千问办公」,并在HuggingFace与ModelScope释出Qwen3.8-Flash-Next开源权重,作为Qwen4系列模型的架构雏形。

GDN+QSA Hybrid注意力

Qwen3.8-Flash延续Qwen3.5混合架构:每4层中3层用Gated DeltaNet(GDN)压缩历史,1层保留全局Attention做精准检索。全局Attention层引入Qwen Sparse Attention(QSA),把序列聚合成micro-block后选出最相关区域执行Attention,降低长序列开销。1M上下文下QSA Prefill与Decode分别最高加速7.6×与4.9×;90% Prefix Cache命中时,1M Prefill吞吐达Qwen3.7-Plus的8.6倍。

Gated Residual、N-gram Embedding与Muon

Residual侧引入Gated Residual(GR),把Residual Stream扩展为4条并行分支并以动态Gate逐元素控制读写,支持FP8存储压低访存。Embedding侧引入N-gram Embedding,结合局部上下文查表为常见短语提供额外表示,51B参数可卸载到Host Memory并与计算重叠。优化方面以Muon Optimizer为主优化器,重新拟合Scaling Law后可稳定使用更大的Learning Rate与Batch Size。

Qwen3.8-Flash与主流模型的对比

对比维度Qwen3.8-FlashDeepSeek-V4-FlashClaude Opus 4.6
总参数量125B+51B N-gram284B未公开
激活参数6B13B未公开
Agentic Coding(DeepSWE 1.1)58.754.4
SWE-bench Pro62.556.053.4
长程办公(CoWorkBench)73.945.168.2
专业工作(JobBench)55.741.336.6
科学推理(GPQA Diamond)91.790.891.3
竞技编程(LiveCodeBench)91.990.688.8
指令遵循(IFBench)81.379.262.5
移动操控(AndroidWorld)84.562.0
长视频理解(LVBench)76.663.0

注:评测数据来源于Qwen3.8-Flash官方发布材料(2026年8月26日),”—”表示官方未提供该项数据;Qwen3.8-Flash-Next-Base在14项benchmark中拿下8项最优。

从官方数据可以看出,Qwen3.8-Flash以6B激活参数在编码、办公与多模态基准上全面领先两家顶流竞品:长程办公CoWorkBench领先DeepSeek-V4-Flash达28.8分,专业工作JobBench领先Claude Opus 4.6达19.1分,而训练成本仅约Qwen3.7-Plus的1/9。海外旗舰可参考Claude Opus 4.6,同系列智能体旗舰可参考Qwen 3.8-Max,与Qwen3.8-Flash形成效率/能力互补。

Qwen3.8-Flash的应用场景与适用人群

结合多模态MoE架构特性,Qwen3.8-Flash适合以下场景:

  • 编码与办公任务:与「千问办公」深度集成,适合作为白领生产力工具底座
  • 长上下文检索与摘要:1M上下文 + QSA长序列加速,适合文档/代码库检索与总结
  • 高并发API经济模型:API定价低、训练成本仅Qwen3.7-Plus的1/9,适合大规模在线推理

适用人群:需要在效率与成本间平衡的API产品经理、长上下文架构师、多模态应用开发者,以及关注Qwen4演进的开源社区研究者。

如何使用Qwen3.8-Flash

Qwen3.8-Flash已在千问AI平台上线API,并同步首发千问办公;权重在HuggingFace与ModelScope发布。使用前需满足以下前提条件:

  • 已注册千问AI平台账号并完成实名认证
  • 稳定网络环境:能访问千问AI平台、HuggingFace、ModelScope
  • 1M上下文API调用需留意token成本,按百万Tokens计费

满足以上条件后,按以下步骤开始使用:

  1. 访问千问AI平台:进入模型页 Qwen3.8-Flash 详情页,查看API接入文档
  2. 申请API Key:在控制台创建API Key并妥善保存
  3. 选择调用方式:通过Python SDK、HTTP或OpenAI兼容接口发起请求
  4. 体验千问办公同步:在千问办公入口直接体验多模态办公能力

完整架构设计与训练方法可参考Qwen3.8-Flash官方博客。开发者也可下载Qwen3.8-Flash-Next开源权重在本地推理或微调。

Qwen3.8-Flash的价格与开源情况

Qwen3.8-Flash的API价格每百万Tokens输入0.8元、输出2.7元,缓存命中0.1元,是主流多模态MoE模型中性价比突出的档位。模型权重已开源,可在HuggingFace与ModelScope免费下载。

开源方面,Qwen3.8-Flash-Next作为Qwen4架构雏形被提前释出,让社区在正式Qwen4家族发布前对其进行检验。

Qwen3.8-Flash常见问题

Qwen3.8-Flash和Qwen3.7-Plus的区别是什么?

Qwen3.8-Flash主打极致效率与编码办公强能力,激活6B、训练成本约Qwen3.7-Plus的1/9,并引入GDN+QSA、Gated Residual、N-gram Embedding与Muon;Qwen3.7-Plus是Qwen3.7系列多模态智能体旗舰。

Qwen3.8-Flash支持多模态吗?

支持。结合文本、图像、音频等多模态信号进行推理与生成;千问办公场景已集成其多模态能力。

Qwen3.8-Flash的1M上下文是怎么实现的?

原生窗口262,144 token,可YaRN扩展至1M。模型引入QSA,在block级别选择最相关区域执行Attention,降低长序列开销。

Qwen3.8-Flash-Next和Qwen3.8-Flash是什么关系?

Qwen3.8-Flash-Next是下一代架构版本,被提前开源释出作为Qwen4系列模型的雏形;Qwen3.8-Flash是千问AI平台对外提供API服务的生产版本(默认1M上下文)。

Qwen3.8-Flash在哪可以体验?

可在千问AI平台模型页申请API Key调用,并通过千问办公使用多模态办公能力;开源权重在HuggingFace与ModelScope发布。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章