Qwen3.8-Flash是阿里通义千问2026年8月推出的多模态MoE大模型,主要用于承载长上下文与多模态任务,主模型125B叠加51B N-gram Embedding、每token激活6B,原生262K上下文、可YaRN扩1M,适用于编码、办公及高并发API场景。
| 基础信息 | 内容 |
|---|---|
| 开发公司/团队 | 阿里通义千问团队 |
| 发布时间 | 2026年8月26日 |
| 产品定位 | 多模态MoE大模型,主打极致效率与编码办公强能力 |
| 主模型参数 | 125B(每token激活6B) |
| N-gram Embedding | 51B(可卸载到Host Memory) |
| 上下文长度 | 原生262K;YaRN扩展1M |
| API定价 | 每百万Tokens输入0.8元、输出2.7元、缓存命中0.1元 |
| 训练成本 | 约为Qwen3.7-Plus的1/9 |
| 同步动态 | 首发上线千问办公;提前释出Qwen3.8-Flash-Next作为Qwen4雏形 |

Qwen3.8-Flash的核心能力
Qwen3.8-Flash围绕四个方向系统升级:优化计算效率与训练稳定性,同时提升模型能力。既是可立即上线的主力API服务,也是Qwen4架构雏形的技术预告。
开发时间线
2026年8月26日20:36,阿里通义千问团队正式发布Qwen3.8-Flash,同日首发上线「千问办公」,并在HuggingFace与ModelScope释出Qwen3.8-Flash-Next开源权重,作为Qwen4系列模型的架构雏形。
GDN+QSA Hybrid注意力
Qwen3.8-Flash延续Qwen3.5混合架构:每4层中3层用Gated DeltaNet(GDN)压缩历史,1层保留全局Attention做精准检索。全局Attention层引入Qwen Sparse Attention(QSA),把序列聚合成micro-block后选出最相关区域执行Attention,降低长序列开销。1M上下文下QSA Prefill与Decode分别最高加速7.6×与4.9×;90% Prefix Cache命中时,1M Prefill吞吐达Qwen3.7-Plus的8.6倍。
Gated Residual、N-gram Embedding与Muon
Residual侧引入Gated Residual(GR),把Residual Stream扩展为4条并行分支并以动态Gate逐元素控制读写,支持FP8存储压低访存。Embedding侧引入N-gram Embedding,结合局部上下文查表为常见短语提供额外表示,51B参数可卸载到Host Memory并与计算重叠。优化方面以Muon Optimizer为主优化器,重新拟合Scaling Law后可稳定使用更大的Learning Rate与Batch Size。
Qwen3.8-Flash与主流模型的对比
| 对比维度 | Qwen3.8-Flash | DeepSeek-V4-Flash | Claude Opus 4.6 |
|---|---|---|---|
| 总参数量 | 125B+51B N-gram | 284B | 未公开 |
| 激活参数 | 6B | 13B | 未公开 |
| Agentic Coding(DeepSWE 1.1) | 58.7 | 54.4 | — |
| SWE-bench Pro | 62.5 | 56.0 | 53.4 |
| 长程办公(CoWorkBench) | 73.9 | 45.1 | 68.2 |
| 专业工作(JobBench) | 55.7 | 41.3 | 36.6 |
| 科学推理(GPQA Diamond) | 91.7 | 90.8 | 91.3 |
| 竞技编程(LiveCodeBench) | 91.9 | 90.6 | 88.8 |
| 指令遵循(IFBench) | 81.3 | 79.2 | 62.5 |
| 移动操控(AndroidWorld) | 84.5 | — | 62.0 |
| 长视频理解(LVBench) | 76.6 | — | 63.0 |
注:评测数据来源于Qwen3.8-Flash官方发布材料(2026年8月26日),”—”表示官方未提供该项数据;Qwen3.8-Flash-Next-Base在14项benchmark中拿下8项最优。
从官方数据可以看出,Qwen3.8-Flash以6B激活参数在编码、办公与多模态基准上全面领先两家顶流竞品:长程办公CoWorkBench领先DeepSeek-V4-Flash达28.8分,专业工作JobBench领先Claude Opus 4.6达19.1分,而训练成本仅约Qwen3.7-Plus的1/9。海外旗舰可参考Claude Opus 4.6,同系列智能体旗舰可参考Qwen 3.8-Max,与Qwen3.8-Flash形成效率/能力互补。
Qwen3.8-Flash的应用场景与适用人群
结合多模态MoE架构特性,Qwen3.8-Flash适合以下场景:
- 编码与办公任务:与「千问办公」深度集成,适合作为白领生产力工具底座
- 长上下文检索与摘要:1M上下文 + QSA长序列加速,适合文档/代码库检索与总结
- 高并发API经济模型:API定价低、训练成本仅Qwen3.7-Plus的1/9,适合大规模在线推理
适用人群:需要在效率与成本间平衡的API产品经理、长上下文架构师、多模态应用开发者,以及关注Qwen4演进的开源社区研究者。
如何使用Qwen3.8-Flash
Qwen3.8-Flash已在千问AI平台上线API,并同步首发千问办公;权重在HuggingFace与ModelScope发布。使用前需满足以下前提条件:
- 已注册千问AI平台账号并完成实名认证
- 稳定网络环境:能访问千问AI平台、HuggingFace、ModelScope
- 1M上下文API调用需留意token成本,按百万Tokens计费
满足以上条件后,按以下步骤开始使用:
- 访问千问AI平台:进入模型页
Qwen3.8-Flash详情页,查看API接入文档 - 申请API Key:在控制台创建API Key并妥善保存
- 选择调用方式:通过Python SDK、HTTP或OpenAI兼容接口发起请求
- 体验千问办公同步:在千问办公入口直接体验多模态办公能力
完整架构设计与训练方法可参考Qwen3.8-Flash官方博客。开发者也可下载Qwen3.8-Flash-Next开源权重在本地推理或微调。
Qwen3.8-Flash的价格与开源情况
Qwen3.8-Flash的API价格每百万Tokens输入0.8元、输出2.7元,缓存命中0.1元,是主流多模态MoE模型中性价比突出的档位。模型权重已开源,可在HuggingFace与ModelScope免费下载。
开源方面,Qwen3.8-Flash-Next作为Qwen4架构雏形被提前释出,让社区在正式Qwen4家族发布前对其进行检验。
Qwen3.8-Flash常见问题
Qwen3.8-Flash和Qwen3.7-Plus的区别是什么?
Qwen3.8-Flash主打极致效率与编码办公强能力,激活6B、训练成本约Qwen3.7-Plus的1/9,并引入GDN+QSA、Gated Residual、N-gram Embedding与Muon;Qwen3.7-Plus是Qwen3.7系列多模态智能体旗舰。
Qwen3.8-Flash支持多模态吗?
支持。结合文本、图像、音频等多模态信号进行推理与生成;千问办公场景已集成其多模态能力。
Qwen3.8-Flash的1M上下文是怎么实现的?
原生窗口262,144 token,可YaRN扩展至1M。模型引入QSA,在block级别选择最相关区域执行Attention,降低长序列开销。
Qwen3.8-Flash-Next和Qwen3.8-Flash是什么关系?
Qwen3.8-Flash-Next是下一代架构版本,被提前开源释出作为Qwen4系列模型的雏形;Qwen3.8-Flash是千问AI平台对外提供API服务的生产版本(默认1M上下文)。
Qwen3.8-Flash在哪可以体验?
可在千问AI平台模型页申请API Key调用,并通过千问办公使用多模态办公能力;开源权重在HuggingFace与ModelScope发布。
浙公网安备33010202004812号