GLM-5.3-FlashX是一款由智谱(Zhipu AI)于2026年9月18日推出的高速推理多模态大模型,主要用于企业智能客服、实时 AI 对话与知识库问答等高并发场景,峰值输出速度达 200 tokens/s、较 GLM-5.3-Flash 提升 5 倍,沿用 1M 长上下文与原生多模态架构,适用于高频调用、实时交互与批量内容生成等方向。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 高速推理多模态大模型 |
| 出品方 | 智谱(Zhipu AI) |
| 发布时间 | 2026年9月18日 |
| 底层基座 | GLM-5.3-Flash(320B/18B) |
| 峰值输出速度 | 200 tokens/s |
| 输入模态 | 文本、图像、视频、文件 |
| 上下文窗口 | 1M tokens(最大输出 128K) |
| 模型编码 | glm-5.3-flashx |
| 定价口径 | GLM-5.3-Flash 的 2.5 倍 |

GLM-5.3-FlashX 的核心能力
GLM-5.3-FlashX 是一次单一变量的迭代:基座智能不变,把推理速度拉满。智能水平与多模态理解均与 GLM-5.3-Flash 一致,AA 综合智能指数 57 分进入全球前沿区间。对 Agent 类产品来说,每轮交互省下的两三秒会随轮次累积,长链路任务的体验差异尤其明显。
5 倍推理提速与 200 tokens/s
峰值输出速度达 200 tokens/s,相较 GLM-5.3-Flash 提升 5 倍,流式输出更连贯,长文本生成、实时对话、代码续写与知识库问答的卡顿与拖尾问题明显缓解。提速依托 10 万张国产芯片组成的推理集群,在 SGLang 基础上构建专用推理引擎,配合节点内张量并行、ReplaySSM、W8A8 量化与混合缓存量化等手段实现。
混合注意力与 1M 长上下文
基座是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型:线性注意力递归捕获局部依赖,稀疏注意力通过轻量索引器召回全局上下文,IndexPool 把 4 个缓存向量压缩为 1 个。相比 GLM-5.3,注意力计算量与 KV 缓存分别降低 3.01 倍与 4.44 倍,这是长上下文成本得以压缩的架构前提。
原生多模态与视觉 Coding 循环
视觉能力原生融入 Coding 循环,模型能主动观察界面、渲染结果与交互反馈并持续改进,在代码、浏览器与图形界面之间协同完成任务。输入侧支持文本、图像、视频与文件,输出为纯文本,配合 1M 上下文可把设计稿、长文档与多轮对话一并纳入。模型还可自主拆解目标、调用工具并交付 PPTX、PDF、DOCX 等成品,这一路径与 AI 智能体 的执行范式一致。
RSI 递归自我改进闭环
本次升级落地了智谱 RSI 递归自我改进的工程实践,让模型能力反哺推理优化与算力调优。
GLM-5.3-FlashX 与同类高速模型的对比
| 对比维度 | GLM-5.3-FlashX | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|---|
| 开发方 | 智谱 AI | 智谱 AI | 阿里千问 |
| 模型定位 | 高速推理多模态模型 | 低成本多模态基座 | 多模态 MoE 通用大模型 |
| 总参/激活 | 320B / 18B | 320B / 18B | 125B / 6B |
| 峰值输出速度 | 200 tokens/s | 约 40 tokens/s | 未公开 |
| 上下文窗口 | 1M tokens | 1M tokens | 1M tokens |
| 输入模态 | 文本/图像/视频/文件 | 文本/图像/视频/文件 | 文本/图像/视频 |
| AA 智能指数 | 57 分 | 57 分 | 未公开 |
| 定价口径 | Flash 的 2.5 倍 | 基线(GLM-5.3 的 1/10) | ¥0.8/百万 tokens 输入 |
| 核心取舍 | 用涨价换时延 | 用低价换成本 | 综合性价比 |
GLM-5.3-FlashX 与基座的智能水平完全一致(AA 智能指数同为 57 分),差别只在速度与价格:速度提升 5 倍,定价上浮到原版 2.5 倍。换成单位成本的视角,这等于用 2.5 倍单价买 5 倍吞吐,在并发压力下设备占用与排队时长都会下降,对按响应时间收费或强依赖实时体验的产品更划算;而低频、批处理与成本敏感的测试场景,原版 Flash 仍是更优解。与 Qwen3.8-Flash 相比两者路线相反——后者以 ¥0.8/百万 tokens 的输入价主打成本。注:以上倍率口径来自智谱官方发布,官方文档未披露绝对价目,故此处不作数值换算。
如果需要了解智谱在高速推理方向的前代产品,可参考 GLM-5.1-highspeed(智谱 AI 推出的 GLM-5.1 高速推理模型,曾把输出速度拉到 400 tokens/s 级别,面向低延迟 Agent 与实时交互);GLM-5.3-FlashX 是它在 GLM-5.3 基座上的延续,能力代际更新,两者可直接对比不同版本的速度与单价口径。
GLM-5.3-FlashX 的应用场景与适用人群
该模型面向对响应速度有刚需、且调用量已形成规模的企业场景,建议先按流量分层再切换:
- 企业智能客服:高并发来电与在线会话下,首字与整段输出的等待时间直接决定体验,200 tokens/s 能显著缩短排队感。
- 实时 AI 对话:语音助手、陪练与实时问答等场景对延迟敏感,流式输出连贯性比单次回答质量更影响留存。
- 批量内容生成:营销文案、商品描述与报告批处理时,吞吐提升可减少并发实例数,压低整体资源占用。
- 知识库问答与 Agent:1M 上下文配合提速,长链路多轮任务的累积时延下降,复杂软件工程与自动化流程更顺。
适用人群:已跑通产品、需要控制响应时延的 AI 产品与工程团队;智能体与自动化流程的开发者;客服、内容与知识管理方向的解决方案架构师。仍处在验证阶段的团队建议先用原版 Flash 控成本,确认时延确为瓶颈后再切 FlashX。
GLM-5.3-FlashX 的使用方法
模型 API 已全面开放,按以下步骤接入:
- 开通平台账号:在 智谱 BigModel 开放平台注册并创建 API Key,确认可访问 Z.ai 与 HuggingFace。
- 调用模型:模型编码使用 glm-5.3-flashx,文本参数与 GLM-5.3 一致;图片在 messages[].content[] 中添加 type: image_url 内容块传入 URL 或 Base64。
- 按推荐参数配置:temperature 建议 1、top_p 0.95、reasoning_effort 设为 max;thinking.type 仅支持 enabled,并保持 thinking.clear_thinking 为 false。
- 开启流式与工具流:实时场景建议同时打开 stream: true 与 tool_stream: true,才能拿到完整的流式输出与工具调用体验。
切换前建议用自有流量做 A/B:同一批请求分别走 Flash 与 FlashX,对比 P95 时延与单位成本后再决定分层比例。
GLM-5.3-FlashX 的价格与开源情况
GLM-5.3-FlashX 的调用定价为 GLM-5.3-Flash 原版本的 2.5 倍。智谱未将其包装为降价,而是明确按「高推理速度 + 高并发稳定性 = 更高调用成本」定价:提速 5 倍后单秒处理能力与并发承载大幅跃升,因此面向的是高并发商用场景,而非轻量化低成本测试。官方文档尚未披露绝对价目,选型时建议按自家 token 结构实测两种版本的单次请求成本。
FlashX 是 Flash 基座的服务化提速版本,模型权重仍由 GLM-5.3-Flash 承担开源角色,可在 HuggingFace 与 ModelScope 下载;FlashX 通过 BigModel 与 Z.ai 提供 API。基座的开源属性叠加全栈国产芯片推理,使本地化部署的单 token 成本可与主流英伟达 GPU 方案相当。
GLM-5.3-FlashX 的常见问题
GLM-5.3-FlashX 和 GLM-5.3-Flash 有什么区别?
基座智能完全一致(AA 智能指数同为 57 分),差别在速度与价格:FlashX 峰值输出 200 tokens/s、提升 5 倍,定价为原版的 2.5 倍,适合用涨价换时延的高并发场景。
GLM-5.3-FlashX 支持哪些输入模态?
支持文本、图像、视频与文件输入,输出为纯文本。上下文窗口 1M tokens、最大输出 128K,文本参数与 GLM-5.3 保持一致。
GLM-5.3-FlashX 的模型编码是什么?
模型编码为 glm-5.3-flashx,通过智谱 BigModel 开放平台调用。建议参数为 temperature 1、top_p 0.95、reasoning_effort max。
GLM-5.3-FlashX 值得为速度多付 2.5 倍吗?
取决于时延是否真为瓶颈。单位成本视角下是用 2.5 倍单价换 5 倍吞吐,并发压力大、按响应时间收费的产品更划算;低频批处理与测试场景用原版 Flash 更省。
浙公网安备33010202004812号