Hy4 preview 轻量版 – 腾讯混元开源的旗舰模型压缩版本

AI模型3天前更新 智小研
32 0

Hy4 preview 轻量版是一款由腾讯混元于2026年9月推出的旗舰模型压缩版本,主要用于在消费级硬件上完成大模型的本地与离线推理,支持稀疏三值量化与混合精度部署,适用于数据敏感型企业、个人开发者与边缘端私有化场景。

发布时间2026年9月1日
开发方腾讯混元(Tencent Hunyuan)
量化方法Sherry 1.25-bit 稀疏三值量化 + MIX-STQ1_0
模型体积约 1.5 TB → 214 GB(减少约 86%)
支持框架Prima.cpp、llama.cpp 生态、vLLM
开源地址GitHub Tencent/AngelSlim、Hugging Face AngelSlim
Hy4 preview 轻量版 – 腾讯混元开源的旗舰模型压缩版本

Hy4 preview 轻量版核心能力

Sherry 1.25-bit 稀疏三值量化

轻量版的核心突破来自腾讯自研的 Sherry 量化算法,采用 1.25-bit 稀疏三值表示,配合 MIX-STQ1_0 混合精度策略,在极低比特下尽量保留原模型的分布特征。与同代闭源旗舰相比,阿里云的 Qwen 3.8-Max 走的是全量高参数路线,而 Hy4 轻量版选择在“可本地部署”上做文章,把原本只能在数据中心跑的 770B 级模型压到单卡可承载。

接近原版的任务表现

据腾讯 AngelSlim 官方仓库实测,轻量版在 SWE-bench Pro 上相比 BF16 原版仅下降约 0.7%,长程编码与工具调用能力基本保留;在公开的多步软件工程评测中,轻量版与全量版的差距被控制在个位数百分点内。这意味着开发者在消费级显卡上也能获得接近云端满血版的推理质量。在中文理解与多模态相关任务上,轻量版同样继承了 Hy4 preview 全量版的底座能力,日常对话、摘要与文档处理的可用度未受明显影响,适合作为私有化场景下的通用底座。

消费级硬件可部署

轻量版已提供 GGUF 格式并适配 Prima.cpp(基于 llama.cpp 生态)。官方给出的参考部署为笔记本 4090(32GB 内存、16GB 显存)或服务端 4×A4000,实测推理速度约 1.02 tokens/s;对于原型验证与离线场景,这样的门槛已显著低于动辄多卡集群的全量模型。

量化内核已回馈上游社区

轻量版采用的 STQ1_0(1.25-bit)量化内核已以 PR #22836 形式提交至 llama.cpp 上游,使用主流推理框架的开发者无需等待官方集成即可获得底层加速;Sherry 算法代码也以独立分支在 AngelSlim 仓库公开,便于研究者复现与改进。这种“先开源、再回馈上游”的节奏,显著降低了第三方框架适配 1.25-bit 权重的工程门槛,也让轻量版能更快被 Prima.cpp、vLLM 等生态吸收。

Hy4 preview 轻量版与全量版对比

维度Hy4 preview 轻量版GLM-5.3-FlashMuse Glimmer
开发方腾讯混元智谱(Zhipu AI)Meta Superintelligence Labs
模型定位旗舰模型的压缩版本,主打消费级硬件上的本地推理GLM-5 系列首个原生多模态开源模型,主打低成本长上下文面向本地常驻智能体的开源多模态模型
参数与体积全量版约 1.5TB 权重,压缩后约 214GB320B 总参数 / 18B 激活参数300 亿参数(dense,2B 视觉编码器 + 28B 文本解码器)
量化方式Sherry 1.25-bit 稀疏三值量化 + MIX-STQ1_0 混合精度未采用低比特量化,原生精度开源4-bit 量化后 20GB 以内单卡运行
运行门槛建议 16GB 显存与 32GB 内存支持全栈国产芯片推理,单 token 成本与英伟达 GPU 方案相当RTX 3090/4090、AMD 9700、24-32GB
上下文长度按官方指南配置原生 1M token131,000 token
开源协议开源(权重 + 量化工具链)已全球开源,HuggingFace 与 ModelScope 可下载Apache 2.0(可免费商用)

注:Hy4 preview 轻量版的体积与量化数据来自腾讯 AngelSlim 官方仓库;GLM-5.3-Flash 与 Muse Glimmer 的规格来自各自官方公布口径。三者定位不同,分数不可直接横向换算,仅供选型参照。

整体来看,Hy4 preview 轻量版把“私有化、离线、低成本”作为差异化卖点:GLM-5.3-Flash 以 1M 长上下文与极低 API 定价主打普惠,Muse Glimmer 则以 20GB 以内的单卡体积面向本地常驻智能体,三者分别对应“压出来的大模型”“原生高效模型”与“端侧小模型”三条路线。

Hy4 preview 轻量版的应用场景与适用人群

Hy4 preview 轻量版在以下场景具备直接价值:

  • 本地私有化部署:金融、医疗等数据不出域行业,可在内网显卡上跑满血级推理。
  • 边缘与离线推理:无稳定云连接的现场设备、巡检终端可做轻量大模型接入。
  • 研发与原型验证:个人开发者用单张 4090 即可体验 770B 级模型的能力边界。

适用人群: Hy4 preview 轻量版主要面向需要在本地或内网跑大模型的企业技术团队、对数据合规有要求的行业用户,以及想在消费级显卡上做实验的开发者与研究者在开源社区中,它降低了“拥有自己的旗舰模型”的硬件门槛。

如何使用 Hy4 preview 轻量版

轻量版以开源形式发布,可直接下载现成权重,也可从全量版自行量化。部署步骤如下:

  1. 下载权重:按 Hy4 preview 轻量版 官方仓库指引,从 Hugging Face 获取 AngelSlim/Hy4-preview-GGUF 对应量化版本的 GGUF 文件。
  2. 本地加载:使用 Prima.cpp 或 llama.cpp 载入 GGUF,按官方指南配置上下文长度与显存参数。
  3. 自行量化:如需从原版压缩,克隆 AngelSlim 仓库并安装依赖后执行量化脚本。
  4. 服务化部署:高并发场景用 vLLM 启动,指定模型路径与服务端口即可对外提供接口。

量化工具链与 vLLM 部署脚本均随 AngelSlim 仓库一并开源,消费级部署建议预留充足显存与内存。

Hy4 preview 轻量版的价格与开源情况

Hy4 preview 轻量版完全开源,权重(GGUF)、量化算法 Sherry 与部署工具链均在 GitHub(Tencent/AngelSlim)与 Hugging Face(AngelSlim)公开,开发者可免费下载、微调与商用,无需按调用量付费。这是它与闭源 API 路线最本质的区别:你买的是一次性的硬件,而不是持续的 token 账单。需要提醒的是,自部署会产生显卡与电力成本,且 1.02 tokens/s 的参考速度更适合离线批处理而非高并发在线服务。对于企业用户,腾讯未对权重商用设置额外授权费用,可纳入私有化交付链路;社区侧已出现基于 Prima.cpp 的部署示例与显存调优笔记,进一步降低了团队上手成本。在合规层面,完全离线运行的特性也让它适用于对数据出境有明确限制的行业场景。

关于 Hy4 preview 轻量版的常见问题

Hy4 preview 轻量版是怎么把 1.5TB 压到 214GB 的?

腾讯采用自研 Sherry 1.25-bit 稀疏三值量化,配合 MIX-STQ1_0 混合精度策略,在极低比特下保留分布特征,使体积减少约 86%。

本地部署需要什么硬件?

官方参考为笔记本 4090(32GB 内存、16GB 显存)或 4×A4000 服务端,最低建议 16GB 显存与 32GB 内存。若仅做更低比特量化推理,部分 24GB 显存显卡亦可勉强加载,但建议预留余量以保证上下文长度与稳定性。

和全量版比性能差多少?

据 AngelSlim 仓库实测,SWE-bench Pro 上相比 BF16 原版仅下降约 0.7%,长程编码与工具调用能力基本保留;在 Terminal-Bench 等多步任务上轻量版同样保持较高完成率,日常编码辅助场景下体感差异很小。

支持哪些推理框架?

提供 GGUF 格式,支持 Prima.cpp、llama.cpp 生态,服务端亦可用 vLLM 部署,STQ1_0 已向 llama.cpp 提交 PR;需要时可经 transformers/AutoModel 直接加载原版检查点做量化前的对照评测。

开源吗?能商用吗?

完全开源,权重与工具链免费获取,可下载、微调与商用;自部署仅需承担硬件与电力成本,无按量 API 费用。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章