找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4781

积分

0

好友

619

主题
发表于 昨天 04:07 | 查看: 9| 回复: 0

混元Hy4 preview量化压缩数据对比图:1.5TB至214GB

压缩后模型在多个主流评测集上和原版持平。

9月1日中午,腾讯发布了其最新一代旗舰模型预览版本 Hy4 preview 的轻量版模型,将模型权重从 1.5TB 压缩到了 214GB ,压缩率高达 86% 。实际上,腾讯混元这次瞄准的是 MoE 模型量化这个老大难问题——架构越强,权重越大,本地部署的门槛也就越高。

腾讯混元的测试结果显示,压缩后的模型与 Hy4 preview 原始模型相比, 长文理解、多轮长上下文检索 和原版基本处于同一水平,数学有小幅回落。压缩后的模型能覆盖日常编程辅助、工具调用、长文档处理和常规问答等场景。

8月28日,腾讯发布并开源了 Hy4 preview,其公开的基准测试结果显示,在多个编程、智能体和科研基准测试中,Hy4 preview 的得分超过了 DeepSeek-V4-Pro-0824 等模型,排名位居开源模型第一梯队。

BF16原版与MIX-STQ1_0量化版游戏生成效果对比

▲BF16原版(左)和MIX-STQ1_0量化版(右)生成效果

MIX-STQ1_0 量化版在多个主流评测集上和 BF16 原版的差距都在一两分以内。长上下文评测集 MRCR、真实工具调用 Agent 评测 MCP-Atlas 等任务中 分差不到1分 ,整体领先 UD-IQ1_M 量化版本。

混元Hy4 preview量化模型主流评测集准确率对比

评测数据之外,还有一点值得注意:研究人员验证了异构硬件拼接跑大模型的可行性。即便不是整套同构硬件,开发者利用手边现有的异构设备,也能把旗舰级大模型跑通。

腾讯混元团队基于分布式集群推理框架 prima.cpp 进行了验证,在一台 4090 笔记本和一台四卡 A4000 服务器上,两端显存合计 80GB、内存合计 64GB,分处两个局域网,靠 prima.cpp 的异构调度把 MoE 层拆开分配,让计算和权重读取彼此重叠,最终将 214GB 的 Hy4 preview 轻量版模型协同跑到了 1.02 token/s ,比笔记本单机 offload 快了约 6 倍。

PRIMA.cpp部署Hy4 preview量化版界面截图

腾讯混元称,这次压缩模型权重而没有让性能大幅降低,靠的是两个核心技术: Sherry稀疏三值量化算法MIX-STQ1_0混合精度策略

Sherry稀疏三值量化算法:把最激进一档权重压到平均1.25比特

腾讯混元自研了 Sherry 稀疏量化算法,专门用来优化路由专家部分。这部分权重大、冗余多,正是压缩空间最大的地方。

Sherry 是一种三值量化方法。每四个权重为一组,一起量化成 {-1、0、+1},并强制每组里恰好 1 个为 0。这样每组有 32 种组合,可以用 5bit 索引编码,摊到每个权重平均 1.25bit。计入分块共享的缩放系数等额外开销,落到文件里的实际开销约 1.31bpw。

基于 Sherry,腾讯混元在 llama.cpp 里实现了 STQ1_0 推理内核,打通了从量化、推理到评测的完整链路。他们将 STQ1_0 和几种常见低比特格式放在同一算子上对比,STQ1_0 在比特数最低的同时,速度和 IQ1_M 基本持平,比 IQ1_S 更快。

Sherry稀疏三值量化方案对比分析图

▲各个算子速度展示

MIX-STQ1_0混合精度策略:按校准数据逐层决定比特压到多低

直接把全部层统一到同一量化档位,操作简单,但问题也显而易见——模型各层对压缩的耐受能力差异极大。社区主流的 UD-IQ1_M 方案,对绝大多数路由专家层统一采用 IQ1_M(1.75bpw)。腾讯混元团队在校准集上发现了一种更聪明的做法:与其一刀切,不如按敏感度逐层分档。敏感的层保留 IQ2_XXS(2.06bpw),不敏感的层用压缩更激进的 STQ1_0(1.31bpw)。这套逐层混合精度方案,就是 MIX-STQ1_0。

大模型量化里,分配精度这件事往往比单纯追求低比特更重要。不增加平均比特预算的前提下,这种逐层分档策略让整体量化误差更低。落到最终模型上,MIX-STQ1_0 的路由专家权重不光评测表现更好,还比 UD-IQ1_M 少占了超过 5GiB 的存储空间。

路由专家层比特分配对比图:MIX-STQ1_0 vs UD-IQ1_M

结语:腾讯混元给出 MoE 部署新思路,不再一刀切压缩模型

长期以来,MoE 模型凭借专家混合架构获得了更强的能力,但庞大的权重也带来了更高的显存门槛。很多高性能开源模型只能跑在高端集群上,普通开发者与中小企业很难本地部署。

腾讯混元此次针对 MoE 模型专家层参数分布特点做定制化压缩,不再简单地对全模型统一降比特,而是按照各层敏感度差异化分配精度,把模型压缩带来的性能损耗降到最低。这条路子或许能为超大 MoE 模型的轻量化落地提供新的参考。如果你平时也关注模型量化、推理部署这些话题,欢迎到云栈社区和更多开发者一起聊。




上一篇:VAST发布Tripo P2.0原生四边面模型,95后团队半年融资50亿
下一篇:三星HBM长协价仅为现货1/5 未来5年七成产能已锁定
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-3 20:08 , Processed in 1.087652 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表