【区角快讯】9月1日,腾讯混元正式对外发布并开源了Hy4 preview的轻量量化版本。此前,该模型原版BF16权重体积高达1.5TB,因本地部署对硬件要求极为苛刻,社区反馈强烈。为此,腾讯混元团队利用自研压缩技术,成功将模型体积缩减至约214GB,显著降低了运行门槛。
此次压缩主要依托两项核心自研技术:Sherry稀疏三值量化算法与MIX-STQ1_0混合精度策略。其中,Sherry算法将每4个权重组量化为{-1、0、+1},每组固定一个零值,平均每个权重仅占1.25比特,计入额外开销后实际约为1.31bpw。目前,llama.cpp已实现STQ1_0推理内核,其速度对标IQ1_M,且优于IQ1_S。
值得注意的是,MIX-STQ1_0策略打破了全层统一比特的传统做法。它依据校准数据判断各层敏感度,敏感层采用IQ2_XXS,不敏感层则使用更激进的STQ1_0。这一策略在未增加平均比特开销的前提下,有效降低了量化误差,相比UD-IQ1_M方案还能节省超过5GB的存储空间。
性能评测数据显示,压缩后的模型在长文理解及长上下文检索能力上与原版基本持平。虽然数学能力出现小幅回落,但编码、工具调用、文档处理及常规问答等核心能力均得到完整保留,整体表现优于UD-IQ1_M量化版本。
此外,团队还验证了异构设备联合推理方案的可行性。借助prima.cpp的调度能力,一台配备4090显卡的笔记本与四卡A4000服务器跨局域网协同工作,显存与内存合计144GB,成功跑通了214GB的大模型。实测推理速度达到1.02 token/s,比笔记本单机offload模式快了6倍。这证明开发者无需采购整套同构高端硬件,利用手头多台异构设备拼接即可运行该模型。
目前,量化后的GGUF权重、基础模型以及AngelSlim代码仓库已在HuggingFace与GitHub平台全面开源,开发者可自行下载并进行部署测试。
腾讯混元开源Hy4轻量版,214GB模型实现异构设备协同推理
科技区角
2026-09-01 15:00
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。