腾讯混元开源Hy4轻量版,214GB模型实现异构设备协同推理

科技区角 2026-09-01 15:00

【区角快讯】9月1日,腾讯混元正式对外发布并开源了Hy4 preview的轻量量化版本。此前,该模型原版BF16权重体积高达1.5TB,因本地部署对硬件要求极为苛刻,社区反馈强烈。为此,腾讯混元团队利用自研压缩技术,成功将模型体积缩减至约214GB,显著降低了运行门槛。

此次压缩主要依托两项核心自研技术:Sherry稀疏三值量化算法与MIX-STQ1_0混合精度策略。其中,Sherry算法将每4个权重组量化为{-1、0、+1},每组固定一个零值,平均每个权重仅占1.25比特,计入额外开销后实际约为1.31bpw。目前,llama.cpp已实现STQ1_0推理内核,其速度对标IQ1_M,且优于IQ1_S。

值得注意的是,MIX-STQ1_0策略打破了全层统一比特的传统做法。它依据校准数据判断各层敏感度,敏感层采用IQ2_XXS,不敏感层则使用更激进的STQ1_0。这一策略在未增加平均比特开销的前提下,有效降低了量化误差,相比UD-IQ1_M方案还能节省超过5GB的存储空间。

性能评测数据显示,压缩后的模型在长文理解及长上下文检索能力上与原版基本持平。虽然数学能力出现小幅回落,但编码、工具调用、文档处理及常规问答等核心能力均得到完整保留,整体表现优于UD-IQ1_M量化版本。

此外,团队还验证了异构设备联合推理方案的可行性。借助prima.cpp的调度能力,一台配备4090显卡的笔记本与四卡A4000服务器跨局域网协同工作,显存与内存合计144GB,成功跑通了214GB的大模型。实测推理速度达到1.02 token/s,比笔记本单机offload模式快了6倍。这证明开发者无需采购整套同构高端硬件,利用手头多台异构设备拼接即可运行该模型。

目前,量化后的GGUF权重、基础模型以及AngelSlim代码仓库已在HuggingFace与GitHub平台全面开源,开发者可自行下载并进行部署测试。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
HuggingFace被曝卖身英伟达:129亿美元!全球最大AI开源平台改姓黄
智谱GLM-5.3-Flash开源:国产算力扛鼎,价格击穿底线
澳洲警方突袭TeamPCP黑客团伙,开源供应链安全再拉警报
智谱入驻天猫卖“算力”,开源模型曾霸榜海外
20ms把PDF变成Markdown!开源OCR神器快了近300倍
智谱GLM-5.3-Flash开源:国产芯片支撑,性价比重塑多模态格局
刚刚,DeepSeek-V4多模态模型开源
突发|黄仁勋867亿元收购Hugging Face,拿下全球最大AI开源平台
苏州再添省级创新引擎!RISC-V创新中心入选首批江苏开源生态平台
活动回顾 | 从系统安装到开源贡献,openEuler Workshop 香港站带你走进开源实践
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号