【科技纵览】9月1日,腾讯混元正式对外发布了Hy4 preview轻量级版本。这一举措标志着大模型在端侧部署与资源受限场景下的应用门槛被进一步降低。该版本的核心突破在于模型权重的极致压缩,通过两项自研技术,将原本接近1.5TB的庞大体量缩减至约214GB。
其中,Sherry稀疏三值量化算法发挥了关键作用,它将最激进档位的权重平均压低至1.25比特。与此同时,MIX-STQ1_0混合精度策略则根据各层敏感度动态分配比特数,在维持同等平均比特预算的前提下,有效降低了量化误差。尽管体积大幅缩水,但其在长文理解、多轮长上下文检索等主流评测任务上的表现,与原始版本基本持平,能力稳定性得以保障。
更值得关注的是其异构设备联合推理方案的验证成果。在一台搭载RTX 4090显卡的笔记本与一台配备四张A4000显卡(显存合计80GB、内存64GB)的服务器之间,系统通过调度拆分MoE层进行协同运行。实测数据显示,这种组合的运行速度达到1.02 token/s,相比笔记本单机offload模式提升了约6倍。目前,相关的量化GGUF库及代码已同步开源。腾讯方面指出,这为那些拥有异构设备或资源有限的开发者,提供了一条运行旗舰大模型的新路径。从行业视角看,这种“云边端”协同的轻量化思路,或许正是打破算力垄断、推动大模型普惠化的关键一步。
腾讯混元Hy4预览版发布:权重压缩至214GB,开源异构推理方案
科技区角
2026-09-01 13:30
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。