腾讯混元团队正式发布Hy3模型的量化版本,大幅降低硬件部署门槛,仅需单张高端显卡即可在本地运行这一超大规模混合专家(MoE)模型。
Hy3是腾讯自研的混合专家架构旗舰模型,总参数量达到295B,原生推理时仅激活21B参数,支持256K超长上下文。该模型在代码生成、智能体调度与长文档理解等任务中的表现,可与参数规模更大的海外旗舰模型比肩。然而,其原始BF16权重文件高达598GB,硬件部署条件较为严苛。

为切实降低开发者使用成本,团队完成了梯度量化压缩,并推出三套适配不同场景的量化方案:
- 极限轻量化的IQ1_M(1bit)版本,权重体积仅85.5GiB,压缩幅度达6.7倍,单张96GB推理显卡即可完整承载,非常适合硬件资源受限的本地离线应用;
- Q4_K_M(4bit)量化包体积为169.9GiB,在双显卡环境下可稳定运行,模型输出精度接近原生完整版本;
- GPTQ Int4版本则原生适配vLLM推理框架,凭借高并发、低延迟的特点,主要面向企业线上API服务场景。

实测结果显示,本次发布的量化方案在显著压缩显存占用的同时,模型的核心能力衰减被控制在极低的水平。4bit版本的输出概率分布和Top-K选择与BF16原版基本保持一致,多语言代码生成、工具调用、长篇内容解读以及智能体任务评测成绩几乎未见明显下滑。
即便是压缩幅度最大的1bit版本,在长文本理解方面也近乎无损,代码和智能体任务性能仅小幅回落,完全可以胜任日常问答、文档处理、编程辅助等通用需求。这一表现有力回应了“低比特量化必然引发能力大幅衰退”的行业痛点。

为进一步优化本地交互的流畅度,腾讯专门开发了llama.cpp专属补丁,补齐了该框架对Hy3原生多令牌投机解码(MTP)机制的适配。开启MTP加速后,令牌接受率稳定维持在60%左右,1bit量化版本的解码速度提升约50%,4bit版本提速接近60%,有效缓解了本地大模型生成过程中常见的卡顿问题。
