Hugging Face Blog·· 2026-08-25AI 评分40
Hugging Face 提出 Quantization-Aware Healing:GPT-OSS 4-bit 模型性能超越全精度原版
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
AI 导读
Hugging Face 推出 Quantization-Aware Healing (QAH) 方法,使压缩至 60B 参数并量化为 MXFP4 的 GPT-OSS 120B 模型在 9 项基准测试中的 7 项上超越其 bfloat16 全精度版本。该方法通过直接从原始未压缩模型进行知识蒸馏,解决了结构压缩后传统恢复手段的性能瓶颈,实现了更小、更便宜且更准确的部署效果。
来源:Hugging Face Blog · huggingface.co