跳到正文
原文
Hugging Face Blog·· 2026-08-25AI 评分47

Quantization-Aware Healing:让压缩后的 4-bit 模型超越其全精度版本

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

AI 导读

Quantization-Aware Healing(QAH)使压缩至 60B 的 GPT-OSS 120B 模型在量化为 MXFP4 后,在 9 项基准中的 7 项超越同架构的 bfloat16 恢复版本。QAH 直接从压缩前的原始模型蒸馏,而非从恢复后的检查点蒸馏,避免受后者精度上限约束。

来源:Hugging Face Blog · huggingface.co