跳到正文
原文
Hugging Face Blog·· 2026-08-10AI 评分49

Hugging Face 解析如何降低知识蒸馏成本以支持规模化实验

Making Knowledge Distillation Cheap Enough to Run at Scale

AI 导读

Hugging Face 展示离线缓存教师模型输出与融合分块 KL 损失如何降低知识蒸馏成本,让单 GPU 长上下文能力恢复训练成为可能。该方法缓存每个位置的 top-100 logits,训练时无需加载教师模型;融合分块计算避免构建完整词表与序列矩阵,示例中显存峰值从约 250GB 降至约 128GB。

来源:Hugging Face Blog · huggingface.co