Hugging Face Blog·· 2026-08-10AI 评分42
Hugging Face 提出高效知识蒸馏方案,大幅降低 LLM 训练显存需求
Making Knowledge Distillation Cheap Enough to Run at Scale
AI 导读
Hugging Face 推出离线 Top-K Logits 缓存与融合分块 KL 损失技术,解决大模型知识蒸馏的高显存痛点。该方法避免同时加载教师与学生模型及构建全词表矩阵,将单步训练峰值显存从约 250GB 降至 128GB。这一优化使长上下文修复可在单张 GPU 上运行,显著降低了大规模实验的成本门槛。
来源:Hugging Face Blog · huggingface.co