跳到正文
原文
Hugging Face Blog·· 2026-08-10AI 评分40

Hugging Face 提出离线 Top-K Logits 与融合分块 KL 损失,大幅降低 LLM 知识蒸馏成本

Making Knowledge Distillation Cheap Enough to Run at Scale

AI 导读

Hugging Face 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型 top-100 logits 并融合分块计算 KL 损失,将蒸馏峰值显存从约 250GB 降至约 128GB。

来源:Hugging Face Blog · huggingface.co