跳到正文
原文
Hugging Face Blog·· 2024-05-16AI 评分51

Hugging Face 发布 KV Cache 量化功能以支持更长上下文生成

Unlocking Longer Generation with Key-Value Cache Quantization

AI 导读

Hugging Face 在 Transformers 库中推出了 KV Cache 量化功能,通过降低键值缓存的精度来显著减少长文本生成的内存占用。该功能支持 int2、int4 和 int8 精度,其中 int4 量化在几乎不损失模型质量的情况下可实现约 2.5 倍的显存节省。

来源:Hugging Face Blog · huggingface.co