Hugging Face 发布 KV Cache 量化功能以支持更长上下文生成
Hugging Face 在 Transformers 库中推出了 KV Cache 量化功能,通过降低键值缓存的精度来显著减少长文本生成的内存占用。该功能支持 int2、int4 和 int8 精度,其中 int4 量化在几乎不损失模型质量的情况下可实现约 2.5 倍的显存节省。
Hugging Face 在 Transformers 库中推出了 KV Cache 量化功能,通过降低键值缓存的精度来显著减少长文本生成的内存占用。该功能支持 int2、int4 和 int8 精度,其中 int4 量化在几乎不损失模型质量的情况下可实现约 2.5 倍的显存节省。
Intel 利用 OPEA 平台,结合 LangChain、BAAI/bge-base-en-v1.5 嵌入模型及 Redis,在 Granite Rapids CPU 和 Gaudi 2 加速器上部署企业级 RAG 应用。
Hugging Face 通过自定义推理处理器在 Inference Endpoints 上集成 Whisper ASR、Pyannote 说话人分离及推测解码。该方案利用 PyTorch 2.2 Flash Attention 加速,支持单 API 端点调用多模型组合。用户可配置助手模型以启用推测解码,需满足特定架构与 batch size=1 限制。
Gradio 推出 reload mode,通过 `gradio app.py` 启动即可在不重启服务器、不重新加载模型的情况下实时预览 UI 变更。该模式利用 `if gr.NO_RELOAD:` 标记保护模型加载逻辑,解决了传统开发中因重载导致的延迟问题。
Zama 利用 Hugging Face Endpoints 和自定义推理处理器,实现 Concrete ML 全同态加密(FHE)模型的云端一键部署。用户可通过 CPU 实例运行预编译模型,在数据加密状态下完成推理以保障隐私。该方案目前依赖 Python 3.10 环境,支持 scikit-learn、PyTorch 等框架的模型转换与调用。
Hugging Face 联合 Google Cloud 发布“Deploy on Google Cloud”集成,允许开发者通过 Vertex AI 或 GKE 将数千个基础模型部署为 API Endpoint。
Hugging Face 展示如何利用 🤗 Optimum Intel 将 SetFit 模型在 Intel Xeon CPU 上的推理速度提升 7.8 倍。该方案采用静态后训练量化(PTQ),仅需少量无标签校准数据即可降低内存占用并保留精度,无需重新训练。这为基于 Sentence Transformers 的少样本微调框架提供了生产级部署的高效路径。
Hugging Face 与 Cloudflare 合作推出 Deploy on Cloudflare Workers AI 集成,允许开发者通过无服务器 API 调用 Llama、Mistral 等开源模型。
Hugging Face 利用 Optimum Intel 库对 Microsoft Phi-2 模型进行 4-bit 量化,并在搭载 Core Ultra 7 155H CPU 的 Intel Meteor Lake 笔记本上成功运行。该方案结合硬件加速与小语言模型优势,实现了本地低延迟、高隐私的 LLM 推理体验。
Hugging Face 推出 Quanto,这是 Optimum 框架下的 PyTorch 量化后端。它支持 int2、int4、int8 和 float8 权重及激活,兼容 CUDA 与 MPS 设备,并集成于 transformers 库中。该工具旨在简化大语言模型及其他模态模型的量化流程,降低部署内存成本。
Hugging Face 演示如何利用 Optimum Intel 和 fastRAG 在 Xeon CPU 上加速 BGE 嵌入模型。通过量化等技术,该方案显著降低延迟并提升吞吐量,适用于 RAG 管道中的检索与重排序。BGE small、base 和 large 模型分别拥有 45M、110M 和 355M 参数,编码向量维度为 384/768/1024。
Hugging Face 演示如何利用 Optimum Habana v1.10.4 和自定义流水线类,在 Intel Gaudi 2 AI 加速器上高效运行 Llama 2(7b/13b/70b)模型。
Hugging Face 在 Text Generation Inference (TGI) v1.4.0 中推出 Messages API,提供与 OpenAI Chat Completion API 的兼容性,允许用户从 OpenAI 模型无缝迁移到开源 LLM。
推荐理由:TGI 1.4.0 新增兼容 OpenAI Chat Completion API 的 Messages API,支持通过修改 base_url 无缝切换至开源模型,并兼容 LangChain 和 LlamaIndex。
Hugging Face Text Generation Inference (TGI) 现已在 AWS Inferentia2 和 Amazon SageMaker 上正式可用。
Hugging Face 展示在 Intel 第四代 Xeon 处理器上,结合 8bit/4bit 量化与辅助生成技术,实现 StarCoder-15B 模型推理速度提升超 7 倍。该方案利用 SmoothQuant 算法进行 INT8 静态量化,使 TTFT 和 TPOT 分别获得约 2.19x 和 2.20x 的加速,且在 HumanEval 基准测试中保持无精度损失。
ONNX Runtime 通过 CUDA 和 TensorRT 执行提供程序显著加速 SD Turbo 和 SDXL Turbo 在 NVIDIA GPU 上的推理。测试显示其吞吐量相比 PyTorch 最高提升 229%,且支持 C# 和 Java 等非 Python 语言调用。用户可通过 Hugging Face 获取由 Olive 优化的模型版本以体验性能增益。
Hugging Face 发布教程指导用户将复杂的 ComfyUI 工作流转换为简单的 Gradio 应用,并部署在 Hugging Face Spaces 的 ZeroGPU 架构上以实现免费的无服务器运行。
推荐理由:原文提供了将 ComfyUI 工作流转换为 Gradio 应用并部署到 Hugging Face Spaces ZeroGPU 的完整步骤,读者可以据此实现免费服务器端推理。
Mistral AI 正式开放其首个平台服务 La Plateforme 的 beta 访问权限,旨在为开发者提供部署和定制开源生成模型的高效途径。该平台目前提供 mistral-tiny、mistral-small 和 mistral-medium 三个文本生成端点以及一个 embedding 端点,各端点在性能与价格上有所区分。
推荐理由:Mistral AI 开放平台 beta 服务,提供三个不同性能与价格权衡的生成端点及嵌入端点,并给出具体基准分数。
Hugging Face 宣布其 Transformers 库和 Text Generation Inference (TGI) 现已原生支持 AMD Instinct MI250 等 GPU,用户无需修改代码即可在 AMD 硬件上运行大语言模型。
推荐理由:原文展示了 AMD GPU 在无需修改代码的情况下运行 Hugging Face 模型的能力,并提供了与 NVIDIA A100 对比的性能基准数据。
Hugging Face 推出 Optimum-NVIDIA 推理库,旨在通过 NVIDIA TensorRT-LLM 和 FP8 格式大幅加速大语言模型推理。
Hugging Face 在 Hub Inference API 中实现了 LoRA 适配器的动态加载机制,通过将请求路由至共享的基础模型后端并即时切换轻量级适配器,使响应时间从 35s 降至 13s。该方案利用 Diffusers 库的 load/unload 功能,让数百个不同的 LoRA 模型仅需不到 5 张 A10G GPU 即可服务,显著降低了计算资源消耗。
Hugging Face 推出 optimum-neuron 工具,支持在 AWS Inferentia2 上部署 Llama 2 模型以加速文本生成。用户可通过 NeuronModelForCausalLM API 将 Llama-2-7b-hf 等模型编译导出至 Neuron 格式,并配置 num_cores、batch_size 及 sequence_length 参数优化推理性能。
Hugging Face 通过 Text Embeddings Inference (TEI) 支持在 Inference Endpoints 上部署开源嵌入模型。该方案针对 MTEB 榜单前 10 模型优化,在 Nvidia A10G 实例上实现 450+ req/sec 吞吐量,成本低至 $0.00156/1M tokens,比 OpenAI Embeddings 便宜 64 倍。
Hugging Face 官方博客发布指南,针对 Stable Diffusion XL (SDXL) 模型提供了一系列推理加速和显存优化方案。
ONNX Runtime 支持加速 Hugging Face 平台上超过 130,000 个模型,涵盖 BERT、GPT2 等 90 多种架构。以 whisper-tiny 为例,其推理平均延迟较 PyTorch 降低高达 74.30%。该工具通过优化性能助力大语言模型及云端模型的部署。
Hugging Face Diffusers 现已支持通过 JAX 在 Google Cloud TPU v5e 上运行 Stable Diffusion XL,实现高性能且低成本的推理。
Hugging Face 针对 Llama 2 在 Amazon SageMaker 部署开展基准测试,评估了 60 种配置下的延迟与吞吐量。该研究基于 Text Generation Inference (TGI) 容器,对比了 GPTQ 4-bit 量化及不同 EC2 实例性能,旨在为成本、低延迟和高吞吐场景提供最优部署建议。
Rocket Money 选择 Hugging Face Inference API 托管其 BERT 系列文本分类模型,以替代原有正则表达式系统处理每月超 1 亿笔交易。该方案解决了小团队缺乏 MLOps 专业知识的痛点,实现了动态扩展和低延迟推理。经过三个月评估,Hugging Face 凭借快速部署能力和合作伙伴支持成为最终选择。
Hugging Face 发布博客文章,系统介绍了大语言模型在生产环境中降低显存需求和提升推理效率的三大核心技术:低精度量化(8-bit/4-bit)、Flash Attention 算法以及针对长文本优化的模型架构(如 RoPE、ALiBi、MQA 和 GQA)。
推荐理由:原文通过代码实测对比了低精度量化、Flash Attention 及 MQA/GQA 架构在显存占用与推理速度上的具体差异,为 LLM 生产环境优化提供了可复用的技术选型依据。
Hugging Face Transformers 原生集成 bitsandbytes 和 auto-gptq 两种量化方案,分别适用于零样本推理/微调及高速文本生成。bitsandbytes 支持多模态模型且无需校准数据,但 4-bit 权重暂不支持序列化;auto-gptq 在文本生成上速度更快并支持 AMD GPU,但需数小时进行模型校准。
Fetch 通过迁移至 Amazon SageMaker 并集成 Hugging Face AWS Deep Learning Container,成功将其最慢扫描的机器学习处理延迟降低 50%,同时文档理解模型准确率提升 200%。该方案支持每周处理超过 8000 万张收据,利用多 GPU 实例和并行训练实现了高并发下的快速推理与规模化部署。
Hugging Face Hub 正式入驻 AWS Marketplace,用户现可通过 AWS 账户直接订阅并支付 Inference Endpoints、Spaces Hardware Upgrades 及 AutoTrain 等服务费用。该集成计费方式允许组织成员统一通过 AWS 账单结算,无需绑定信用卡,旨在降低企业采用 Llama 2、StarCoder 等大语言模型的技术门槛。
Hugging Face 发布教程,演示如何利用 Optimum 和 Accelerate 库优化基于 🤗 Transformers 的 Bark 文本转语音模型。该方案通过少量代码即可降低内存占用并提升推理速度,文中提供了针对 Bark small 检查点的基准测试结果及 Google Colab 示例。
BentoML 开源平台支持将 Hugging Face 上的 DeepFloyd IF 文本生成图像模型部署至生产环境。该流程涵盖定义模型、创建 Service、构建 Bento 及容器化部署,利用 T5-XXL-1.1 编码提示词并分三阶段在像素空间生成 1024x1024 px 图像。开发者可独立扩展各 Stage Runner 以优化 GPU 资源分配与推理性能。
Hugging Face 演示如何通过自定义 handler 在 Inference Endpoints 上部署 MusicGen。该流程支持文本生成音乐及可选旋律条件,适用于无原生 pipeline 的模型。用户需复制 facebook/musicgen-large 仓库并添加依赖文件即可实现一键部署。
Hugging Face 推出专为 Amazon SageMaker 设计的 LLM Inference Container,基于 Text Generation Inference (TGI) 实现高性能部署。
Hugging Face 结合 OpenVINO NNCF、Quantization-Aware Training (QAT) 及 Token Merging 技术,成功优化 Stable Diffusion 模型在 Intel CPU 上的推理效率。该方案实现了相比 PyTorch 5.1x 的推理加速与 4x 的模型体积缩减,显著降低了资源受限设备上的生成延迟。
Hugging Face 与 Microsoft 合作,在 Azure Machine Learning Studio 中原生集成 Hugging Face Hub Model Catalog。
Intel 利用 SmoothQuant-O3 技术将 OPT、LLaMA 等模型量化至 INT8,使模型体积缩小约 2x 且精度损失极小。该方案支持在单颗 Intel Sapphire Rapids CPU 上实现 MPT-7B-chat 的实时文本生成,显著降低推理延迟与硬件成本。
Hugging Face 演示如何在单张 AMD GPU 上通过 ROCm 平台运行 Vicuna 13B 模型。该模型拥有 130 亿参数,利用 GPTQ 技术进行 4-bit 量化后显著降低显存需求,并在 Instinct MI210 等硬件上完成部署验证。