跳到正文

#教程/实践

今日 6 条
12月11日周一
  1. Hugging Face Blog55

    Hugging Face 详解混合专家模型(MoE)原理与工程实践

    Hugging Face 发布博客详细解析混合专家模型(MoE),涵盖其稀疏性机制、负载均衡策略及在 Transformer 中的应用。文章对比了 Switch Transformers 等经典工作,探讨了 MoE 在预训练效率、微调稳定性及显存占用方面的权衡,并介绍了专家并行、容量因子优化及量化蒸馏等工程落地技术。

12月5日周二
  1. Hugging Face Blog55

    Hugging Face 详解如何通过动态加载 LoRA 将推理速度提升 300%

    Hugging Face 在 Hub Inference API 中实现了 LoRA 适配器的动态加载机制,通过将请求路由至共享的基础模型后端并即时切换轻量级适配器,使响应时间从 35s 降至 13s。该方案利用 Diffusers 库的 load/unload 功能,让数百个不同的 LoRA 模型仅需不到 5 张 A10G GPU 即可服务,显著降低了计算资源消耗。

11月9日周四
  1. Hugging Face Blog85

    Hugging Face 发布 Latent Consistency LoRAs 实现 SDXL 4 步快速生成

    Hugging Face 推出 Latent Consistency Models (LCM) LoRAs,允许在 Stable Diffusion XL 和 SD v1.5 等模型上通过仅 4-8 步推理实现高质量图像生成,显著加速过程(如 M1 Mac 上从约 60 秒降至 6 秒)。

    推荐理由:提供了将LCM LoRA应用于SDXL等模型的具体代码与基准测试,展示了如何在保持画质的前提下大幅降低推理步数并提升生成速度。

11月7日周二
10月27日周五
  1. Hugging Face Blog68

    Hugging Face 发布个人编程助手微调指南

    Hugging Face 发布教程展示如何微调 StarCoder 模型创建个人编程助手 HugCoder。文章详述了从 GitHub 收集数据、使用 PEFT (QLoRA) 进行高效微调的流程,并对比了不同硬件配置下的训练成本与效果。此外,还提供了通过 VS Code 插件集成云端推理端点以及在 Mac 等消费级设备上本地部署小参数模型的实操步骤。

    推荐理由:原文提供了基于私有代码库微调 StarCoder 的完整工作流,包含 QLoRA 与全量微调的成本对比及本地部署方案。

10月25日周三
10月24日周二
  1. Hugging Face Blog73

    Hugging Face 详解 RLHF with PPO 的实现细节及优化器差异

    Hugging Face 团队发布博客文章,详细解析了基于 PPO 的 RLHF(人类反馈强化学习)实现细节。该研究成功复现了 OpenAI 2019 年 lm-human-preferences 代码库的学习曲线,并整理了一份关键实施清单。

    推荐理由:原文通过复现 OpenAI 早期 RLHF 代码,揭示了 PyTorch 与 TensorFlow Adam 优化器在数值实现上的差异及其对模型训练稳定性的具体影响。

10月3日周二
  1. Hugging Face Blog63

    Hugging Face 推出 Chat Templates 以解决聊天模型格式错配问题

    Hugging Face 在 tokenizers 中引入 chat_template 属性,允许使用 Jinja 模板保存和加载模型训练时的聊天格式。该功能旨在解决不同模型采用各异的消息转换格式导致输入分布偏移、进而引发严重且难以调试的性能下降问题。开发者可通过 tokenizer.apply_chat_template() 方法自动格式化对话历史,确保推理或微调时的输入与训练数据一致。

    推荐理由:原文提供了将聊天格式作为Jinja模板存入tokenizer的方法,有助于开发者规避因格式不匹配导致的模型性能静默下降。

10月2日周一
  1. Hugging Face Blog31

    使用 Inference API 部署 AI Comic Factory

    Hugging Face 教程展示如何通过 fork 并配置 AI Comic Factory,利用 Inference API 部署私有空间以消除排队等待。该应用基于 NextJS,需 PRO 账户访问 Llama-2 和 SDXL 1.0 模型,通过设置环境变量将语言与图像引擎指向 INFERENCE_API。目前该集成处于早期阶段,SDXL refiner 等部分功能尚未支持。

9月29日周五
9月28日周四
9月26日周二
9月18日周一
  1. Hugging Face Blog38

    Hugging Face 发布目标检测排行榜及评估指标详解

    Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的开源目标检测模型进行排名。该博客深入解析 IoU、Average Precision (AP) 和 Average Recall (AR) 等核心评估指标的计算方法。文章旨在帮助开发者理解不同报告间结果差异的原因,从而更批判性地评估模型性能并选择最适合应用需求的模型。

9月15日周五
  1. Hugging Face Blog62

    Hugging Face 详解 LLM 生产环境优化:低精度、Flash Attention 与架构创新

    Hugging Face 发布博客文章,系统介绍了大语言模型在生产环境中降低显存需求和提升推理效率的三大核心技术:低精度量化(8-bit/4-bit)、Flash Attention 算法以及针对长文本优化的模型架构(如 RoPE、ALiBi、MQA 和 GQA)。

    推荐理由:原文通过代码实测对比了低精度量化、Flash Attention 及 MQA/GQA 架构在显存占用与推理速度上的具体差异,为 LLM 生产环境优化提供了可复用的技术选型依据。

9月13日周三
  1. Hugging Face Blog45

    使用 PyTorch FSDP 微调 Llama 2 70B

    Hugging Face 演示如何利用 PyTorch FSDP、Transformers、Accelerate 和 TRL 微调 Llama 2 70B。通过仅在 rank 0 加载权重并广播至其他设备,解决了多 GPU 并行加载导致的 CPU 内存溢出问题。该方案在 2 节点 16 张 A100 GPU 环境下运行,显著降低了显存占用并提升了训练速度。

9月12日周二
  1. Hugging Face Blog50

    Hugging Face Transformers 原生支持量化方案概览:bitsandbytes 与 auto-gptq 对比

    Hugging Face Transformers 原生集成 bitsandbytes 和 auto-gptq 两种量化方案,分别适用于零样本推理/微调及高速文本生成。bitsandbytes 支持多模态模型且无需校准数据,但 4-bit 权重暂不支持序列化;auto-gptq 在文本生成上速度更快并支持 AMD GPU,但需数小时进行模型校准。

9月8日周五
  1. Hugging Face Blog60

    Hugging Face 发布 SDXL 的 T2I-Adapter 支持指南与模型权重

    Hugging Face Diffusers团队联合T2I-Adapter作者发布了针对Stable Diffusion XL (SDXL)的T2I-Adapter支持,提供sketch、canny、lineart、depth和openpose等多种条件的预训练检查点。

    推荐理由:原文提供了T2I-Adapter在SDXL上的训练细节、参数对比及diffusers库中的具体代码用法,便于开发者复现高效可控生成。

8月31日周四
8月30日周三
  1. Hugging Face Blog62

    Hugging Face 发布 AudioLDM 2 在 Diffusers 中的推理加速教程

    Hugging Face 发布教程展示如何在 🧨 Diffusers 库中优化 AudioLDM 2 模型的推理速度,将生成 10 秒音频的时间从约 30 秒缩短至不到 1 秒。

    推荐理由:原文通过逐步演示代码优化技巧,展示了如何将 AudioLDM 2 的推理时间缩短十倍以上,为开发者提供了可直接复用的性能调优方法。

8月9日周三
  1. Hugging Face Blog26

    使用 BentoML 部署 Hugging Face DeepFloyd IF 模型实战

    BentoML 开源平台支持将 Hugging Face 上的 DeepFloyd IF 文本生成图像模型部署至生产环境。该流程涵盖定义模型、创建 Service、构建 Bento 及容器化部署,利用 T5-XXL-1.1 编码提示词并分三阶段在像素空间生成 1024x1024 px 图像。开发者可独立扩展各 Stage Runner 以优化 GPU 资源分配与推理性能。

8月8日周二
  1. Hugging Face Blog77

    Hugging Face 发布使用 DPO 微调 Llama 2 的实践指南

    Hugging Face 博客介绍了如何在 TRL 库中使用直接偏好优化(DPO)方法微调 Llama v2 7B 模型。文章详细演示了从监督微调(SFT)到 DPO 训练的全流程,包括数据格式准备、QLoRA 配置及关键超参数 beta 的设置,并提供了可复用的代码示例和最终模型链接。

    推荐理由:提供了在TRL库中使用DPO微调Llama 2的完整代码与流程,展示了如何绕过复杂RLHF步骤直接优化偏好数据。

8月4日周五
8月2日周三
8月1日周二
7月27日周四
  1. Hugging Face Blog65

    Hugging Face 发布 Stable Diffusion XL 在 Mac 上的 Core ML 部署与高级量化指南

    Hugging Face 联合 Apple 发布 Stable Diffusion XL 的 Core ML 版本,并介绍混合位量化技术以优化 Mac 端运行效率。该技术在保持高画质的同时将模型体积压缩至 1.4 GB(减少 71%),支持在 macOS 14 beta 上通过 CPU+GPU 运行。官方已开源转换脚本、推理 Demo 及预计算量化配方,开发者可直接复用或应用于其他微调模型。

    推荐理由:文章详解了混合位量化技术原理及在 Stable Diffusion XL 上的应用,提供了从模型转换到性能测试的完整开源工具链。

6月19日周一
6月15日周四
6月12日周一
  1. Hugging Face Blog28

    Hugging Face Hub 面向画廊、图书馆、档案馆和博物馆的使用指南

    Hugging Face Hub 为 GLAM 领域提供模型、数据集及演示应用的共享平台,目前托管超 190,000 个模型与 33,000 个数据集。机构可通过按任务(如 token-classification)和语言筛选查找现成模型,并利用 Spaces 快速部署 Gradio 或 Docker 应用。文章还演示了如何将 CSV 格式的数据集上传至 Hub 以支持文本分类等任务。

6月2日周五
5月31日周三
5月25日周四
5月24日周三
5月23日周二
  1. Hugging Face Blog62

    Safetensors 通过安全审计并将成为 Hugging Face 默认模型格式

    Hugging Face、EleutherAI 和 Stability AI 联合委托 Trail of Bits 对 safetensors 库进行的外部安全审计已完成,结果显示未发现导致任意代码执行的关键安全漏洞。

    推荐理由:原文披露了 safetensors 通过外部安全审计的结果及成为默认格式的路径,读者可据此评估模型加载的安全性与性能收益。