跳到正文

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

106条精选相关主题AI 编码Agent 智能体产品更新

最新精选

第 61–80 条 · 共 106 条
2月24日周一
  1. Hugging Face Blog62

    Hugging Face 推出 Remote VAEs 以通过 Inference Endpoints 进行解码

    Hugging Face 发布实验性功能 Remote VAEs,允许用户将潜在空间扩散模型的 VAE 解码过程委托给远程端点,从而降低本地 GPU 的显存占用并避免分块解码带来的质量损失。

    推荐理由:原文提供了将 VAE 解码委托给远程端点的代码示例和显存对比数据,帮助开发者在低显存设备上优化扩散模型推理性能。

2月13日周四
  1. Hugging Face Blog60

    Hugging Face 博客详解十亿级分类与嵌入推理的成本优化方案

    Hugging Face 官方博客发布技术指南,详细解析了如何在十亿级规模下优化文本分类、文本嵌入及视觉嵌入的推理成本与延迟。文章通过对比 DistilBERT、ModernBERT 和 ColQwen2 等模型在 NVIDIA L4 GPU 上的表现,给出了具体的批量大小(Batch Size)和虚拟用户数(VUs)配置建议,并指出视觉嵌入任务因架构复杂导致成本显著高于纯文本任务。

    推荐理由:原文提供了针对十亿级推理任务的硬件选型与参数调优实测数据,读者可据此评估大规模分类和嵌入场景下的成本优化路径。

1月31日周五
1月27日周一
  1. Hugging Face Blog65

    Diffusers 团队解析开源视频生成模型现状及低显存推理优化指南

    Hugging Face Diffusers 团队发布博客,综述了当前开源视频生成模型(如 CogVideoX, Hunyuan, LTX-Video)的能力、局限性及技术架构。

    推荐理由:文章梳理了开源视频生成模型的现状与局限,并提供了在 Diffusers 中通过量化、卸载等优化手段降低显存需求及微调的具体代码方案。

1月16日周四
12月24日周二
  1. Hugging Face Blog68

    Hugging Face 发布 PyTorch GPU 显存可视化与估算教程

    Hugging Face 发布教程指导如何使用 PyTorch 内置工具可视化训练过程中的 GPU 显存占用。文章详细解析了模型参数、优化器状态、激活值等组件的显存构成,并提供了一套估算总显存需求的数学公式及启发式方法。

    推荐理由:文章拆解了PyTorch显存快照工具的使用,并给出了基于模型参数和激活值的显存估算公式,有助于开发者定位训练中的内存瓶颈。

10月8日周二
  1. Hugging Face Blog63

    Hugging Face 发布动态推测解码方法以加速文本生成

    Intel Labs 与 Hugging Face 联合推出动态推测解码(Dynamic Speculative Decoding),该方法已作为 Transformers 库 v4.45.0 版本中辅助生成的默认模式,可将文本生成速度提升最高达 2.7x。

    推荐理由:原文提供了动态推测解码的具体实现代码和基准测试数据,读者可据此优化大模型推理速度。

9月18日周三
  1. Hugging Face Blog63

    Hugging Face 详解如何将 LLM 微调至 1.58bit 极限量化

    Hugging Face 发布技术博客,介绍如何通过特定技巧将现有的 Llama3 8B 模型微调至 BitNet 架构支持的 1.58bit 极限量化水平。团队通过引入动态 lambda 值逐步应用量化以解决权重分布突变导致的性能损失,最终在仅使用 10B tokens 微调的情况下使模型在 MMLU 基准测试中超越 Llama 1 7B。

    推荐理由:原文详细拆解了将 Llama3 微调至 1.58bit 的量化技巧与动态 lambda 调度策略,为低精度模型部署提供了可复现的工程路径。

8月14日周三
  1. Hugging Face Blog60

    Hugging Face 复盘 Infini-attention 实验:为何其长上下文性能随压缩次数下降

    Hugging Face 团队分享了复现 Google Infini-attention 的实验结果,发现随着内存压缩次数增加,模型在长上下文任务中的性能显著下降且不可靠。

    推荐理由:作者详细记录了复现Infini-attention的调试过程与失败原因,揭示了长上下文扩展中压缩记忆的性能瓶颈及收敛难点。

8月12日周一
7月22日周一
  1. Hugging Face Blog68

    Hugging Face 详解 WWDC 24 Core ML 新特性运行 Mistral 7B

    Hugging Face 发布教程,指导开发者利用 WWDC 24 引入的 Core ML 新特性在 Mac 上运行 Mistral 7B 模型。通过 Swift Tensor、Stateful Buffers 和块量化技术,该方案能将 70 亿参数模型的内存占用降至 4GB 以下。

    推荐理由:原文详细演示了利用WWDC 24新特性将Mistral 7B转换为Core ML模型并实现端侧高效推理的完整流程。

6月12日周三
3月22日周五
  1. Hugging Face Blog60

    Hugging Face 介绍嵌入向量量化技术以提升检索速度与降低成本

    Hugging Face 博客介绍了嵌入向量的二进制和标量(int8)量化方法,旨在解决大规模检索中的内存与成本瓶颈。通过结合二进制快速检索与 int8 重排序,该方法在保持约 96% 原始性能的同时,将内存占用减少 32 倍,检索速度提升最高达 45 倍。文中提供了基于 Sentence Transformers 库的实现代码及针对 4100 万条维基百科文本的演示案例。

    推荐理由:原文提供了二进制与标量量化结合重排序的检索方案及代码示例,读者可据此评估其在降低内存成本与提升速度间的平衡效果。

3月20日周三
  1. Hugging Face Blog75

    Hugging Face 发布 Cosmopedia:用于预训练大语言模型的大规模合成数据生成指南

    Hugging Face 推出 Cosmopedia,这是一个包含超过 3000 万个文件和 250 亿 token 的开源合成数据集,旨在复现 Phi-1.5 的训练数据以用于从零开始预训练大语言模型。

    推荐理由:原文详细拆解了从提示词工程到大规模生成的完整技术栈,为复现 Phi 系列合成数据提供了可落地的开源方案。

2月16日周五
  1. Hugging Face Blog67

    Hugging Face 演示用开源 LLM 生成合成数据训练高效专用模型

    Hugging Face 发布教程展示如何利用开源 Mixtral-8x7B-Instruct-v0.1 模型生成合成数据,以微调 RoBERTa-base 等小型专用模型。

    推荐理由:通过金融情感分析案例演示了利用开源大模型生成合成数据并微调小模型的完整流程,提供了具体的成本与性能对比数据及可复用的代码仓库。

1月14日周日
  1. Hugging Face Blog65

    Hugging Face 发布教程:如何将 ComfyUI 工作流转为 Gradio 应用并在 Spaces 上免费运行

    Hugging Face 发布教程指导用户将复杂的 ComfyUI 工作流转换为简单的 Gradio 应用,并部署在 Hugging Face Spaces 的 ZeroGPU 架构上以实现免费的无服务器运行。

    推荐理由:原文提供了将 ComfyUI 工作流转换为 Gradio 应用并部署到 Hugging Face Spaces ZeroGPU 的完整步骤,读者可以据此实现免费服务器端推理。

1月10日周三
  1. Hugging Face Blog78

    Hugging Face 介绍如何使用 Unsloth 将 LLM 微调速度提升 2 倍

    Hugging Face 博客介绍了社区开发的轻量级工具 Unsloth,该工具与 🤗 TRL 库完全兼容,可将大语言模型(LLM)的微调速度提升最高 2.7 倍,同时减少高达 74% 的显存使用量且精度零损失。

    推荐理由:原文提供了 Unsloth 与 TRL 集成的具体代码示例和基准测试数据,展示了在不损失精度的情况下显著降低显存占用并加速微调的方法。

1月2日周二
  1. Hugging Face Blog62

    Hugging Face 发布 SDXL Dreambooth LoRA 高级训练脚本与最佳实践指南

    Hugging Face 发布了结合 Pivotal Tuning 和 Prodigy 优化器的 SDXL Dreambooth LoRA 高级训练脚本,旨在通过少量图像实现高质量概念捕捉并降低计算资源需求。该指南详细解析了文本编码器学习率、自定义标题、Min-SNR Gamma 加权等关键技巧,并展示了在 diffusers 库中的具体代码实现及在不同场景下的实验对比结果。

    推荐理由:整合了Pivotal Tuning与Prodigy优化器等前沿技巧,提供了可直接复用的SDXL LoRA微调脚本及详细参数配置指南。

12月20日周三
  1. Hugging Face Blog65

    Hugging Face 演示通过推测解码实现 Whisper 推理 2 倍加速

    Hugging Face 博客展示如何利用推测解码(Speculative Decoding)将 Whisper 模型的推理速度提升约 2 倍,同时保证输出结果与原模型完全一致。文章详细给出了使用 Distil-Whisper 或 Whisper tiny 作为辅助模型的技术实现代码、英语及多语言场景下的基准测试结果,并说明了选择辅助模型和控制批次大小等优化策略。

    推荐理由:原文提供了在 Hugging Face Transformers 中利用辅助模型实现 Whisper 推理加速的具体代码与基准测试数据,展示了无损提速的工程落地路径。