跳到正文

#教程/实践

今日 6 条
6月12日周四
  1. Hugging Face Blog65

    Hugging Face Kernel Hub 五分钟入门教程

    Hugging Face 发布 Kernel Hub 使用教程,介绍如何通过 kernels 库直接加载预编译优化内核以替代复杂的手动构建流程。文中演示了集成 RMSNorm 内核的方法,并在 L4 GPU 上展示了最高约 1.97x 的推理加速效果。

    推荐理由:原文演示了通过一行代码加载预编译内核以替代手动构建,并给出了 RMSNorm 在特定硬件上的实测加速数据。

6月4日周三
6月3日周二
5月25日周日
5月23日周五
5月21日周三
  1. Hugging Face Blog68

    Hugging Face 发布 nanoVLM:纯 PyTorch 实现的最简视觉语言模型训练工具包

    Hugging Face 推出 nanoVLM,这是一个用于训练视觉语言模型(VLM)的轻量级纯 PyTorch 工具包。该项目受 nanoGPT 启发,旨在通过极简且可读的代码帮助初学者在免费 Colab 笔记本上启动 VLM 训练。

    推荐理由:原文提供了基于纯 PyTorch 的极简 VLM 训练代码库及 Colab 入口,适合开发者快速理解视觉语言模型架构与训练流程。

5月12日周一
4月30日周三
  1. Hugging Face Blog53

    Hugging Face 深度解析 Qwen-3 Chat Template 的四个关键设计

    Hugging Face 博客通过分析 Qwen-3 的 Jinja chat template,指出其相比前代模型在架构上的四项改进。文章展示了 Qwen-3 如何通过 `enable_thinking` 标志实现可选推理,利用滚动检查点机制动态管理上下文以保留多步工具调用的思维链,优化了工具参数的序列化逻辑以避免双重转义,并移除了默认的系统提示词。

4月25日周五
4月23日周三
4月16日周三
  1. Hugging Face Blog40

    Hugging Face 解析 LLM 并发请求中的 Prefill 与 Decode 阶段性能优化

    Hugging Face 详解大语言模型推理中 Prefill(并行处理输入)与 Decode(串行生成输出)两阶段的差异及其对延迟和吞吐量的影响。文章指出 Prefill 阶段计算密集,而 Decode 阶段受限于 GPU 内存带宽,需通过批处理提升利用率。针对 TNG 在 24 张 H100 GPU 上的部署案例,分析了如何平衡交互应用所需的低延迟与非交互式场景的高吞吐量需求。

4月9日周三
  1. Mistral AI37

    Mistral AI 利用 LLM as a Judge 与结构化输出评估 RAG 系统

    Mistral AI 提出结合“LLM as a Judge”与 RAG Triad 框架来评估检索增强生成系统。该方案利用 Mistral 模型作为裁判,通过 Context Relevance、Groundedness 和 Answer Relevance 三个维度量化性能。配合 API 新推出的结构化输出功能,可强制模型返回机器可读的评分与推理依据,提升评估可靠性。

4月4日周五
4月3日周四
4月2日周三
  1. Hugging Face Blog37

    TNG 提出 LLM 服务公平调度与动态背压方案

    TNG Technology Consulting 针对 vLLM 等推理引擎的队列阻塞问题,提出在 API Server 层实施轮询式公平调度。该方案通过动态调整请求发送速率以控制后端队列长度,解决“重度用户”占用资源导致新用户延迟高的问题,并支持基于 KV cache 相似度的路由优化。

3月31日周一
3月26日周三
  1. Hugging Face Blog60

    Sentence Transformers 重排序模型微调指南

    本文详细介绍了如何使用 Sentence Transformers 库微调和训练重排序(Reranker)模型。作者通过实战演示了数据集加载、困难负样本挖掘、损失函数选择及训练参数配置等关键步骤。

    推荐理由:提供了从数据准备到模型评估的完整微调流程,并展示了小模型在特定领域超越通用大模型的实测结果。

3月20日周四
3月7日周五
3月4日周二
2月28日周五
2月24日周一
  1. Hugging Face Blog62

    Hugging Face 推出 Remote VAEs 以通过 Inference Endpoints 进行解码

    Hugging Face 发布实验性功能 Remote VAEs,允许用户将潜在空间扩散模型的 VAE 解码过程委托给远程端点,从而降低本地 GPU 的显存占用并避免分块解码带来的质量损失。

    推荐理由:原文提供了将 VAE 解码委托给远程端点的代码示例和显存对比数据,帮助开发者在低显存设备上优化扩散模型推理性能。

2月13日周四
  1. Hugging Face Blog60

    Hugging Face 博客详解十亿级分类与嵌入推理的成本优化方案

    Hugging Face 官方博客发布技术指南,详细解析了如何在十亿级规模下优化文本分类、文本嵌入及视觉嵌入的推理成本与延迟。文章通过对比 DistilBERT、ModernBERT 和 ColQwen2 等模型在 NVIDIA L4 GPU 上的表现,给出了具体的批量大小(Batch Size)和虚拟用户数(VUs)配置建议,并指出视觉嵌入任务因架构复杂导致成本显著高于纯文本任务。

    推荐理由:原文提供了针对十亿级推理任务的硬件选型与参数调优实测数据,读者可据此评估大规模分类和嵌入场景下的成本优化路径。

2月12日周三
2月4日周二
1月31日周五
1月30日周四
1月27日周一
  1. Hugging Face Blog65

    Diffusers 团队解析开源视频生成模型现状及低显存推理优化指南

    Hugging Face Diffusers 团队发布博客,综述了当前开源视频生成模型(如 CogVideoX, Hunyuan, LTX-Video)的能力、局限性及技术架构。

    推荐理由:文章梳理了开源视频生成模型的现状与局限,并提供了在 Diffusers 中通过量化、卸载等优化手段降低显存需求及微调的具体代码方案。

1月23日周四
1月16日周四
12月24日周二
  1. Hugging Face Blog68

    Hugging Face 发布 PyTorch GPU 显存可视化与估算教程

    Hugging Face 发布教程指导如何使用 PyTorch 内置工具可视化训练过程中的 GPU 显存占用。文章详细解析了模型参数、优化器状态、激活值等组件的显存构成,并提供了一套估算总显存需求的数学公式及启发式方法。

    推荐理由:文章拆解了PyTorch显存快照工具的使用,并给出了基于模型参数和激活值的显存估算公式,有助于开发者定位训练中的内存瓶颈。

12月23日周一