跳到正文

#部署/工程

今日 3 条
12月1日周一
  1. Hugging Face Blog80

    Hugging Face Transformers v5 发布:聚焦简洁性、训练、推理与生产环境

    Hugging Face 正式发布 Transformers v5.0.0rc-0,该版本将安装量提升至日均 300 万次并支持超过 400 种模型架构。v5 重点优化了代码简洁性与模块化设计,移除 Flax/TensorFlow 支持以专注 PyTorch 后端,并引入 transformers serve 新 API 及原生量化支持以提升推理与生产环境的互操作性。

    推荐理由:官方详解 v5 版本在简化代码、统一后端及增强推理与量化支持方面的核心变化,为开发者评估迁移成本与生态兼容性提供直接依据。

11月25日周二
11月22日周六
11月17日周一
11月5日周三
  1. Google Research68

    Google Research 发布太空可扩展 AI 基础设施系统设计预印本论文

    Google Research 发布名为 Project Suncatcher 的研究项目及相关预印本论文,提出构建由自由空间光链路连接的太阳能卫星星座以承载 Google TPUs 进行 AI 计算。

    推荐理由:Google Research 发布关于太空 AI 基础设施的预印本论文,详细论证了利用太阳能卫星星座承载 TPU 进行大规模计算的可行性与挑战。

10月24日周五
10月21日周二
  1. Hugging Face Blog62

    Hugging Face 发布开源 OCR 模型选型与部署指南

    Hugging Face 发布指南帮助开发者选择和使用开源 OCR 模型。文章对比了 Chandra、OlmOCR-2、PaddleOCR-VL 等最新模型在表格处理、多语言支持及输出格式上的能力,并介绍了 OmniDocBenchmark 等评测基准。

    推荐理由:Hugging Face 官方指南系统梳理了主流开源 OCR 模型的能力差异、评测基准及本地与云端部署方案,为构建文档 AI 流水线提供了选型依据。

10月16日周四
10月11日周六
9月19日周五
9月2日周二
  1. Hugging Face Blog65

    Hugging Face 发布指南:在 ZeroGPU Spaces 中使用 PyTorch AoT 编译提升性能

    Hugging Face 发布技术指南,介绍如何在 ZeroGPU Spaces 中利用 PyTorch 的 ahead-of-time (AoT) 编译来优化模型推理速度。

    推荐理由:文章详细演示了如何在 ZeroGPU Spaces 中集成 PyTorch AoT 编译,提供了从基础配置到 FP8 量化及动态形状的高级优化代码与实测加速数据。

8月18日周一
  1. Hugging Face Blog58

    Hugging Face 发布 CUDA 内核构建与生产级部署指南

    Hugging Face 发布了关于使用 kernel-builder 库构建和部署自定义 CUDA 内核的详细指南。文章演示了如何从零开始编写图像转灰度内核,将其注册为原生 PyTorch 算子,并通过 Nix 实现可复现构建。此外,还介绍了如何利用 Hugging Face Hub 进行多架构编译、语义化版本管理以及生成 Python wheels 以支持生产环境部署。

7月23日周三
  1. Hugging Face Blog61

    Hugging Face 发布 Flux 模型 LoRA 推理加速指南

    Hugging Face 博客发布了针对 Flux.1-Dev 模型的 LoRA 推理优化方案,通过组合 Flash Attention 3、torch.compile 和 FP8 量化技术,实现了约 2.3 倍的推理速度提升。

    推荐理由:提供了结合 Flash Attention 3、torch.compile 和 FP8 量化的 LoRA 热交换优化方案,解决了重编译瓶颈并给出了在消费级 GPU 上的具体实现路径。

7月22日周二
7月10日周四
7月9日周三
7月8日周二
  1. Hugging Face Blog38

    Hugging Face 生产基础设施中的三个关键监控告警

    Hugging Face 基础设施团队分享了支撑其生产环境的三个核心监控告警机制。其中“高 NAT 网关吞吐量”告警用于识别异常流量并优化云成本,通过 DNS 覆盖切换私有网络路径以节省对象存储访问费用。“Hub 请求日志归档成功率”告警则确保 Hub 应用日志数据被高效捕获、处理及存储,保障平台稳定性与可观测性。

6月23日周一
6月16日周一
6月12日周四
  1. Hugging Face Blog65

    Hugging Face Kernel Hub 五分钟入门教程

    Hugging Face 发布 Kernel Hub 使用教程,介绍如何通过 kernels 库直接加载预编译优化内核以替代复杂的手动构建流程。文中演示了集成 RMSNorm 内核的方法,并在 L4 GPU 上展示了最高约 1.97x 的推理加速效果。

    推荐理由:原文演示了通过一行代码加载预编译内核以替代手动构建,并给出了 RMSNorm 在特定硬件上的实测加速数据。

6月11日周三
6月4日周三
6月3日周二
5月23日周五
5月21日周三
5月13日周二
5月7日周三
  1. Mistral AI75

    Mistral AI 发布 Mistral Medium 3 模型

    Mistral AI 正式发布 Mistral Medium 3,这是一款旨在平衡 SOTA 性能、更低成本和简化部署的新类别模型。该模型在编码和多模态理解等专业用例中表现领先,基准测试显示其性能达到或超过 Claude Sonnet 3.7 的 90%,但 API 价格低至每百万 token 输入 $0.4 / 输出 $2。

    推荐理由:Mistral Medium 3 以显著低于竞品的成本提供接近前沿的性能,并支持混合或本地部署,为企业级应用提供了兼顾效率与可控性的新选择。

4月29日周二
4月16日周三
  1. Hugging Face Blog40

    Hugging Face 解析 LLM 并发请求中的 Prefill 与 Decode 阶段性能优化

    Hugging Face 详解大语言模型推理中 Prefill(并行处理输入)与 Decode(串行生成输出)两阶段的差异及其对延迟和吞吐量的影响。文章指出 Prefill 阶段计算密集,而 Decode 阶段受限于 GPU 内存带宽,需通过批处理提升利用率。针对 TNG 在 24 张 H100 GPU 上的部署案例,分析了如何平衡交互应用所需的低延迟与非交互式场景的高吞吐量需求。

4月9日周三
4月2日周三
  1. Hugging Face Blog37

    TNG 提出 LLM 服务公平调度与动态背压方案

    TNG Technology Consulting 针对 vLLM 等推理引擎的队列阻塞问题,提出在 API Server 层实施轮询式公平调度。该方案通过动态调整请求发送速率以控制后端队列长度,解决“重度用户”占用资源导致新用户延迟高的问题,并支持基于 KV cache 相似度的路由优化。

3月31日周一
3月28日周五
3月21日周五
2月14日周五
2月13日周四
  1. Hugging Face Blog60

    Hugging Face 博客详解十亿级分类与嵌入推理的成本优化方案

    Hugging Face 官方博客发布技术指南,详细解析了如何在十亿级规模下优化文本分类、文本嵌入及视觉嵌入的推理成本与延迟。文章通过对比 DistilBERT、ModernBERT 和 ColQwen2 等模型在 NVIDIA L4 GPU 上的表现,给出了具体的批量大小(Batch Size)和虚拟用户数(VUs)配置建议,并指出视觉嵌入任务因架构复杂导致成本显著高于纯文本任务。

    推荐理由:原文提供了针对十亿级推理任务的硬件选型与参数调优实测数据,读者可据此评估大规模分类和嵌入场景下的成本优化路径。