跳到正文

#部署/工程

今日 3 条
5月16日周四
5月9日周四
5月1日周三
4月16日周二
4月10日周三
4月3日周三
  1. Hugging Face Blog30

    Hugging Face 发布 SetFit 在 Intel Xeon 上通过 Optimum Intel 实现 7.8 倍推理加速

    Hugging Face 展示如何利用 🤗 Optimum Intel 将 SetFit 模型在 Intel Xeon CPU 上的推理速度提升 7.8 倍。该方案采用静态后训练量化(PTQ),仅需少量无标签校准数据即可降低内存占用并保留精度,无需重新训练。这为基于 Sentence Transformers 的少样本微调框架提供了生产级部署的高效路径。

4月2日周二
3月20日周三
3月18日周一
3月15日周五
2月29日周四
2月8日周四
  1. Hugging Face Blog68

    Hugging Face TGI 发布兼容 OpenAI 的 Messages API

    Hugging Face 在 Text Generation Inference (TGI) v1.4.0 中推出 Messages API,提供与 OpenAI Chat Completion API 的兼容性,允许用户从 OpenAI 模型无缝迁移到开源 LLM。

    推荐理由:TGI 1.4.0 新增兼容 OpenAI Chat Completion API 的 Messages API,支持通过修改 base_url 无缝切换至开源模型,并兼容 LangChain 和 LlamaIndex。

2月1日周四
1月30日周二
1月15日周一
1月14日周日
  1. Hugging Face Blog65

    Hugging Face 发布教程:如何将 ComfyUI 工作流转为 Gradio 应用并在 Spaces 上免费运行

    Hugging Face 发布教程指导用户将复杂的 ComfyUI 工作流转换为简单的 Gradio 应用,并部署在 Hugging Face Spaces 的 ZeroGPU 架构上以实现免费的无服务器运行。

    推荐理由:原文提供了将 ComfyUI 工作流转换为 Gradio 应用并部署到 Hugging Face Spaces ZeroGPU 的完整步骤,读者可以据此实现免费服务器端推理。

12月11日周一
  1. Mistral AI73

    Mistral AI 推出 La Plateforme 开发者平台

    Mistral AI 正式开放其首个平台服务 La Plateforme 的 beta 访问权限,旨在为开发者提供部署和定制开源生成模型的高效途径。该平台目前提供 mistral-tiny、mistral-small 和 mistral-medium 三个文本生成端点以及一个 embedding 端点,各端点在性能与价格上有所区分。

    推荐理由:Mistral AI 开放平台 beta 服务,提供三个不同性能与价格权衡的生成端点及嵌入端点,并给出具体基准分数。

12月5日周二
  1. Hugging Face Blog65

    Hugging Face 宣布支持 AMD Instinct GPU 的大语言模型开箱即用加速

    Hugging Face 宣布其 Transformers 库和 Text Generation Inference (TGI) 现已原生支持 AMD Instinct MI250 等 GPU,用户无需修改代码即可在 AMD 硬件上运行大语言模型。

    推荐理由:原文展示了 AMD GPU 在无需修改代码的情况下运行 Hugging Face 模型的能力,并提供了与 NVIDIA A100 对比的性能基准数据。

  2. Hugging Face Blog55

    Hugging Face 详解如何通过动态加载 LoRA 将推理速度提升 300%

    Hugging Face 在 Hub Inference API 中实现了 LoRA 适配器的动态加载机制,通过将请求路由至共享的基础模型后端并即时切换轻量级适配器,使响应时间从 35s 降至 13s。该方案利用 Diffusers 库的 load/unload 功能,让数百个不同的 LoRA 模型仅需不到 5 张 A10G GPU 即可服务,显著降低了计算资源消耗。

11月7日周二
10月24日周二
10月4日周三
10月3日周二
9月26日周二
9月19日周二
  1. Hugging Face Blog24

    Rocket Money 与 Hugging Face 合作:在生产环境中扩展易变 ML 模型

    Rocket Money 选择 Hugging Face Inference API 托管其 BERT 系列文本分类模型,以替代原有正则表达式系统处理每月超 1 亿笔交易。该方案解决了小团队缺乏 MLOps 专业知识的痛点,实现了动态扩展和低延迟推理。经过三个月评估,Hugging Face 凭借快速部署能力和合作伙伴支持成为最终选择。

9月15日周五
  1. Hugging Face Blog62

    Hugging Face 详解 LLM 生产环境优化:低精度、Flash Attention 与架构创新

    Hugging Face 发布博客文章,系统介绍了大语言模型在生产环境中降低显存需求和提升推理效率的三大核心技术:低精度量化(8-bit/4-bit)、Flash Attention 算法以及针对长文本优化的模型架构(如 RoPE、ALiBi、MQA 和 GQA)。

    推荐理由:原文通过代码实测对比了低精度量化、Flash Attention 及 MQA/GQA 架构在显存占用与推理速度上的具体差异,为 LLM 生产环境优化提供了可复用的技术选型依据。

9月12日周二
  1. Hugging Face Blog50

    Hugging Face Transformers 原生支持量化方案概览:bitsandbytes 与 auto-gptq 对比

    Hugging Face Transformers 原生集成 bitsandbytes 和 auto-gptq 两种量化方案,分别适用于零样本推理/微调及高速文本生成。bitsandbytes 支持多模态模型且无需校准数据,但 4-bit 权重暂不支持序列化;auto-gptq 在文本生成上速度更快并支持 AMD GPU,但需数小时进行模型校准。

9月1日周五
  1. Hugging Face Blog15

    Fetch 利用 Amazon SageMaker 与 Hugging Face 将 ML 处理延迟降低 50%

    Fetch 通过迁移至 Amazon SageMaker 并集成 Hugging Face AWS Deep Learning Container,成功将其最慢扫描的机器学习处理延迟降低 50%,同时文档理解模型准确率提升 200%。该方案支持每周处理超过 8000 万张收据,利用多 GPU 实例和并行训练实现了高并发下的快速推理与规模化部署。

8月10日周四
  1. Hugging Face Blog27

    Hugging Face Hub 上线 AWS Marketplace,支持使用 AWS 账户付费

    Hugging Face Hub 正式入驻 AWS Marketplace,用户现可通过 AWS 账户直接订阅并支付 Inference Endpoints、Spaces Hardware Upgrades 及 AutoTrain 等服务费用。该集成计费方式允许组织成员统一通过 AWS 账单结算,无需绑定信用卡,旨在降低企业采用 Llama 2、StarCoder 等大语言模型的技术门槛。

8月9日周三
  1. Hugging Face Blog26

    使用 BentoML 部署 Hugging Face DeepFloyd IF 模型实战

    BentoML 开源平台支持将 Hugging Face 上的 DeepFloyd IF 文本生成图像模型部署至生产环境。该流程涵盖定义模型、创建 Service、构建 Bento 及容器化部署,利用 T5-XXL-1.1 编码提示词并分三阶段在像素空间生成 1024x1024 px 图像。开发者可独立扩展各 Stage Runner 以优化 GPU 资源分配与推理性能。

8月4日周五
5月31日周三
5月25日周四
5月24日周三
5月16日周二
5月15日周一