跳到正文

#部署/工程

今日 3 条
1月30日周四
1月28日周二
  1. Hugging Face Blog70

    Hugging Face Hub 集成 fal、Replicate 等四家 Serverless 推理提供商

    Hugging Face 宣布在 Hub 模型页面及客户端 SDK 中正式集成 fal、Replicate、Sambanova 和 Together AI 四家 Serverless 推理提供商。用户可通过自定义 API Key 直连或经 HF 路由两种模式调用 DeepSeek-R1 等模型,PRO 用户每月获 $2 跨提供商通用额度。

    推荐理由:原文展示了在 Hub 模型页直接调用多家第三方 Serverless 推理服务的统一入口与计费模式,为开发者提供了更灵活的模型部署选择。

1月23日周四
1月22日周三
1月16日周四
12月24日周二
  1. Hugging Face Blog68

    Hugging Face 发布 PyTorch GPU 显存可视化与估算教程

    Hugging Face 发布教程指导如何使用 PyTorch 内置工具可视化训练过程中的 GPU 显存占用。文章详细解析了模型参数、优化器状态、激活值等组件的显存构成,并提供了一套估算总显存需求的数学公式及启发式方法。

    推荐理由:文章拆解了PyTorch显存快照工具的使用,并给出了基于模型参数和激活值的显存估算公式,有助于开发者定位训练中的内存瓶颈。

12月23日周一
12月17日周二
  1. Hugging Face Blog34

    Hugging Face 在 GCP 第 5 代 Xeon CPU 上基准测试语言模型性能

    Hugging Face 在 Google Cloud C4(第 5 代 Xeon)与 N2(第 3 代 Xeon)实例上对比文本嵌入和生成性能。C4 的文本嵌入吞吐量比 N2 高 10x 至 24x,文本生成高 2.3x 至 3.6x。考虑价格因素后,C4 在两项任务中分别保持 7x~19x 和 1.7x~2.9x 的 TCO 优势,证明轻量级 Agentic AI 可完全部署于 CPU。

12月9日周一
12月3日周二
11月26日周二
  1. Hugging Face Blog42

    Hugging Face 重构上传下载架构引入内容寻址存储

    Hugging Face Xet 团队重新设计 Hub 上传下载架构,引入内容寻址存储(CAS)以突破现有限制。新协议采用“智能写入、简单读取”理念,在字节级分析文件以优化去重与压缩,预计可将 Safetensors 等张量文件的上传速度提升 10-25%。该方案旨在解决大模型权重传输瓶颈,并为全球用户提供更低延迟和更安全的审计追踪。

11月20日周三
  1. Hugging Face Blog42

    Hugging Face Xet 团队利用内容定义分块技术提升存储效率

    Hugging Face Xet 团队采用内容定义分块(CDC)技术,仅传输修改后的数据块以优化 Git LFS 存储。在 CORD-19 数据集基准测试中,该方案使平均下载时间从 51 分钟降至 19 分钟,存储占用从 8.9 GB 减至 3.52 GB。预计对 PyTorch 检查点实现 50% 去重率,可节省高达 100 TB 存储空间,计划于 2025 年初推出基于 Xet 的仓库。

11月7日周四
  1. Mistral AI42

    Mistral Batch API 发布

    Mistral AI 推出 Batch API,处理高容量请求的成本比同步 API 低 50%。该功能已在 La Plateforme 上线,支持所有模型,适用于文档摘要、向量嵌入及数据标注等场景。每个工作区限制 100 万个进行中请求。

10月29日周二
9月20日周五
8月19日周一
8月7日周三
7月30日周二
7月29日周一
7月18日周四
  1. Hugging Face Blog65

    Hugging Face TGI 发布 Multi-LoRA 服务功能

    Hugging Face 为 Text Generation Inference (TGI) 推出 Multi-LoRA serving 功能,支持在单次部署的基础模型上动态加载并服务多达 30 个 LoRA 适配器。

    推荐理由:TGI 新增 Multi-LoRA 功能,允许在单一基础模型部署中动态加载多个微调适配器,显著降低多模型服务的运维成本与复杂度。

7月9日周二
7月3日周三
6月7日周五
6月4日周二
5月29日周三
  1. Hugging Face Blog42

    Hugging Face 推出 TGI Benchmarking 工具以优化 LLM 推理部署

    Hugging Face 发布 Text Generation Inference (TGI) 的配套基准测试工具,旨在超越单纯吞吐量指标,帮助开发者通过权衡延迟与吞吐来调优 LLM 部署。该工具支持在 Hugging Face Space 中运行,提供预填充统计及 TTFT、Latency 等关键性能可视化分析,适用于不同用户场景下的推理服务优化。

5月22日周三
5月21日周二
5月16日周四
5月9日周四
5月1日周三
4月16日周二
4月10日周三
4月3日周三
  1. Hugging Face Blog30

    Hugging Face 发布 SetFit 在 Intel Xeon 上通过 Optimum Intel 实现 7.8 倍推理加速

    Hugging Face 展示如何利用 🤗 Optimum Intel 将 SetFit 模型在 Intel Xeon CPU 上的推理速度提升 7.8 倍。该方案采用静态后训练量化(PTQ),仅需少量无标签校准数据即可降低内存占用并保留精度,无需重新训练。这为基于 Sentence Transformers 的少样本微调框架提供了生产级部署的高效路径。

4月2日周二
3月20日周三
3月18日周一