跳到正文

#部署/工程

今日 3 条
4月27日周四
4月17日周一
4月6日周四
3月28日周二
2月23日周四
2月15日周三
2月6日周一
1月24日周二
1月2日周一
12月14日周三
12月8日周四
11月21日周一
11月2日周三
  1. Hugging Face Blog38

    Hugging Face Optimum Intel 集成 OpenVINO 加速模型推理

    Hugging Face 宣布将 Intel OpenVINO 集成至 Optimum Intel,支持在多种 Intel 处理器上对 Transformers 模型进行高效推理。该功能基于 OpenVINO 2022.2,利用 NNCF 框架实现模型量化,可在数分钟内显著降低模型体积与预测延迟。目前主要支持 BERT、DistilBERT 等编码器模型的静态量化及量化感知训练。

10月21日周五
  1. Hugging Face Blog29

    Hugging Face 教程:从 PyTorch DDP 到 Accelerate 再到 Trainer 的分布式训练进阶

    Hugging Face 发布教程,展示通过三个抽象层级实现多 GPU 分布式数据并行(DDP)训练。内容涵盖原生 `pytorch.distributed`、`🤗 Accelerate` 轻量封装及 `🤗 Transformers` 高级 `Trainer` API。该方案支持在单 GPU、TPU 或多节点环境下运行,仅需极少代码修改即可提升训练速度并简化配置。

10月14日周五
  1. Hugging Face Blog40

    Hugging Face Inference Endpoints 入门指南

    Hugging Face 推出 Inference Endpoints,支持将 Hub 模型一键部署至 AWS 等云端托管基础设施。该服务提供 Public、Protected 和 Private 三种安全访问模式,其中 Private 端点通过 AWS PrivateLink 实现 VPC 内隔离访问。用户可配置自动扩缩容及自定义容器,简化生产环境下的模型推理部署流程。

10月12日周三
  1. Hugging Face Blog48

    Hugging Face 优化 BLOOM 推理:延迟降低 5 倍,吞吐量提升 50 倍

    Hugging Face 通过移植模型至 transformers 并结合 Accelerate 实现流水线并行,将 BLOOM 推理延迟降低 5 倍,吞吐量提升 50 倍。针对 176B 参数、352GB 显存需求的模型,团队利用 device_map="auto" 自动分片以适配多 GPU 环境。该优化过程涉及解决 Tensor 并行导致的数值差异及建立严格的生成测试套件以确保模型稳定性。

9月27日周二
9月16日周五
8月19日周五
8月11日周四
7月27日周三
7月25日周一
7月14日周四
  1. Hugging Face Blog45

    BLOOM 176B 模型训练技术解析

    Hugging Face 公布 176B 参数多语言模型 BLOOM 的训练工程细节。该模型基于 GPT3 架构,在 Jean Zay 超算上利用 384 张 NVIDIA A100 80GB GPU,通过 Megatron-DeepSpeed 框架耗时 3.5 个月完成训练。项目处理了涵盖 46 种语言的 350B tokens 数据集,实现了大规模分布式并行训练的技术突破。

6月22日周三
6月15日周三
6月2日周四
5月10日周二
4月26日周二
3月16日周三
1月13日周四
1月11日周二
11月30日周二
11月19日周五
11月4日周四
10月20日周三
9月14日周二
7月8日周四
4月20日周二
4月8日周四