Hugging Face 与 Amazon SageMaker 达成战略合作并推出深度学习容器
Hugging Face 宣布与 Amazon 建立战略合作,将 AWS 设为首选云服务商。双方推出新的 Hugging Face Deep Learning Containers (DLCs),支持在 Amazon SageMaker 中训练 Transformer 模型。该集成通过 SageMaker Python SDK 简化部署流程,利用自动模型调优和分布式训练库加速从实验到生产的转化。
Hugging Face 宣布与 Amazon 建立战略合作,将 AWS 设为首选云服务商。双方推出新的 Hugging Face Deep Learning Containers (DLCs),支持在 Amazon SageMaker 中训练 Transformer 模型。该集成通过 SageMaker Python SDK 简化部署流程,利用自动模型调优和分布式训练库加速从实验到生产的转化。
社区成员 Maxence Dominici 在 Google Cloud 上部署了基于 DistilBERT 模型的 serverless 情感分析流水线。
Hugging Face Transformers 中的 RAG 模型通过集成 Ray 库,将上下文文档检索速度提升 2 倍并优化分布式微调扩展性。该方案利用 Ray 的有状态 Actor 抽象替代 torch.distributed,解决了单进程瓶颈及 PyTorch 依赖限制。在 4 GPU 场景下,Ray 实现每批次检索耗时降至 1.66 秒,显著优于原有方案的 3.438 秒。
Hugging Face 与 Google TPU 团队合作,为 PyTorch / XLA 添加对 Cloud TPUs 的一流支持。用户可通过 `Trainer` 模块在保持原有接口不变的情况下,利用 `xm.xla_device()` 和 `xm.optimizer_step()` 等 API 在 Cloud TPUs 上运行并扩展模型训练。
Hugging Face Transformers v4.2.0 优化了 BERT、RoBERTa 等模型的 TensorFlow 实现,在 GPU V100 上推理速度比 Google 官方实现快约 10%,比 v4.1.1 版本快两倍。
OpenAI 成功将 Kubernetes 集群规模扩展至 7,500 个节点。这一基础设施升级旨在支持 GPT-3、CLIP 和 DALL·E 等大模型的训练,同时也服务于如《Scaling Laws for Neural Language Models》等小规模快速迭代研究项目。
Hugging Face Trainer v4.2.0 实验性支持 DeepSpeed 和 FairScale 的 ZeRO 功能,通过 `--deepspeed` 和 `--sharded_ddp` 参数实现。
Hugging Face 通过优化 🤗 Transformers 和 Tokenizers 库,为 API 客户实现 Transformer 推理速度提升 100 倍。首先利用 Rust 实现的 Tokenizer 缓存及注意力矩阵维度缩减获得 10x 加速;随后针对特定硬件进行模型编译、层融合及量化处理,再获 10x 性能增益。
OpenAI 发布了针对块稀疏权重神经网络的高度优化 GPU 内核。这些内核根据所选稀疏度,运行速度比 cuBLAS 或 cuSPARSE 快数个数量级。OpenAI 利用该技术在文本情感分析及文本图像生成建模中取得了 SOTA 结果。