Hugging Face 发布使用 TensorFlow 和 TPU 训练语言模型教程
Hugging Face 发布教程,指导用户利用 🤗 Transformers、TensorFlow 及 TPUStrategy 从零开始训练 RoBERTa (base) 模型。该方案通过 XLA 兼容性优化,解决了社区在 TPU 上训练时的痛点,并演示了从 WikiText v1 数据集处理、Unigram tokenizer 训练到 TFRecord 格式上传的完整流程。
Hugging Face 发布教程,指导用户利用 🤗 Transformers、TensorFlow 及 TPUStrategy 从零开始训练 RoBERTa (base) 模型。该方案通过 XLA 兼容性优化,解决了社区在 TPU 上训练时的痛点,并演示了从 WikiText v1 数据集处理、Unigram tokenizer 训练到 TFRecord 格式上传的完整流程。
Hugging Face 与 AWS 合作,通过 `optimum neuron` 将 Transformers 模型适配至 AWS Inferentia2。基准测试显示,Inferentia2 相比 NVIDIA A10G GPU 平均延迟降低 4.5 倍,相比 Inferentia1 延迟降低 4 倍。开发者仅需一行代码即可编译模型,无需手动切片或修改架构。
Snorkel AI 与 Hugging Face 建立合作伙伴关系,旨在帮助企业更灵活地利用基础模型。Snorkel Flow 平台集成 Hugging Face 的 Inference Endpoint 服务,使企业能访问超过 150,000 个开源模型,并利用其“暂停和恢复”功能在控制成本的同时按需激活模型 API。
Hugging Face 通过 Optimum Habana 库实现 BLOOMZ 模型在 Habana Gaudi2 加速器上的高效部署。基准测试显示,Gaudi2 运行 176B 参数 BLOOMZ 比 Nvidia A100 快 1.42 倍,运行 7B 版本快 2.89 倍。
Hugging Face 展示在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 的方法。使用 Optimum Intel 和 OpenVINO 将 runwayml/stable-diffusion-v1-5 模型转为 bfloat16 并固定分辨率,平均延迟从 32.3 秒降至 4.7 秒。
Fetch 通过 Hugging Face Expert Acceleration Program 在 AWS 上构建自有文档 AI 模型,将开发时间缩短 30%,延迟降低 50%。该方案利用 Amazon SageMaker 和 AWS Inferentia 加速推理,支持每日处理超 1100 万张收据,替代了原有的第三方黑盒解决方案。
Hugging Face 推出托管服务 Inference Endpoints,简化模型部署流程。实测显示其 CPU 推理延迟低至 43ms,较原 ECS 方案快两倍以上。尽管成本增加 24%-50%,但显著降低了运维复杂度与认知负荷。
Hugging Face 展示在 Intel Sapphire Rapids CPU 上运行 PyTorch Transformer 模型的推理性能。通过 Optimum Intel 库,对比 Ice Lake 架构,测试了 distilbert、bert 和 roberta 等模型在短长文本序列下的延迟。结果显示新架构能显著提升推理速度,为成本敏感场景提供高效 CPU 方案。
Hugging Face Optimum 库通过集成 Microsoft ONNX Runtime,为 Transformer 模型提供开源训练加速方案。在单节点 8 GPU A100 环境下,结合 DeepSpeed ZeRO Stage 1,训练速度提升 39% 至 130%,平均提速超 35%。
Hugging Face 展示如何利用 Intel Sapphire Rapids CPU 的 Advanced Matrix Extensions (AMX) 指令加速 PyTorch Transformer 分布式训练。
Hugging Face 展示 Habana Gaudi®2 在训练和推理上比 Nvidia A100 80GB 快约两倍。BERT 预训练中,Gaudi®2 相比初代 Gaudi 提速 3.04 倍,吞吐量达 1580.2 samples/s,优于 A100 的 981.6 samples/s。
OpenAI 超级计算团队工程师 Christian Gibson 正在探索后端系统的细微之处。
Hugging Face 提供 Inference Widget、Inference API、Inference Endpoints 和 Spaces 四种推理方案。免费 API 适合开发测试,Endpoints 支持 AWS/Azure 部署及自动扩缩容,起价 $0.06/小时。Spaces 结合 Gradio UI 实现模型快速演示与生产部署。
Hugging Face 宣布将 Intel OpenVINO 集成至 Optimum Intel,支持在多种 Intel 处理器上对 Transformers 模型进行高效推理。该功能基于 OpenVINO 2022.2,利用 NNCF 框架实现模型量化,可在数分钟内显著降低模型体积与预测延迟。目前主要支持 BERT、DistilBERT 等编码器模型的静态量化及量化感知训练。
Hugging Face 发布教程,展示通过三个抽象层级实现多 GPU 分布式数据并行(DDP)训练。内容涵盖原生 `pytorch.distributed`、`🤗 Accelerate` 轻量封装及 `🤗 Transformers` 高级 `Trainer` API。该方案支持在单 GPU、TPU 或多节点环境下运行,仅需极少代码修改即可提升训练速度并简化配置。
Hugging Face 推出 Inference Endpoints,支持将 Hub 模型一键部署至 AWS 等云端托管基础设施。该服务提供 Public、Protected 和 Private 三种安全访问模式,其中 Private 端点通过 AWS PrivateLink 实现 VPC 内隔离访问。用户可配置自动扩缩容及自定义容器,简化生产环境下的模型推理部署流程。
Hugging Face 通过移植模型至 transformers 并结合 Accelerate 实现流水线并行,将 BLOOM 推理延迟降低 5 倍,吞吐量提升 50 倍。针对 176B 参数、352GB 显存需求的模型,团队利用 device_map="auto" 自动分片以适配多 GPU 环境。该优化过程涉及解决 Tensor 并行导致的数值差异及建立严格的生成测试套件以确保模型稳定性。
Hugging Face Accelerate 利用 PyTorch meta device 创建空模型并自动计算设备映射,从而在有限内存下加载 OPT-6.7B 等大语言模型。该方案通过分块加载权重至 GPU、CPU 或磁盘,避免了传统方法中因同时持有模型结构与权重副本导致的内存溢出问题。
Hugging Face 展示利用 DeepSpeed-Inference 与 Accelerate 在 8x80GB A100 GPU 上实现 BLOOM 176B 模型的高吞吐推理。
Hugging Face 演示如何将 ViT B/16 模型部署至 Google Cloud Vertex AI,实现比 Kubernetes 更简洁的代码与同等扩展性。该流程利用 `google-cloud-aiplatform` SDK 完成模型上传、端点创建及预测请求,支持自动扩缩容、版本管理及流量分割等托管功能。
Hugging Face 展示了如何使用 Docker 和 Kubernetes 扩展 🤗 ViT 模型的 TensorFlow Serving 本地部署。该方案通过容器化 SavedModel 并配置 gRPC 请求处理,实现了支持多用户的高可用服务架构。
🤗 transformers 库现已支持使用 XLA 编译 TensorFlow 文本生成模型,速度提升高达 100x,甚至快于 PyTorch。该功能基于 GPT-2 等模型演示了采样、Beam Search 及温度控制等生成策略,需 transformers >= 4.21.0 版本。
Hugging Face 团队演示如何利用 TF Serving 本地部署 Vision Transformer (ViT) 图像分类模型,支持 REST 和 gRPC 端点。
Hugging Face 公布 176B 参数多语言模型 BLOOM 的训练工程细节。该模型基于 GPT3 架构,在 Jean Zay 超算上利用 384 张 NVIDIA A100 80GB GPU,通过 Megatron-DeepSpeed 框架耗时 3.5 个月完成训练。项目处理了涵盖 46 种语言的 350B tokens 数据集,实现了大规模分布式并行训练的技术突破。
Hugging Face 提供 torch.onnx、transformers.onnx 和 Optimum 三种方式将 Transformers 模型导出为 ONNX。
Intel 正式加入 Hugging Face 硬件合作伙伴计划,双方合作推出开源库 Optimum Intel,旨在简化 Transformers 模型的训练、微调和推理加速。
Cohere、OpenAI 和 AI21 Labs 联合制定了一套适用于任何开发或部署大语言模型组织的初步最佳实践。该指南旨在为相关机构提供通用的部署参考标准。
Hugging Face 发布 Optimum 1.2,新增对 ONNX Runtime 及 Transformers pipelines 的推理支持。用户可通过替换 `AutoModelForXxx` 为 `ORTModelForXxx` 类无缝切换至加速运行时,并集成量化与图优化工具以提升模型效率。
Hugging Face 联合 Habana Labs 推出基于 Habana Gaudi 的 Transformers 训练方案,其价格性能比最新 GPU EC2 实例提升最高 40%。
Hugging Face 与 AWS 合作,利用 AWS Inferentia 芯片加速 BERT 等 Transformer 模型推理。该方案相比 GPU 实例可降低高达 80% 的单次推理成本并提升 2.3 倍吞吐量。
Hugging Face Infinity 容器化方案在 Amazon EC2 C6i(Intel Ice Lake)实例上运行 DistilBERT,相比 vanilla transformers 实现最高 800% 的延迟与吞吐量提升。该方案支持特征提取、排序等任务,通过端到端优化管道降低 Transformer 模型部署成本。
通过 `torch.save`/`load` 替代默认加载方式,GPT-J 6B 在 Amazon SageMaker 上的模型加载时间从 83 秒降至 7.7 秒,提速约 10.5 倍。该优化使模型能在 SageMaker 的 60 秒请求限制内完成实时推理,解决了大语言模型生产环境部署难题。
Hugging Face 推出开源库 Optimum,支持在 Graphcore IPU 上加速 Transformer 模型。该方案通过 PopTorch 实现 BERT 等模型的训练与微调,显著降低推理延迟。开发者可利用 `optimum[graphcore]` 包及示例代码快速部署 SQuAD 问答任务。
Hugging Face 展示如何利用 Intel Xeon Scalable CPU、Intel extension for PyTorch 及 oneCCL 库,在 Ice Lake 架构服务器上加速 PyTorch 分布式训练。该方案通过 BERT 模型在 MRPC 数据集上的微调实验,验证了从单节点扩展至多节点集群时的性能提升与成本优化潜力。
Hugging Face 详解利用 Intel oneAPI、oneDNN 及 IPEX 等软件栈优化 BERT 类模型在 Ice Lake Xeon CPU 上的推理性能。Ice Lake 相比 Cascade Lake 在 NLP 任务中实现最高 75% 的推理加速,通过集成 MKL 与 OpenMP 提升计算效率。
Hugging Face 指出“机器学习即代码”时代已至,主张软件工程最佳实践应应用于 ML 工作流。Transformer 架构正成为通用模型基础,在图像、音频等领域表现优异。企业应优先招聘具备 ML 技能的软件与 DevOps 工程师,而非单纯增加数据科学家数量。
Hugging Face 推出开源库 Optimum,旨在解决 Transformer 模型在生产环境中的规模化部署难题。该工具包通过与硬件合作伙伴协作,抽象了量化、稀疏化等加速技术的复杂性,帮助工程师在特定硬件上实现高效训练与推理。
Hugging Face 发布新的 Inference Deep Learning Containers (DLCs),支持通过一行代码将训练好的 Transformer 模型或 Model Hub 中 10,000+ 公开模型部署至 Amazon SageMaker。该方案提供生产级端点、自动扩展及内置监控,并包含基于 transformers pipelines 的零代码推理工具包。
Hugging Face 发布关于 BERT 模型在 CPU 上高效部署的系列文章首篇,聚焦硬件优化策略。基准测试基于 AWS c5.metal 实例及 Intel Xeon Platinum 8275 CPU,对比 PyTorch 1.8.1、TensorFlow 2.4.0 与 ONNX Runtime 性能。
Hugging Face 联合 Amazon SageMaker 推出优化容器,支持通过单行代码启动 BART/T5 模型的分布式训练。该集成利用 SageMaker Data Parallelism 加速 Seq2Seq 模型微调,并简化了将 transformers 4.4.2 版本模型上传至 huggingface.co 的流程。