Hugging Face 提出机器学习即代码时代已到来
Hugging Face 指出“机器学习即代码”时代已至,主张软件工程最佳实践应应用于 ML 工作流。Transformer 架构正成为通用模型基础,在图像、音频等领域表现优异。企业应优先招聘具备 ML 技能的软件与 DevOps 工程师,而非单纯增加数据科学家数量。
Hugging Face 指出“机器学习即代码”时代已至,主张软件工程最佳实践应应用于 ML 工作流。Transformer 架构正成为通用模型基础,在图像、音频等领域表现优异。企业应优先招聘具备 ML 技能的软件与 DevOps 工程师,而非单纯增加数据科学家数量。
团队利用 RSICD、UCM 及 Sydney 数据集对 OpenAI 的 CLIP 模型进行微调,以适配遥感卫星图像场景。该模型通过对比学习优化图文联合嵌入表示,支持基于文本查询检索大规模卫星影像。项目展示了在 Flax/JAX 框架下结合数据增强技术提升特定领域零样本推理能力的实践方案。
Gradio 集成 Inference API,支持通过几行代码调用 Hub 模型并部署至免费的 Hugging Face Spaces。该方案兼容 Transformers、spaCy 等框架及多种模态任务,用户还可利用 Series 功能混合不同模型构建复杂演示应用。
Hugging Face Spaces 支持通过 Streamlit 托管机器学习模型演示和数据集可视化。开发者可利用 `st.text_area`、`slider` 等组件构建交互界面,并借助 🤗 Datasets 的 streaming 功能处理大规模数据。项目可通过拖拽文件部署,需在 `requirements.txt` 中声明依赖以确保持续运行。
Hugging Face Hub 公共模型仓库数量突破 16,000,并推出 Spaces Beta、TensorBoard 集成及新增评估指标展示等功能。社区方面,JAX/FLAX Sprint 吸引近 800 人参与,产出 DALL·E mini 等开源项目;同时上线免费在线课程第一部分,涵盖 Transformers 等生态工具。
Hugging Face 推出开源库 Optimum,旨在解决 Transformer 模型在生产环境中的规模化部署难题。该工具包通过与硬件合作伙伴协作,抽象了量化、稀疏化等加速技术的复杂性,帮助工程师在特定硬件上实现高效训练与推理。
Hugging Face 与 Graphcore 宣布合作,通过新开源库 Optimum 提供针对 Intelligence Processing Unit (IPU) 优化的 Transformer 模型。开发者可在生产环境中以最小代码复杂度部署 BERT 等 SOTA 模型,实现显著加速。
Hugging Face 联合多家机构提出 DeDLOC 方法,旨在利用志愿者分散的 GPU 资源进行大规模语言模型预训练。团队组织40名志愿者成功预训练了孟加拉语模型 sahajBERT,其下游任务性能接近使用数百个高端加速器的更大规模模型。该实验证明了在普通网络环境下通过自适应梯度聚合实现高效分布式训练的潜力,相关代码已集成至 Hivemind 库。
spaCy 现已集成至 Hugging Face Hub,支持通过 `spacy-huggingface-hub` 库一键上传模型并自动生成元数据。用户可直接在浏览器中试用 NER 推理 API,或通过 pip 安装社区及官方发布的 60 多个 spaCy 3.1 版本模型。
Hugging Face 发布新的 Inference Deep Learning Containers (DLCs),支持通过一行代码将训练好的 Transformer 模型或 Model Hub 中 10,000+ 公开模型部署至 Amazon SageMaker。该方案提供生产级端点、自动扩展及内置监控,并包含基于 transformers pipelines 的零代码推理工具包。
Hugging Face Hub 正式集成 Sentence Transformers v2,提供超过 90 个覆盖 100 多种语言的预训练模型。Hub 新增特征提取和句子相似度两个组件,并开放 Inference API 端点以支持程序化调用。用户可通过 `save_to_hub` 快速分享模型,自动生成的模型卡片将展示架构详情及使用指南。
Hugging Face 演示如何利用 EleutherAI GPT-Neo 和 🤗 Accelerated Inference API 进行 Few-shot learning。
Gradio 2.0 允许开发者通过一行代码将 Hugging Face Model Hub 上的模型转换为 GUI 演示。该功能默认调用 Hugging Face Inference API,也支持本地运行 transformers 库进行计算。用户可并行对比或串联组合多个模型,快速构建如翻译摘要等复杂应用。
Hugging Face 发布关于 BERT 模型在 CPU 上高效部署的系列文章首篇,聚焦硬件优化策略。基准测试基于 AWS c5.metal 实例及 Intel Xeon Platinum 8275 CPU,对比 PyTorch 1.8.1、TensorFlow 2.4.0 与 ONNX Runtime 性能。
Hugging Face 推出开源库 🤗 Accelerate,旨在让 PyTorch 用户无需重写样板代码即可在多种设备配置上运行原始训练脚本。该库提供统一 API 和启动器命令,支持多 GPU、TPU 及混合精度训练,并计划集成 fairscale、DeepSpeed 和 AWS SageMaker。用户只需添加少量代码行即可自动处理设备放置和数据加载器包装,同时兼容传统启动方式。
Hugging Face 联合 Amazon SageMaker 推出优化容器,支持通过单行代码启动 BART/T5 模型的分布式训练。该集成利用 SageMaker Data Parallelism 加速 Seq2Seq 模型微调,并简化了将 transformers 4.4.2 版本模型上传至 huggingface.co 的流程。
BigBird 采用块稀疏注意力替代 BERT 的全注意力,将序列长度支持提升至 4096 并显著降低计算成本。该模型通过滑动窗口、全局 token 和随机 block 三种机制近似全注意力矩阵,在长文档摘要等任务中实现 SOTA。BigBird RoBERTa-like 模型现已集成至 Hugging Face Transformers 库。
Hugging Face 宣布与 Amazon 建立战略合作,将 AWS 设为首选云服务商。双方推出新的 Hugging Face Deep Learning Containers (DLCs),支持在 Amazon SageMaker 中训练 Transformer 模型。该集成通过 SageMaker Python SDK 简化部署流程,利用自动模型调优和分布式训练库加速从实验到生产的转化。
社区成员 Maxence Dominici 在 Google Cloud 上部署了基于 DistilBERT 模型的 serverless 情感分析流水线。
Hugging Face 发布教程,指导使用 🤗 Transformers 库微调 Wav2Vec2 模型进行英语自动语音识别。该预训练模型基于对比学习,仅需 10 分钟标注数据即可在 LibriSpeech 测试集上实现低于 5% 的词错误率。
Hugging Face 发布2021年2月“长程Transformer”阅读组总结,聚焦降低模型计算成本。文章综述了 Longformer、Compressive Transformer、Linformer 和 Performer 四种方法,分别采用自定义注意力模式、递归、低秩近似和核近似技术。这些方案旨在解决标准自注意力机制随序列长度二次增长的计算瓶颈,支持处理超过512或1024长度的序列。
Hugging Face 工程师提出构建神经网络的三个关键步骤:首先深入分析数据以识别模式,其次从简单基线模型开始建立性能参照,最后通过过拟合小批量样本验证代码实现。这些方法旨在帮助开发者区分模型表达能力限制与代码 Bug,确保所建模型与设计意图一致。
Hugging Face Transformers 中的 RAG 模型通过集成 Ray 库,将上下文文档检索速度提升 2 倍并优化分布式微调扩展性。该方案利用 Ray 的有状态 Actor 抽象替代 torch.distributed,解决了单进程瓶颈及 PyTorch 依赖限制。在 4 GPU 场景下,Ray 实现每批次检索耗时降至 1.66 秒,显著优于原有方案的 3.438 秒。
Hugging Face 与 Google TPU 团队合作,为 PyTorch / XLA 添加对 Cloud TPUs 的一流支持。用户可通过 `Trainer` 模块在保持原有接口不变的情况下,利用 `xm.xla_device()` 和 `xm.optimizer_step()` 等 API 在 Cloud TPUs 上运行并扩展模型训练。
Hugging Face Transformers v4.2.0 优化了 BERT、RoBERTa 等模型的 TensorFlow 实现,在 GPU V100 上推理速度比 Google 官方实现快约 10%,比 v4.1.1 版本快两倍。
Hugging Face Trainer v4.2.0 实验性支持 DeepSpeed 和 FairScale 的 ZeRO 功能,通过 `--deepspeed` 和 `--sharded_ddp` 参数实现。
Hugging Face 通过优化 🤗 Transformers 和 Tokenizers 库,为 API 客户实现 Transformer 推理速度提升 100 倍。首先利用 Rust 实现的 Tokenizer 缓存及注意力矩阵维度缩减获得 10x 加速;随后针对特定硬件进行模型编译、层融合及量化处理,再获 10x 性能增益。
Hugging Face 发布教程,演示如何使用 🤗Transformers 的 EncoderDecoderModel 框架,利用 BERT 和 GPT2 等预训练检查点热启动编码器-解码器模型。该方法基于 Rothe et al. (2020) 的研究,旨在以远低于从头预训练的成本,实现与 T5、Pegasus 等大模型在序列到序列任务上相当的性能。
Stas Bekman 将 Facebook FAIR 的 fairseq wmt19 翻译系统成功移植到 Hugging Face Transformers 库。
Hugging Face Transformers 3.1 版本与 Ray Tune 集成,提供强大的超参数调优方案。在 RTE 数据集上,Population-based Training 算法相比 Grid Search 将最佳测试准确率从 65.4% 提升至 70.5%,且 GPU 耗时更少。用户可通过几行代码接入 HyperBand、贝叶斯优化等先进算法进行模型微调。
Hugging Face 发布技术博客,深入解析基于 Transformer 的编码器-解码器架构在序列到序列任务中的数学原理及推理机制。文章重点拆解 Encoder 和 Decoder 组件,并建立理论与 🤗Transformers 库中 T5、Bart、MarianMT 和 Pegasus 等模型实际应用的联系。
Hugging Face 推出 `pytorch_block_sparse` 扩展,利用 NVIDIA CUTLASS 模板实现高效块稀疏矩阵乘法。该库提供 `BlockSparseLinear` 模块替代标准线性层,在 75% 稀疏度下推理速度约为密集矩阵的 2 倍,内存占用降低 4 倍。
Reformer 模型通过重新设计 Transformer 架构,实现用不到 8GB 内存训练长达 50 万 token 的序列。相比 BERT 仅支持 512 token 的限制,Reformer 利用局部自注意力、LSH 哈希、可逆残差层及轴向位置编码四大特性大幅降低显存占用。该模型已集成至 Hugging Face Transformers 库,适用于长文本摘要等任务。
Hugging Face 发布博客文章,详细解析了 Greedy Search、Beam Search、Sampling、Top-K Sampling 和 Top-p (Nucleus) Sampling 等主流文本生成解码策略。文章结合 GPT2 模型演示了如何使用 transformers 库配置这些方法,分析了各策略在解决重复生成和提升连贯性方面的优劣及适用场景。
Hugging Face 利用 Transformers 和 Tokenizers 库,在 Esperanto 语料上从零训练了名为 EsperBERTo 的 84M 参数小模型。该模型采用 52,000 词表的 Byte-level BPE 分词器,编码序列长度比 GPT-2 分词器短约 30%,并成功微调用于词性标注任务。