GPT-Neo 与 🤗 Accelerated Inference API 实现 Few-shot learning 实践
Hugging Face 演示如何利用 EleutherAI GPT-Neo 和 🤗 Accelerated Inference API 进行 Few-shot learning。
Hugging Face 演示如何利用 EleutherAI GPT-Neo 和 🤗 Accelerated Inference API 进行 Few-shot learning。
Gradio 2.0 允许开发者通过一行代码将 Hugging Face Model Hub 上的模型转换为 GUI 演示。该功能默认调用 Hugging Face Inference API,也支持本地运行 transformers 库进行计算。用户可并行对比或串联组合多个模型,快速构建如翻译摘要等复杂应用。
Hugging Face 发布关于 BERT 模型在 CPU 上高效部署的系列文章首篇,聚焦硬件优化策略。基准测试基于 AWS c5.metal 实例及 Intel Xeon Platinum 8275 CPU,对比 PyTorch 1.8.1、TensorFlow 2.4.0 与 ONNX Runtime 性能。
Hugging Face 联合 Amazon SageMaker 推出优化容器,支持通过单行代码启动 BART/T5 模型的分布式训练。该集成利用 SageMaker Data Parallelism 加速 Seq2Seq 模型微调,并简化了将 transformers 4.4.2 版本模型上传至 huggingface.co 的流程。
BigBird 采用块稀疏注意力替代 BERT 的全注意力,将序列长度支持提升至 4096 并显著降低计算成本。该模型通过滑动窗口、全局 token 和随机 block 三种机制近似全注意力矩阵,在长文档摘要等任务中实现 SOTA。BigBird RoBERTa-like 模型现已集成至 Hugging Face Transformers 库。
社区成员 Maxence Dominici 在 Google Cloud 上部署了基于 DistilBERT 模型的 serverless 情感分析流水线。
Hugging Face 发布教程,指导使用 🤗 Transformers 库微调 Wav2Vec2 模型进行英语自动语音识别。该预训练模型基于对比学习,仅需 10 分钟标注数据即可在 LibriSpeech 测试集上实现低于 5% 的词错误率。
Hugging Face 工程师提出构建神经网络的三个关键步骤:首先深入分析数据以识别模式,其次从简单基线模型开始建立性能参照,最后通过过拟合小批量样本验证代码实现。这些方法旨在帮助开发者区分模型表达能力限制与代码 Bug,确保所建模型与设计意图一致。
Hugging Face Transformers 中的 RAG 模型通过集成 Ray 库,将上下文文档检索速度提升 2 倍并优化分布式微调扩展性。该方案利用 Ray 的有状态 Actor 抽象替代 torch.distributed,解决了单进程瓶颈及 PyTorch 依赖限制。在 4 GPU 场景下,Ray 实现每批次检索耗时降至 1.66 秒,显著优于原有方案的 3.438 秒。
Hugging Face 与 Google TPU 团队合作,为 PyTorch / XLA 添加对 Cloud TPUs 的一流支持。用户可通过 `Trainer` 模块在保持原有接口不变的情况下,利用 `xm.xla_device()` 和 `xm.optimizer_step()` 等 API 在 Cloud TPUs 上运行并扩展模型训练。
Hugging Face Transformers v4.2.0 优化了 BERT、RoBERTa 等模型的 TensorFlow 实现,在 GPU V100 上推理速度比 Google 官方实现快约 10%,比 v4.1.1 版本快两倍。
Hugging Face Trainer v4.2.0 实验性支持 DeepSpeed 和 FairScale 的 ZeRO 功能,通过 `--deepspeed` 和 `--sharded_ddp` 参数实现。
Hugging Face 通过优化 🤗 Transformers 和 Tokenizers 库,为 API 客户实现 Transformer 推理速度提升 100 倍。首先利用 Rust 实现的 Tokenizer 缓存及注意力矩阵维度缩减获得 10x 加速;随后针对特定硬件进行模型编译、层融合及量化处理,再获 10x 性能增益。
Hugging Face 发布教程,演示如何使用 🤗Transformers 的 EncoderDecoderModel 框架,利用 BERT 和 GPT2 等预训练检查点热启动编码器-解码器模型。该方法基于 Rothe et al. (2020) 的研究,旨在以远低于从头预训练的成本,实现与 T5、Pegasus 等大模型在序列到序列任务上相当的性能。
Stas Bekman 将 Facebook FAIR 的 fairseq wmt19 翻译系统成功移植到 Hugging Face Transformers 库。
Hugging Face Transformers 3.1 版本与 Ray Tune 集成,提供强大的超参数调优方案。在 RTE 数据集上,Population-based Training 算法相比 Grid Search 将最佳测试准确率从 65.4% 提升至 70.5%,且 GPU 耗时更少。用户可通过几行代码接入 HyperBand、贝叶斯优化等先进算法进行模型微调。
Hugging Face 发布技术博客,深入解析基于 Transformer 的编码器-解码器架构在序列到序列任务中的数学原理及推理机制。文章重点拆解 Encoder 和 Decoder 组件,并建立理论与 🤗Transformers 库中 T5、Bart、MarianMT 和 Pegasus 等模型实际应用的联系。
Reformer 模型通过重新设计 Transformer 架构,实现用不到 8GB 内存训练长达 50 万 token 的序列。相比 BERT 仅支持 512 token 的限制,Reformer 利用局部自注意力、LSH 哈希、可逆残差层及轴向位置编码四大特性大幅降低显存占用。该模型已集成至 Hugging Face Transformers 库,适用于长文本摘要等任务。
Hugging Face 发布博客文章,详细解析了 Greedy Search、Beam Search、Sampling、Top-K Sampling 和 Top-p (Nucleus) Sampling 等主流文本生成解码策略。文章结合 GPT2 模型演示了如何使用 transformers 库配置这些方法,分析了各策略在解决重复生成和提升连贯性方面的优劣及适用场景。
Hugging Face 利用 Transformers 和 Tokenizers 库,在 Esperanto 语料上从零训练了名为 EsperBERTo 的 84M 参数小模型。该模型采用 52,000 词表的 Byte-level BPE 分词器,编码序列长度比 GPT-2 分词器短约 30%,并成功微调用于词性标注任务。
OpenAI 于2月2日举办了首届 Spinning Up Workshop,作为其新教育计划的一部分。该活动旨在推广深度强化学习领域的教育资源与社区互动。
OpenAI 推出名为 Spinning Up in Deep RL 的教育资源,旨在帮助任何人成为熟练的深度强化学习从业者。该资源包含清晰的 RL 代码示例、教育练习、文档和教程。
OpenAI 指出深度学习是一门实证科学,团队的基础设施质量是进步的关键倍增器。当前开源生态系统已使任何人都有可能构建优秀的深度学习基础设施。