Hugging Face 从零训练 CodeParrot 🦜 指南
Hugging Face 发布教程,指导用户从零开始训练名为 CodeParrot 的 Python 代码生成模型。该模型基于 GPT-2 large 架构(1.5B 参数),利用清洗后的 50GB GitHub Python 数据集进行训练。通过自定义 Tokenizer 和 🤗 Accelerate 库,开发者可复现类似 GitHub Copilot 的代码自动补全功能。
Hugging Face 发布教程,指导用户从零开始训练名为 CodeParrot 的 Python 代码生成模型。该模型基于 GPT-2 large 架构(1.5B 参数),利用清洗后的 50GB GitHub Python 数据集进行训练。通过自定义 Tokenizer 和 🤗 Accelerate 库,开发者可复现类似 GitHub Copilot 的代码自动补全功能。
Hugging Face 发布开源 Python 库及无代码界面 Data Measurements Tool,基于 Dataset 和 Spaces Hub 与 Streamlit 构建。该工具支持自动计算词汇分布、标签平衡度及 Zipf 定律符合度等指标,帮助用户交互式地理解、构建、整理和比较 NLP 数据集。
Hugging Face 在“用 10 亿训练对训练最佳句子嵌入模型”项目中开发了 state-of-the-art 句子嵌入模型。该项目利用 7 个 TPU v3-8 和 JAX/Flax 框架,采用对比学习及 Multiple Negative Ranking Loss 进行训练。通过优化批次大小、引入 hard negatives 及使用缩放余弦相似度,显著提升了模型性能。
Hugging Face 联合多家机构提出 DeDLOC 方法,旨在利用志愿者分散的 GPU 资源进行大规模语言模型预训练。团队组织40名志愿者成功预训练了孟加拉语模型 sahajBERT,其下游任务性能接近使用数百个高端加速器的更大规模模型。该实验证明了在普通网络环境下通过自适应梯度聚合实现高效分布式训练的潜力,相关代码已集成至 Hivemind 库。
OpenAI 最新研究发现,通过在小型精选数据集上进行微调,可以针对特定行为价值观改善语言模型的表现。该方法利用少量数据即可有效调整模型行为,为优化大语言模型的合规性与安全性提供了新路径。
Hugging Face 发布2021年2月“长程Transformer”阅读组总结,聚焦降低模型计算成本。文章综述了 Longformer、Compressive Transformer、Linformer 和 Performer 四种方法,分别采用自定义注意力模式、递归、低秩近似和核近似技术。这些方案旨在解决标准自注意力机制随序列长度二次增长的计算瓶颈,支持处理超过512或1024长度的序列。
Hugging Face 工程师提出构建神经网络的三个关键步骤:首先深入分析数据以识别模式,其次从简单基线模型开始建立性能参照,最后通过过拟合小批量样本验证代码实现。这些方法旨在帮助开发者区分模型表达能力限制与代码 Bug,确保所建模型与设计意图一致。
Hugging Face 发布教程,演示如何使用 🤗Transformers 的 EncoderDecoderModel 框架,利用 BERT 和 GPT2 等预训练检查点热启动编码器-解码器模型。该方法基于 Rothe et al. (2020) 的研究,旨在以远低于从头预训练的成本,实现与 T5、Pegasus 等大模型在序列到序列任务上相当的性能。
Hugging Face Transformers 3.1 版本与 Ray Tune 集成,提供强大的超参数调优方案。在 RTE 数据集上,Population-based Training 算法相比 Grid Search 将最佳测试准确率从 65.4% 提升至 70.5%,且 GPU 耗时更少。用户可通过几行代码接入 HyperBand、贝叶斯优化等先进算法进行模型微调。
OpenAI 发布分析显示,自 2012 年以来,在 ImageNet 分类任务上达到相同性能所需的神经网络训练计算量每 16 个月减少一半。相比 2012 年,目前训练达到 AlexNet 水平的网络所需计算量减少了 44 倍,这一效率提升幅度超过了同期摩尔定律预期的 11 倍成本改进。结果表明,在高投入的 AI 任务中,算法进步带来的收益已超过传统硬件效率的提升。
推荐理由:OpenAI 官方分析指出算法效率提升速度远超摩尔定律,为理解 AI 算力需求变化提供了量化依据。
Hugging Face 利用 Transformers 和 Tokenizers 库,在 Esperanto 语料上从零训练了名为 EsperBERTo 的 84M 参数小模型。该模型采用 52,000 词表的 Byte-level BPE 分词器,编码序列长度比 GPT-2 分词器短约 30%,并成功微调用于词性标注任务。
OpenAI 研究证实,CNN、ResNet 和 Transformer 均存在“双重下降”现象:随着模型规模、数据量或训练时间增加,性能先提升后下降再回升。该效应通常通过精细的正则化避免,但其成因尚未完全明确,被视为重要的后续研究方向。
OpenAI 发现梯度噪声尺度这一统计指标能预测神经网络训练的并行化能力。由于复杂任务梯度更嘈杂,未来更大批量大小将变得有用,从而消除 AI 系统进一步增长的潜在限制。
OpenAI 推出一种结合 Transformer 架构与无监督预训练的可扩展、任务无关语言理解系统,并在多项多样化语言任务上取得 SOTA 结果。该系统的代码已开源发布,旨在证明有监督学习与无监督预训练相结合的有效性,并推动在更大规模数据集上的进一步研究。
OpenAI 发布分析显示,自 2012 年以来,最大规模 AI 训练运行所使用的算力呈指数级增长,其翻倍周期为 3.4 个月。这一增速远超摩尔定律的 2 年翻倍周期,累计增幅超过 300,000 倍。该报告强调算力提升是 AI 进步的关键组成部分,并建议业界为远超当前能力的系统做好准备。
推荐理由:原文提供了 AI 训练算力增长的具体量化趋势,读者可据此评估未来模型能力扩展的硬件基础与潜在瓶颈。
OpenAI 推出实验性元学习方法 Evolved Policy Gradients,通过进化学习智能体的损失函数实现新任务快速训练。该方法使智能体在测试时能完成超出训练范围的基础任务,例如导航至房间另一侧的目标物体。
OpenAI 发起一项名为 Retro 的迁移学习竞赛,旨在评估强化学习算法从先前经验中泛化的能力。该比赛聚焦于测试模型在迁移学习场景下的表现,为相关算法提供标准化评测基准。
OpenAI 推出名为 Reptile 的可扩展元学习算法,通过重复采样任务并执行随机梯度下降来更新初始参数。该算法将 Shortest Descent 应用于元学习场景,仅需对 SGD 或 Adam 等优化器的黑盒访问权限,在计算效率和性能上与一阶 MAML 相似。
OpenAI 展示其 Dota 2 AI 通过自我对弈在一个月内从接近高排名玩家水平提升至击败顶尖职业选手。该研究证明,在算力充足的情况下,自我对弈能将机器学习系统性能推至超人水平。与受限于训练数据的监督学习不同,自我对弈系统的数据质量随智能体能力提升而自动优化。
OpenAI 指出深度学习是一门实证科学,团队的基础设施质量是进步的关键倍增器。当前开源生态系统已使任何人都有可能构建优秀的深度学习基础设施。
OpenAI 介绍了四个旨在增强或使用生成模型的项目。生成模型属于机器学习中的无监督学习技术分支。该文章还探讨了生成模型的定义、重要性及未来发展方向。