跳到正文

#数据/训练

今日 0 条
12月8日周三
  1. Hugging Face Blog42

    Hugging Face 从零训练 CodeParrot 🦜 指南

    Hugging Face 发布教程,指导用户从零开始训练名为 CodeParrot 的 Python 代码生成模型。该模型基于 GPT-2 large 架构(1.5B 参数),利用清洗后的 50GB GitHub Python 数据集进行训练。通过自定义 Tokenizer 和 🤗 Accelerate 库,开发者可复现类似 GitHub Copilot 的代码自动补全功能。

11月29日周一
10月25日周一
  1. Hugging Face Blog35

    Hugging Face 社区周项目:使用 10 亿训练对与 TPU v3-8 训练 SOTA 句子嵌入模型

    Hugging Face 在“用 10 亿训练对训练最佳句子嵌入模型”项目中开发了 state-of-the-art 句子嵌入模型。该项目利用 7 个 TPU v3-8 和 JAX/Flax 框架,采用对比学习及 Multiple Negative Ranking Loss 进行训练。通过优化批次大小、引入 hard negatives 及使用缩放余弦相似度,显著提升了模型性能。

7月15日周四
  1. Hugging Face Blog53

    Hugging Face 发布 DeDLOC 算法实现互联网协同训练语言模型

    Hugging Face 联合多家机构提出 DeDLOC 方法,旨在利用志愿者分散的 GPU 资源进行大规模语言模型预训练。团队组织40名志愿者成功预训练了孟加拉语模型 sahajBERT,其下游任务性能接近使用数百个高端加速器的更大规模模型。该实验证明了在普通网络环境下通过自适应梯度聚合实现高效分布式训练的潜力,相关代码已集成至 Hivemind 库。

6月10日周四
3月9日周二
  1. Hugging Face Blog23

    Hugging Face 2021年2月阅读组:Long-range Transformers

    Hugging Face 发布2021年2月“长程Transformer”阅读组总结,聚焦降低模型计算成本。文章综述了 Longformer、Compressive Transformer、Linformer 和 Performer 四种方法,分别采用自定义注意力模式、递归、低秩近似和核近似技术。这些方案旨在解决标准自注意力机制随序列长度二次增长的计算瓶颈,支持处理超过512或1024长度的序列。

2月25日周四
11月9日周一
  1. Hugging Face Blog32

    Hugging Face 详解如何利用预训练检查点热启动编码器-解码器模型

    Hugging Face 发布教程,演示如何使用 🤗Transformers 的 EncoderDecoderModel 框架,利用 BERT 和 GPT2 等预训练检查点热启动编码器-解码器模型。该方法基于 Rothe et al. (2020) 的研究,旨在以远低于从头预训练的成本,实现与 T5、Pegasus 等大模型在序列到序列任务上相当的性能。

11月2日周一
5月5日周二
  1. OpenAI News62

    OpenAI 发布分析:神经网络训练计算效率每16个月翻倍

    OpenAI 发布分析显示,自 2012 年以来,在 ImageNet 分类任务上达到相同性能所需的神经网络训练计算量每 16 个月减少一半。相比 2012 年,目前训练达到 AlexNet 水平的网络所需计算量减少了 44 倍,这一效率提升幅度超过了同期摩尔定律预期的 11 倍成本改进。结果表明,在高投入的 AI 任务中,算法进步带来的收益已超过传统硬件效率的提升。

    推荐理由:OpenAI 官方分析指出算法效率提升速度远超摩尔定律,为理解 AI 算力需求变化提供了量化依据。

2月14日周五
12月5日周四
12月14日周五
6月11日周一
5月16日周三
  1. OpenAI News62

    OpenAI 发布分析指出 AI 训练算力每 3.4 个月翻倍

    OpenAI 发布分析显示,自 2012 年以来,最大规模 AI 训练运行所使用的算力呈指数级增长,其翻倍周期为 3.4 个月。这一增速远超摩尔定律的 2 年翻倍周期,累计增幅超过 300,000 倍。该报告强调算力提升是 AI 进步的关键组成部分,并建议业界为远超当前能力的系统做好准备。

    推荐理由:原文提供了 AI 训练算力增长的具体量化趋势,读者可据此评估未来模型能力扩展的硬件基础与潜在瓶颈。

4月18日周三
4月5日周四
3月7日周三
8月16日周三
  1. OpenAI News38

    OpenAI 详解 Dota 2 AI 自我对弈机制

    OpenAI 展示其 Dota 2 AI 通过自我对弈在一个月内从接近高排名玩家水平提升至击败顶尖职业选手。该研究证明,在算力充足的情况下,自我对弈能将机器学习系统性能推至超人水平。与受限于训练数据的监督学习不同,自我对弈系统的数据质量随智能体能力提升而自动优化。

8月29日周一
6月16日周四