跳到正文

#教程/实践

今日 0 条
3月20日周三
  1. Hugging Face Blog75

    Hugging Face 发布 Cosmopedia:用于预训练大语言模型的大规模合成数据生成指南

    Hugging Face 推出 Cosmopedia,这是一个包含超过 3000 万个文件和 250 亿 token 的开源合成数据集,旨在复现 Phi-1.5 的训练数据以用于从零开始预训练大语言模型。

    推荐理由:原文详细拆解了从提示词工程到大规模生成的完整技术栈,为复现 Phi 系列合成数据提供了可落地的开源方案。