Hugging Face Blog·· 2024-03-20精选AI 评分75
Hugging Face 发布 Cosmopedia:用于预训练大语言模型的大规模合成数据生成指南
Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models
AI 导读
Hugging Face 推出 Cosmopedia,这是一个包含超过 3000 万个文件和 250 亿 token 的开源合成数据集,旨在复现 Phi-1.5 的训练数据以用于从零开始预训练大语言模型。
推荐理由
原文详细拆解了从提示词工程到大规模生成的完整技术栈,为复现 Phi 系列合成数据提供了可落地的开源方案。
来源:Hugging Face Blog · huggingface.co