跳到正文

#教程/实践

今日 6 条
6月30日周四
6月29日周三
6月28日周二
6月23日周四
6月22日周三
6月9日周四
6月7日周二
6月2日周四
5月20日周五
5月18日周三
5月10日周二
5月4日周三
5月2日周一
4月28日周四
  1. Hugging Face Blog26

    使用 Kili 和 HuggingFace AutoTrain 构建文本分类主动学习流程

    文章演示了结合 Kili 标注平台与 HuggingFace AutoTrain 构建文本分类的主动学习流程。以 Medium 应用商店约 40130 条用户评论为例,通过定义订阅、内容等类别进行数据清洗与模型训练。该方案利用 AutoTrain 自动化超参数优化及 SOTA Transformer 模型生成,实现高效的用户情感分析。

4月26日周二
4月25日周一
4月22日周五
4月5日周二
  1. Hugging Face Blog38

    Hugging Face Transformers 为何违背 DRY 原则采用单模型文件策略

    Hugging Face Transformers 库刻意违背“不要重复自己”(DRY)原则,转而采用“单模型文件策略”,将模型前向传播所需的所有代码集中在一个文件中。这一设计旨在降低开源社区贡献门槛、提升代码可读性,并适应机器学习领域快速演进且模型架构静态的特性,避免中心化抽象带来的维护复杂性。

3月17日周四
3月16日周三
3月11日周五
3月2日周三
2月11日周五
2月2日周三
2月1日周二
1月25日周二
1月12日周三
  1. Hugging Face Blog42

    🤗 Transformers 集成 pyctcdecode 实现 Wav2Vec2 与 n-gram 语言模型联合解码

    🤗 Transformers 现已支持通过 Kensho Technologies 的 pyctcdecode 库,将微调后的 Wav2Vec2 模型与 n-gram 语言模型结合进行音频解码。该功能解决了此前缺乏简单用户界面以利用外部语言模型提升转录准确性的问题,特别适用于仅使用少量标注数据(如 10 分钟)训练的场景。

1月11日周二
12月23日周四
12月8日周三
  1. Hugging Face Blog42

    Hugging Face 从零训练 CodeParrot 🦜 指南

    Hugging Face 发布教程,指导用户从零开始训练名为 CodeParrot 的 Python 代码生成模型。该模型基于 GPT-2 large 架构(1.5B 参数),利用清洗后的 50GB GitHub Python 数据集进行训练。通过自定义 Tokenizer 和 🤗 Accelerate 库,开发者可复现类似 GitHub Copilot 的代码自动补全功能。

11月30日周二
11月19日周五
11月15日周一
  1. Hugging Face Blog40

    使用 🤗 Transformers 微调 XLS-R 进行低资源 ASR

    Hugging Face 发布教程,演示如何使用 🤗 Transformers 微调 XLS-R(Wav2Vec2-XLS-R-300M)进行低资源自动语音识别。该模型基于近50万小时128种语言数据预训练,参数规模达3亿至20亿。教程以 Common Voice 数据集为例,采用 CTC 算法和 WER 指标评估,展示了从数据准备到 Hub 上传的完整流程。

11月4日周四
10月26日周二
10月13日周三
  1. Hugging Face Blog24

    使用遥感卫星图像和描述微调 CLIP

    团队利用 RSICD、UCM 及 Sydney 数据集对 OpenAI 的 CLIP 模型进行微调,以适配遥感卫星图像场景。该模型通过对比学习优化图文联合嵌入表示,支持基于文本查询检索大规模卫星影像。项目展示了在 Flax/JAX 框架下结合数据增强技术提升特定领域零样本推理能力的实践方案。

10月5日周二