跳到正文

#教程/实践

今日 6 条
6月3日周四
5月25日周二
4月20日周二
4月8日周四
3月31日周三
  1. Hugging Face Blog38

    BigBird 块稀疏注意力机制详解

    BigBird 采用块稀疏注意力替代 BERT 的全注意力,将序列长度支持提升至 4096 并显著降低计算成本。该模型通过滑动窗口、全局 token 和随机 block 三种机制近似全注意力矩阵,在长文档摘要等任务中实现 SOTA。BigBird RoBERTa-like 模型现已集成至 Hugging Face Transformers 库。

3月18日周四
3月12日周五
2月25日周四
2月10日周三
  1. Hugging Face Blog21

    Hugging Face 集成 Ray 加速 RAG 检索与微调

    Hugging Face Transformers 中的 RAG 模型通过集成 Ray 库,将上下文文档检索速度提升 2 倍并优化分布式微调扩展性。该方案利用 Ray 的有状态 Actor 抽象替代 torch.distributed,解决了单进程瓶颈及 PyTorch 依赖限制。在 4 GPU 场景下,Ray 实现每批次检索耗时降至 1.66 秒,显著优于原有方案的 3.438 秒。

2月9日周二
1月26日周二
1月19日周二
1月18日周一
11月9日周一
  1. Hugging Face Blog32

    Hugging Face 详解如何利用预训练检查点热启动编码器-解码器模型

    Hugging Face 发布教程,演示如何使用 🤗Transformers 的 EncoderDecoderModel 框架,利用 BERT 和 GPT2 等预训练检查点热启动编码器-解码器模型。该方法基于 Rothe et al. (2020) 的研究,旨在以远低于从头预训练的成本,实现与 T5、Pegasus 等大模型在序列到序列任务上相当的性能。

11月3日周二
11月2日周一
10月10日周六
7月3日周五
  1. Hugging Face Blog26

    Reformer 模型如何用不到 8GB 内存处理 50 万 token 序列

    Reformer 模型通过重新设计 Transformer 架构,实现用不到 8GB 内存训练长达 50 万 token 的序列。相比 BERT 仅支持 512 token 的限制,Reformer 利用局部自注意力、LSH 哈希、可逆残差层及轴向位置编码四大特性大幅降低显存占用。该模型已集成至 Hugging Face Transformers 库,适用于长文本摘要等任务。

3月1日周日
2月14日周五
2月26日周二
11月8日周四
8月29日周一