跳到正文

#Hugging Face

今日 0 条
10月20日周三
10月13日周三
  1. Hugging Face Blog24

    使用遥感卫星图像和描述微调 CLIP

    团队利用 RSICD、UCM 及 Sydney 数据集对 OpenAI 的 CLIP 模型进行微调,以适配遥感卫星图像场景。该模型通过对比学习优化图文联合嵌入表示,支持基于文本查询检索大规模卫星影像。项目展示了在 Flax/JAX 框架下结合数据增强技术提升特定领域零样本推理能力的实践方案。

10月5日周二
9月24日周五
9月14日周二
7月15日周四
  1. Hugging Face Blog53

    Hugging Face 发布 DeDLOC 算法实现互联网协同训练语言模型

    Hugging Face 联合多家机构提出 DeDLOC 方法,旨在利用志愿者分散的 GPU 资源进行大规模语言模型预训练。团队组织40名志愿者成功预训练了孟加拉语模型 sahajBERT,其下游任务性能接近使用数百个高端加速器的更大规模模型。该实验证明了在普通网络环境下通过自适应梯度聚合实现高效分布式训练的潜力,相关代码已集成至 Hivemind 库。

7月13日周二
7月8日周四
6月28日周一
  1. Hugging Face Blog32

    Hugging Face Hub 集成 Sentence Transformers v2:支持90+模型及新组件

    Hugging Face Hub 正式集成 Sentence Transformers v2,提供超过 90 个覆盖 100 多种语言的预训练模型。Hub 新增特征提取和句子相似度两个组件,并开放 Inference API 端点以支持程序化调用。用户可通过 `save_to_hub` 快速分享模型,自动生成的模型卡片将展示架构详情及使用指南。

6月3日周四
5月25日周二
4月20日周二
4月16日周五
  1. Hugging Face Blog52

    Hugging Face 发布 🤗 Accelerate 库以简化 PyTorch 分布式训练

    Hugging Face 推出开源库 🤗 Accelerate,旨在让 PyTorch 用户无需重写样板代码即可在多种设备配置上运行原始训练脚本。该库提供统一 API 和启动器命令,支持多 GPU、TPU 及混合精度训练,并计划集成 fairscale、DeepSpeed 和 AWS SageMaker。用户只需添加少量代码行即可自动处理设备放置和数据加载器包装,同时兼容传统启动方式。

4月8日周四
3月31日周三
  1. Hugging Face Blog38

    BigBird 块稀疏注意力机制详解

    BigBird 采用块稀疏注意力替代 BERT 的全注意力,将序列长度支持提升至 4096 并显著降低计算成本。该模型通过滑动窗口、全局 token 和随机 block 三种机制近似全注意力矩阵,在长文档摘要等任务中实现 SOTA。BigBird RoBERTa-like 模型现已集成至 Hugging Face Transformers 库。

3月23日周二
  1. Hugging Face Blog42

    Hugging Face 与 Amazon SageMaker 达成战略合作并推出深度学习容器

    Hugging Face 宣布与 Amazon 建立战略合作,将 AWS 设为首选云服务商。双方推出新的 Hugging Face Deep Learning Containers (DLCs),支持在 Amazon SageMaker 中训练 Transformer 模型。该集成通过 SageMaker Python SDK 简化部署流程,利用自动模型调优和分布式训练库加速从实验到生产的转化。

3月18日周四
3月12日周五
3月9日周二
  1. Hugging Face Blog23

    Hugging Face 2021年2月阅读组:Long-range Transformers

    Hugging Face 发布2021年2月“长程Transformer”阅读组总结,聚焦降低模型计算成本。文章综述了 Longformer、Compressive Transformer、Linformer 和 Performer 四种方法,分别采用自定义注意力模式、递归、低秩近似和核近似技术。这些方案旨在解决标准自注意力机制随序列长度二次增长的计算瓶颈,支持处理超过512或1024长度的序列。

2月25日周四
2月10日周三
  1. Hugging Face Blog21

    Hugging Face 集成 Ray 加速 RAG 检索与微调

    Hugging Face Transformers 中的 RAG 模型通过集成 Ray 库,将上下文文档检索速度提升 2 倍并优化分布式微调扩展性。该方案利用 Ray 的有状态 Actor 抽象替代 torch.distributed,解决了单进程瓶颈及 PyTorch 依赖限制。在 4 GPU 场景下,Ray 实现每批次检索耗时降至 1.66 秒,显著优于原有方案的 3.438 秒。

2月9日周二
1月26日周二
1月19日周二
1月18日周一
11月9日周一
  1. Hugging Face Blog32

    Hugging Face 详解如何利用预训练检查点热启动编码器-解码器模型

    Hugging Face 发布教程,演示如何使用 🤗Transformers 的 EncoderDecoderModel 框架,利用 BERT 和 GPT2 等预训练检查点热启动编码器-解码器模型。该方法基于 Rothe et al. (2020) 的研究,旨在以远低于从头预训练的成本,实现与 T5、Pegasus 等大模型在序列到序列任务上相当的性能。

11月3日周二
11月2日周一
10月10日周六
9月10日周四
7月3日周五
  1. Hugging Face Blog26

    Reformer 模型如何用不到 8GB 内存处理 50 万 token 序列

    Reformer 模型通过重新设计 Transformer 架构,实现用不到 8GB 内存训练长达 50 万 token 的序列。相比 BERT 仅支持 512 token 的限制,Reformer 利用局部自注意力、LSH 哈希、可逆残差层及轴向位置编码四大特性大幅降低显存占用。该模型已集成至 Hugging Face Transformers 库,适用于长文本摘要等任务。

3月1日周日
2月14日周五