跳到正文

#多模态

今日 0 条
3月6日周一
2月15日周三
2月3日周五
1月30日周一
  1. Hugging Face Blog38

    Hugging Face 计算机视觉生态现状:支持8大核心任务与超3000个模型

    Hugging Face Hub 现已支持图像分类、分割等 8 项核心计算机视觉任务,收录超过 3000 个模型和 100 多个数据集。平台通过 Transformers 库集成 ViT、Swin 及 ConvNeXt 等架构,并提供 Pipelines 简化推理流程。开发者可利用 Trainer API 微调模型,或借助 Datasets 库加载 ImageNet-1k 等数据以加速训练。

1月20日周五
1月16日周一
11月21日周一
7月28日周四
3月16日周三
12月15日周三
  1. Hugging Face Blog53

    Hugging Face Transformers 集成 Perceiver IO 全模态模型

    Hugging Face 宣布将 Perceiver IO 加入 Transformers 库,这是首个支持文本、图像、音频、视频和点云等多种模态及其组合的 Transformer 基神经网络。该模型通过在潜在变量上执行自注意力机制,解决了传统 Transformer 在高维数据上的计算和内存扩展性限制。文中展示了其在光学流预测、图像分类及多模态自动编码等任务中的具体实现代码与性能表现。

10月13日周三
  1. Hugging Face Blog24

    使用遥感卫星图像和描述微调 CLIP

    团队利用 RSICD、UCM 及 Sydney 数据集对 OpenAI 的 CLIP 模型进行微调,以适配遥感卫星图像场景。该模型通过对比学习优化图文联合嵌入表示,支持基于文本查询检索大规模卫星影像。项目展示了在 Flax/JAX 框架下结合数据增强技术提升特定领域零样本推理能力的实践方案。

3月4日周四
1月5日周二
  1. OpenAI News70

    OpenAI 发布 CLIP:连接文本与图像的神经网络

    OpenAI 推出名为 CLIP 的神经网络,该模型通过自然语言监督高效学习视觉概念。CLIP 可直接应用于任何视觉分类基准,只需提供待识别类别的名称即可实现类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:原文介绍了CLIP通过自然语言监督学习视觉概念,并具备类似GPT的零样本分类能力。

4月25日周四
  1. OpenAI News45

    OpenAI 发布 MuseNet:基于 Transformer 的多风格音乐生成模型

    OpenAI 推出 MuseNet,这是一款能生成 4 分钟、包含 10 种乐器并融合从乡村到披头士等多种风格的深度神经网络。该模型未显式编程音乐知识,而是通过预测数十万个 MIDI 文件中的下一个 token 来学习和谐、节奏与风格模式。MuseNet 采用与 GPT-2 相同的大规模 Transformer 架构,具备通用的无监督学习能力。