跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

125条精选相关主题图像生成AI 视频语音与音频

最新精选

第 121–125 条 · 共 125 条
9月25日周一
  1. OpenAI News62

    OpenAI 宣布 ChatGPT 支持看、听和说

    OpenAI 宣布 ChatGPT 新增视觉和听觉功能,支持用户通过图像和语音进行交互。该更新使模型能够处理非文本输入并生成相应回复,扩展了对话场景。

    推荐理由:官方宣布 ChatGPT 具备视觉和听觉能力,用户可据此了解交互方式从纯文本向多模态的转变。

8月22日周二
  1. Hugging Face Blog70

    Hugging Face 发布开源视觉语言模型 IDEFICS

    Hugging Face 推出开源视觉语言模型 IDEFICS,作为 DeepMind Flamingo 的公开复现版本。该模型提供 9B 和 80B 参数两种规模及指令微调变体,支持图文交错输入与文本生成。训练数据包含新创建的 115B token 数据集 OBELICS,模型权重在 Hugging Face Hub 上线并集成至 transformers 库。

    推荐理由:原文公开了基于 Flamingo 架构的开源复现细节及 OBELICS 数据集,为社区提供了可验证的多模态大模型训练基准。

3月14日周二
  1. OpenAI News92

    OpenAI 发布 GPT-4 多模态大模型

    OpenAI 发布 GPT-4,这是其深度学习规模化工作的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入并输出文本。尽管在许多现实场景中能力仍不及人类,但它在各类专业和学术基准测试中展现出人类水平的性能。

    推荐理由:原文确认 GPT-4 为支持图文输入的多模态大模型,并在专业与学术基准上达到人类水平表现。

2月15日周三
1月5日周二
  1. OpenAI News70

    OpenAI 发布 CLIP:连接文本与图像的神经网络

    OpenAI 推出名为 CLIP 的神经网络,该模型通过自然语言监督高效学习视觉概念。CLIP 可直接应用于任何视觉分类基准,只需提供待识别类别的名称即可实现类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:原文介绍了CLIP通过自然语言监督学习视觉概念,并具备类似GPT的零样本分类能力。