OpenAI 宣布 ChatGPT 支持看、听和说
OpenAI 宣布 ChatGPT 新增视觉和听觉功能,支持用户通过图像和语音进行交互。该更新使模型能够处理非文本输入并生成相应回复,扩展了对话场景。
推荐理由:官方宣布 ChatGPT 具备视觉和听觉能力,用户可据此了解交互方式从纯文本向多模态的转变。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
OpenAI 宣布 ChatGPT 新增视觉和听觉功能,支持用户通过图像和语音进行交互。该更新使模型能够处理非文本输入并生成相应回复,扩展了对话场景。
推荐理由:官方宣布 ChatGPT 具备视觉和听觉能力,用户可据此了解交互方式从纯文本向多模态的转变。
Hugging Face 推出开源视觉语言模型 IDEFICS,作为 DeepMind Flamingo 的公开复现版本。该模型提供 9B 和 80B 参数两种规模及指令微调变体,支持图文交错输入与文本生成。训练数据包含新创建的 115B token 数据集 OBELICS,模型权重在 Hugging Face Hub 上线并集成至 transformers 库。
推荐理由:原文公开了基于 Flamingo 架构的开源复现细节及 OBELICS 数据集,为社区提供了可验证的多模态大模型训练基准。
OpenAI 发布 GPT-4,这是其深度学习规模化工作的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入并输出文本。尽管在许多现实场景中能力仍不及人类,但它在各类专业和学术基准测试中展现出人类水平的性能。
推荐理由:原文确认 GPT-4 为支持图文输入的多模态大模型,并在专业与学术基准上达到人类水平表现。
Salesforce Research 的 BLIP-2 模型已集成至 Hugging Face Transformers,支持零样本图像描述、提示词引导生成及视觉问答。
推荐理由:原文演示了如何在 Transformers 中调用 BLIP-2 完成图像描述与问答,提供了可复用的代码路径。
OpenAI 推出名为 CLIP 的神经网络,该模型通过自然语言监督高效学习视觉概念。CLIP 可直接应用于任何视觉分类基准,只需提供待识别类别的名称即可实现类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:原文介绍了CLIP通过自然语言监督学习视觉概念,并具备类似GPT的零样本分类能力。