跳到正文
原文
Hugging Face Blog·· 2024-05-14精选AI 评分82

谷歌发布开源视觉语言模型 PaliGemma

PaliGemma – Google's Cutting-Edge Open Vision Language Model

AI 导读

谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。

推荐理由

原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。

来源:Hugging Face Blog · huggingface.co