Hugging Face Blog·· 2024-06-24AI 评分53
Florence-2 微调教程:在 DocVQA 数据集上实现视觉问答
Fine-tuning Florence-2 - Microsoft's Cutting-edge Vision Language Models
AI 导读
Hugging Face 发布教程展示如何微调 Microsoft 的 Florence-2 模型以支持 DocVQA 任务。通过冻结视觉编码器并在单张 A100 GPU 上使用 batch size 6 进行 7 个 epoch 的训练,验证集上的 Levenshtein 相似度从 0 提升至 57.0。该过程证明了小参数量视觉语言模型在受限资源下适配下游任务的可行性。
来源:Hugging Face Blog · huggingface.co