Hugging Face Blog·· 2024-07-18AI 评分48
Hugging Face 发布 Docmatix:规模达 DocVQA 240 倍的文档视觉问答数据集
Docmatix - a huge dataset for Document Visual Question Answering
AI 导读
Hugging Face 推出 Docmatix,包含 240 万张图像和 950 万组问答对,规模是现有 DocVQA 数据集的 240 倍。该数据由 PDFA 经 Phi-3-small 生成并过滤幻觉后构建。实验显示,用其微调 Florence-2 模型可使 DocVQA 性能提升约 20%,且 0.7B 参数版本表现仅比 8B Idefics2 低 5%。
来源:Hugging Face Blog · huggingface.co