跳到正文
原文
Hugging Face Blog·· 2024-07-18AI 评分48

Hugging Face 发布 Docmatix:规模达 DocVQA 240 倍的文档视觉问答数据集

Docmatix - a huge dataset for Document Visual Question Answering

AI 导读

Hugging Face 推出 Docmatix,包含 240 万张图像和 950 万组问答对,规模是现有 DocVQA 数据集的 240 倍。该数据由 PDFA 经 Phi-3-small 生成并过滤幻觉后构建。实验显示,用其微调 Florence-2 模型可使 DocVQA 性能提升约 20%,且 0.7B 参数版本表现仅比 8B Idefics2 低 5%。

来源:Hugging Face Blog · huggingface.co