Hugging Face Blog·· 2024-03-05AI 评分29
ConTextual 数据集发布:评估多模态模型在文本丰富场景中的联合推理能力
Introducing ConTextual: How well can your Multimodal model jointly reason over text and image in text-rich scenes?
AI 导读
UCLA 研究人员推出 ConTextual 数据集,包含 506 个指令,旨在评估大语言模型(LMM)对图像中文本与视觉上下文的联合推理能力。基准测试显示,GPT-4V 等专有模型在信息图和时间读取任务上表现不佳,开源模型如 LLaVA-v1.5-13B 存在显著领域差距。增强型 LLM 方法仅获 17.2% 的人类认可率,表明当前模型在处理文本丰富的真实场景时仍有巨大提升空间。
来源:Hugging Face Blog · huggingface.co