跳到正文
原文
Hugging Face Blog·· 2024-03-05AI 评分36

Hugging Face 发布 ConTextual:评测多模态模型在文本密集场景中的图文联合推理能力

Introducing ConTextual: How well can your Multimodal model jointly reason over text and image in text-rich scenes?

AI 导读

加州大学洛杉矶分校研究者推出 ConTextual,一个包含 506 条指令的文本密集视觉推理数据集,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。初步评测 13 个模型显示,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上落后;开源模型在多个领域表现不佳,用 OCR 加 caption 增强 LLM 的方案人类通过率仅 17.2%。

来源:Hugging Face Blog · huggingface.co