← 返回总览

DocVQA low

datasetgeneralmultimodaldocument-understandingimagetext

2020 · https://rrc.cvc.uab.es/?ch=17 · freshness: aging 文档 VQA 的奠基数据集;前沿 VLM 已高分,作为标准对标项仍被广泛引用但区分力下降。

专家判语 Expert verdict low

值得回答:已饱和的文档 VQA 还值不值得引用, 作为门槛还是弃用? 我认为是作为门槛 它与 OCRBench的分工(理解 vs 识别) 在你选文档处理模型时怎么用? 确实有交集,但OCRbench更新更频繁一些,多专注于表格处理; VQA领域更广,但由于已饱和且少连续复杂推理,一般作为入门级别。

— 署名 chenhao · 2026-06-17

它是什么 Agent summary 事实 · AI 整理

DocVQA(全称 Document Visual Question Answering,意思是“看着文档图片回答问题”)是这一类测试的奠基考卷,由 Mathew、Karatzas、Jawahar 三人在 2020 年发布(论文见 arXiv 2007.00398,正式发表于 WACV 2021)。它包含 50,000 个问题,出在 12,000 多张文档图片上。要做对题,AI 不能只读纯文字,得真的“看懂”图片里的版面:表格长什么样、表单填在哪、文字排在哪个位置。这套题目在 RRC(Robust Reading Competition,一个长期举办的文字识别竞赛)上设有公开排行榜,各家在介绍自己多模态大模型(能同时看图读文的 AI)时,也常拿它来对比文档能力。我们这条记录就是在翻看这些技术报告时发现的。

要注意两点。第一,它本质是一套数据集(外加一个竞赛榜),不是某个模型自带的排名,得有人拿模型去跑才会出分。第二,这套题公开太多年,如今主流的多模态大模型普遍都能拿高分,既有数据污染的风险(模型可能提前见过这些题、靠背答案虚高),也已经接近满分饱和,拉不开差距了。它只测单张文档的看图回答,不涉及跨多页推理、长文档,也不测让模型自己写一段话。

① 权威 Authority
学术/机构/引用

维护方 maintainersMinesh Mathew, Dimosthenis Karatzas, C.V. Jawahar (IIIT Hyderabad / CVC)
机构数 institutions0
更新节奏 cadencefrozen
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 document-understandingvisual-qalayout-reading

模态 imagetext   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览