VDR DATA OS
VDR / 项目文档 / 冻结评测

冻结评测

候选池、qrels、Case 与评测边界

开源测试集分析

本文是冻结评测资产的事实账本:记录候选池、Query/qrels、真实 Case、抽样和使用边界。项目状态只在 STATUS.md 维护。评测页、Query、答案、qrels、证据及其近重复项不得用于训练、合成、hard-negative 挖掘、模型选择或阈值调参。

统一约束

  • HuggingFace 元数据中的 split 名称不是训练许可。eval.parquet、上游 benchmark 定义和本项目的逻辑角色优先于其 train 标签。
  • 必须保留原始 Query–正页面/qrels 关系和候选库规模;清洗副本与官方原始评测必须分别报告。
  • 下文的重合检查均为页面 ID 或规范化文本的精确匹配,不能替代全量图片感知去重。

1. vdr-multilingual-test

这是 vdr-multilingual-train 对应的多语种视觉检索 benchmark。

  • 路径:data/vdr-multilingual-test/;5 种语言 de/en/es/fr/it,每种语言使用 eval.parquet
  • 每种语言 3,000 页,共 15,000 页;字段为 idqueryimagepagetypelanguage,没有 answernegatives 或显式 qrels。
  • 每种语言有 visualmixtext 三个独立子 benchmark。每类都是 1,000 页、100 条 Query。
  • 每个 1,000 行区段的前 100 行有 Query;非空 Query 所在行及其同一行图片是隐式 Query–正页面对,余下 900 行组成候选页。
  • 评测粒度固定为 语言 × pagetype,即 15 个 benchmark;不得将不同语言或类型的候选页混入同一 1,000 页候选池。

真实 Case

[de / visual]
Query:Wie viel kostet der HERMA Ordner A4 Social Icons?
正页面 ID:de_10_638be5d4e15a73ebefd68f8107a8d56a2c914a25
[en / visual]
Query:What is the quarter-on-quarter growth rate of Klook in Asia-Pacific as of October 2022?
正页面 ID:en_38_ad48ef166177e56ece9322605f7492caf3d345ed
[en / mix]
Query:What was the average growth rate of Jack pines?
正页面 ID:en_22_825138bf832d7e63bce7a8453e156d4636f94ba7
[es / mix]
Query:¿Cuál es el año de publicación del Reglamento de la Comisión Asesora de la UNRWA?
正页面 ID:es_70_f4f0afb2d3eaf881be0f4e6b5c8c3284a29955fa
[it / visual]
Query:Qual è il documento regionale di adattamento della Lombardia?
正页面 ID:it_30_8a6af5057bce0f34eb939f91ddd443a154c35400

本地导出抽样

以下图片与字段直接对应 Git 忽略目录 开源数据样本/vdr-multilingual-test/samples.jsonl

[sample #1 | de / visual]
图片:de_visual_0000.jpg
Query:Wie viel kostet der HERMA Ordner A4 Social Icons?
正页面 ID:de_10_638be5d4e15a73ebefd68f8107a8d56a2c914a25
[sample #2 | de / mix]
图片:de_mix_1000.jpg
Query:Welche Filme wurden beim Camerimage Festival in Bydgoszcz mit goldenen Fröschen ausgezeichnet?
正页面 ID:de_27_4b3abd7225bcb43abba795c72c28d7d8c03c96f8

与训练集的隔离检查

  • 五种语言的测试页面 idvdr-multilingual-train 的页面 id 交集均为 0
  • 德语、英语、法语、意语的非空 Query 与训练 Query 精确交集均为 0
  • 西语有 1 条文本重合:¿Cuántos centros Adobe Authorized Training Center hay en España?。训练页为 es_3_ddbd30b209d74aaa53933b274c1dd10f0de79755,测试页为 es_3_ae1c7d70e787eb8b92d334f1586e9249a579b76d。构建零测试文本泄漏的自定义训练副本时,应过滤该训练 Query。
  • 法语 text 子集的 ID fr_1_513e8e20fb267438be90ee1860d7188668d02c4c 及其 Query 在第 20272071 行重复。官方评测保留原始重复;内部去重版须另命名并同时报告原始分数。

真实页面图片、Query 与行号已导出到 Git 忽略目录 开源数据样本/vdr-multilingual-test/

2. VisRAG-Ret-Test-*(6 个)

这 6 个检索 benchmark 不包含 languagetext/visual/mix 字段;它们按文档任务域划分,使用显式三段式评测结构:

corpus:候选页面图片(corpus-id, image)
queries:问题与参考答案(query-id, query, answer, options, is_numerical)
qrels:正页面关系(query-id, corpus-id, score)
  • 所有 qrels 都能指向现有 corpus 页面,且分数均为 1
  • ArxivQA、ChartQA、InfoVQA、MP-DocVQA、PlotQA 的每个 Query 有 1 个正页。
  • SlideVQA 有 556 条 Query 和 702 条 qrels,其中 146 条 Query 有 2 个正页,评测不能只保留一个正页。

规模与真实 Case

[ArxivQA | 8,066 页 / 816 Query]
Query:Which statement best describes the relationship between the components labeled 'Myosin' and 'Actin filament'?
Answer:C
正页面:1508.06771_0.jpg
Options:C) Myosin heads are bound to actin filaments.
[ChartQA | 500 页 / 63 Query]
Query:How many more people felt inspired frequently than depressed frequently?
Answer:0.03
正页面:3960.png
[InfoVQA | 459 页 / 718 Query]
Query:Which social media site was invented in 2002?
Answer:['friendster']
正页面:36966.jpeg
[MP-DocVQA | 741 页 / 591 Query]
Query:Where is the birth defects clinical study center in Pennsylvania?
Answer:['Philadelphia']
正页面:ngxh0227_p74.jpg
[PlotQA | 9,593 页 / 863 Query,其中 558 条数值题]
Query:Across all years, what is the minimum percentage of unemployed female labor force in Europe(all income levels)?
Answer:7.3613074550266
正页面:8111.png
[SlideVQA | 1,284 页 / 556 Query / 702 qrels]
Query:In which year did the company that divested Eismann in 2004 achieve higher Organic Growth, 2003 or 2004?
Answer:2003
正页面:...presentation-7-1024.jpg、...presentation-13-1024.jpg

与本地训练来源的泄漏

  • colpali_train_set 含有 108 条 ArxivQA 测试泄漏记录:Query 相同,且正图文件名也与测试 qrel 的 corpus-id 相同。它不能与 ArxivQA 测试集同时用于独立泛化评测。
  • VisRAG-Ret-Train-In-domain-data 存在规范化精确 Query 重合:ArxivQA 50、InfoVQA 2、MP-DocVQA 11、PlotQA 136、SlideVQA 1 条;ChartQA 为 0。其匹配的训练行数更高,因为训练集中存在重复 Query。
  • VisRAG-Ret-Train-Synthetic-data 与这 6 个测试集没有规范化精确 Query 重合。

若需基于本地训练来源评测这些 benchmark,必须构建过滤后的训练副本,并将过滤规则、删除数量和官方原始分数一并记录。

3. MMLongBench-Doc

这是面向长上下文多模态文档理解的 benchmark。虽然本地 Parquet split 名为 train,上游将其定义为 benchmark;项目内逻辑角色固定为 test

  • 路径:data/MMLongBench-Doc/135 份 PDF 和 1,091 个问题,覆盖研究报告、教程/Workshop、学术论文、指南、Brochure、行业/行政文件、财报 7 类文档。
  • 每份 PDF 有 3–18 个问题。字段为 doc_iddoc_typequestionanswerevidence_pagesevidence_sourcesanswer_format
  • evidence_pagesevidence_sources 保存为字符串化 Python 列表,读取时必须解析;文档页码含 0,渲染时应按 PDF 页索引验证。
  • 360/1,091(33.0%)是跨页问题;244answer_format=None,参考答案为 Not answerable
  • 证据类型出现次数:文本 298、Figure 293、Table 218、Chart 178、布局文本 119

真实 Case

[Research report / Chart]
文档:PH_2016.06.08_Economy-Final.pdf
Question:According to the report, how do 5% of the Latinos see economic upward mobility for their children?
Answer:Less well-off
Evidence:page [5] / Chart
[Academic paper / Table + Layout]
文档:2005.12872v3.pdf
Question:According to the DETR PyTorch inference code, what is the output dimension of the linear_class layer?
Answer:92
Evidence:page [26] / Table, Generalized-text (Layout)
[Cross-page / Table]
文档:PH_2016.06.08_Economy-Final.pdf
Question:According to the report, which one is greater in population in the survey? Foreign born Latinos, or the Latinos interviewed by cellphone?
Answer:Latinos interviewed by cellphone
Evidence:pages [19, 20] / Table
[Guidebook / Figure]
文档:honor_watch_gs_pro.pdf
Question:What is the time on the gallery screenshot when demostrating how to set galley watch faces?
Answer:10:08AM
Evidence:pages [39, 40, 41] / Figure
[Unanswerable]
文档:Independents-Report.pdf
Question:What's the percentage of people who are democrats and voted in the last election compared to the entire population in 2024?
Answer:Not answerable
Evidence:[] / None

标注边界与隔离检查

  • 9 条可回答问题的 evidence_pages=[],另有 7 条不可回答问题仍有证据页;空证据页不能单独作为不可回答判断。
  • 与本地 colpali_train_set、VisRAG Synthetic、VisRAG In-domain 的 Query 做规范化精确匹配,交集均为 0;尚未完成 PDF/图片级感知去重。
  • 后续本地样本将按 7 类文档、跨页、数值和不可回答等维度分层选择 12 个问题,并将每题全部证据页渲染为 PNG。

4. 前三套评测的共同边界

允许:使用冻结的原始 Query、候选页和 qrels/证据页计算指标;
      分别报告原始 benchmark 与显式命名的内部清洗 benchmark;
      在 Git 忽略目录导出少量图片供人工检查。

禁止:将测试页面、Query、答案、qrels、证据页或近重复项加入训练;
      用测试集生成合成 Query、负样本或蒸馏样本;
      使用测试集反复选择 Prompt、模型版本、训练轮次或阈值后仍报告为独立泛化结果。

5. JinaVDR

JinaVDR 是视觉文档检索评测集合,而不是一份可以统一打散的训练数据。官方项目见 jina-ai/jina-vdr;本地路径为 data/JinaVDR/,约 15G,共 42 个子数据集。本地所有配置合计 60,845 行。

真实 Case

[europeana-it-scans / 意大利历史扫描件]
Query:Quali sono gli insegnamenti che il discorso di Andreotti suggerisce?
正页面:images/446__ASILS_Fondo_Giulio_Andreotti_Discorsi0090.jpg
特点:意大利语历史档案,页面含印刷或手写内容,并附 Europeana 来源链接和署名信息。
[shanghai_master_plan / 中文城市规划]
Query:上海市城市总体规划2017-2035生态网络布局图
正页面:page_67.jpg
特点:需要从中文总体规划的地图、布局和文字中完成检索。
[ChartQA / 图表]
Query:What was the average ticket price in the 2006/07 season?
正图 ID:1500
特点:同一图表可对应多个问题;本地 1,000 个问题行实际对应 834 张唯一图片。
[medical-prescriptions / 医疗文档]
Query:What is Dexter's Patient Health Questionnaire 2 item (PHQ-2) total score [Reported] on 2020-08-29?
正图 ID:img_36
特点:包含医疗处方或健康记录,既有专业缩写,也有隐私与合规风险。
[jdocqa / 日文文档]
Query:八王子神社は「はちおっつぁん」と呼ばれ住民に親しまれていますが、
       事故が起きたような言い伝えはありますか。
正图 ID:0
特点:自由回答式日文问题,本节只使用其 Query–页面关系做冻结检索评测。
[airbnb-synthetic-retrieval / 中文合成检索]
Query:在East Village找一个地方从Dec 01, 2018到Dec 04, 2018价格低于$78。
正页面:5118de5d-2b2d-4fa0-b656-34d238e1b3dc.png
特点:中文条件查询对应英文地点、日期与价格信息组成的渲染表格。

行结构与空 Query 的正确解释

  • 多数子集使用 queryimageimage_filenametext_description 四个核心字段;部分子集另有 linksattributions 等来源信息。text_description 通常是 OCR 文本,不是额外的相关性标注。
  • JinaVDR 没有统一的显式 qrels。对非空 Query 行,该行图片就是隐式正页面;候选库则由当前子数据集的全部唯一 image_filename 构成。
  • 空 Query 行不是数据损坏。 官方统计表把 Queries 和 Documents 分开报告,而本地 Parquet 将问题行与仅作为候选文档的行放在同一结构中。本地全量审计得到 17,470 / 60,845 = 28.7% 的空 Query 行,它们必须留在候选库中。
  • docvqa 本地有 38 条非空 Query、499 张唯一文档和 461 条空 Query 候选行;官方原始表报告 39 Queries / 499 Documents。空 Query 与非空 Query 的 image_filename 交集为 0
  • airbnb-synthetic-retrieval 本地有 4,952 条非空 Query、10,000 张唯一文档和 5,048 条空 Query 候选行;官方原始表报告 4,953 Queries / 10,000 Documents。两类行的图片文件名交集同样为 0
  • stanford_slide 本地有 13 条非空 Query、994 张唯一文档和 987 条空 Query 候选行;官方原始表报告 14 Queries / 994 Documents。其 13 个问题落在少量被重复提问的页面上,因此行数不能直接当作文档数。
  • ChartQA 等子集没有空 Query 行,但会让同一图片对应多个问题。候选库仍应按唯一图片构建,而不能把 1,000 个问题行误算成 1,000 张候选图。

评测口径与质量边界

  • 评测时必须按 42 个子数据集分别建候选池、分别计算指标;先过滤空 Query 以形成问题集合,同时保留该子集的每一张唯一图片作为 corpus。
  • 非空 Query 所在图片构成隐式正例。不能把空 Query 行删掉后再建 corpus,否则会系统性缩小候选库并虚高检索分数。
  • 本地 Query 数与官方表在 docvqa、Airbnb、Stanford Slide 等任务上各有 1 条差异,较可能来自数据版本或过滤规则变化,不能静默改写成同一口径。报告中应同时列出官方原始 benchmark 数和本地实际运行数。
  • OCR、图片、Query、隐式正例及候选文档均属于冻结评测资产;不得用于训练、合成 Query、OCR 蒸馏或 hard-negative 挖掘。医疗处方等敏感领域样本还应限制人工复核范围和传播方式。

本地复核导出

  • 已向 开源数据样本/JinaVDR/ 导出 100 条 review-only 样本,覆盖全部 42 个子数据集,每个子集 2–3 条;100 条均为非空 Query 行,且 Query–图片对无重复,没有把 corpus-only 空 Query 行误当成问题。
  • 每条 manifest 保留子数据集、Query、image_filename、仅供复核的 text_description 预览、来源 Parquet 与本地行号;正图写入 images/。这些产物均标记 evaluation_only=true,不属于训练导出。

6. MIRACL-VISION

MIRACL-VISION 是标准 BEIR 风格的多语种视觉检索 benchmark。本地路径为 data/miracl-vision/,约 91G,覆盖 ar/bn/de/en/es/fa/fi/fr/hi/id/ja/ko/ru/sw/te/th/yo/zh 共 18 种语言。

真实 Case

[en]
Query ID:910
Query:On what TV network did Scooby-Doo first air?
正文章:Scooby-Doo, Where Are You!
Corpus ID / Image ID:2610234 / i13
[zh]
Query ID:7443372
Query:联合国五常国家有哪些?
正文章:联合国安全理事会常任理事国
Corpus ID / Image ID:49655 / i632
[ja]
Query ID:4
Query:森上亜希子の出身はどこ
正文章:森上亜希子
Corpus ID / Image ID:329100 / i15378
[ar]
Query ID:8574
Query:في أي عام تأسست منظمة الدول المصدرة للنفط أوبك؟
正文章:أوبك
Corpus ID / Image ID:233622 / i9502

结构、规模与多正例

  • 每种语言都有独立的 queries.parquetcorpus.parquetqrels.parquetimages.parquet。本地合计 7,898 条 Query、338,734 条 corpus/image 和 10,094 条 qrels。
  • 代表性规模为:英语 447 Query / 42,971 corpus / 623 qrels,中文 189 / 8,672 / 269,阿拉伯语 2,127 / 75,444 / 2,558。候选池应按语言隔离,不能将 18 种语言的图片合并后冒充官方指标。
  • Query 字段为 _idtext;qrels 字段为 query-idcorpus-idscore,本地相关性分数均为 1
  • corpus 字段为 _idtexttitleimage_idtext_downloaded_from_Wikipedia。本地只有英语 corpus 额外含 text_obtained_via_ocr_from_screenshots;不能假设其余 17 种语言也有同等 OCR 字段或 OCR 质量。
  • 一个问题可以有多个正文档。英语平均每个 Query 有 623 / 447 = 1.39 个正例,单个 Query 最多 7 个;只保留第一条 qrel 会错误惩罚其他有效命中。

冻结评测边界

  • 该数据适合测试大规模多语种视觉检索:Query 用目标语言表达,corpus 同时提供 Wikipedia 文本、标题和页面截图图像。
  • 官方评测应保留每种语言完整的大候选库和全部多正例 qrels。图片与 corpus 通过 image_id 对齐,不能仅用标题命中替代视觉页面检索结果。
  • Query、qrels、corpus 文本、页面图片以及英语特有 OCR 都是冻结测试信息。它们不得进入训练、数据合成、负例挖掘、检索器蒸馏或生成模型提示优化;尤其不能把 corpus/OCR 当成“无标签语料”回流训练。

本地复核导出

  • 已向 开源数据样本/miracl-vision/ 导出 100 条样本,覆盖全部 18 种语言,每种语言 5–6 条;选中 qrels 的本地 score 均为 1
  • 导出先用轻量 ID 列完成 qrels → query/corpus → corpus.image_id → images.file_name 连接,再只读取选中图片所在 row group。manifest 保留语言、Query/Corpus ID、标题和 review-only 文本预览,100 张正图均可解码。

7. NayanaIR-Bench

本地 data/NayanaIR-Bench/11G,由单语的 MonoBench 和跨语种的 CrossBench-v3 两类 benchmark 组成。二者任务定义与候选池不同,不能混合统计。

真实 Case

[MonoBench-en]
Query:What was the preference for the basketball court flooring as stated by Mr. Siciliano?
Answer:Mr. Siciliano stated that the preference for the basketball court would be a wood floor.
正页:document_27791_page_0_en(score=2)、
      document_27791_page_1_en(score=1)
[MonoBench-zh]
Query:文本中提到的曾孙的总数是多少?
Answer:有2个曾孙。
正页:document_13834_page_1_zh(score=2)
[MonoBench-hi]
Query:स्वास्थ्य और शिक्षा आयोग के लिए नियमित बैठक एजेंडा पर अंतिम आइटम क्या है?
Answer:नियमित बैठक के एजेंडे पर अंतिम आइटम 'स्थगन' है।
正页:document_2899_page_1_hi(score=2)
[CrossBench-v3 / 旁遮普语 Query → 英文文档]
Query:ਦੂਜੀ-ਪੀੜ੍ਹੀ ਦੇ ਐਂਟੀਸਾਈਕੋਟਿਕਸ ਨੂੰ ਸ਼ਾਈਜ਼ੋਫਰੀਅਨੀਆ ਦੇ ਇਲਾਜ ਵਿੱਚ
       ਪਹਿਲੇ ਪੀੜ੍ਹੀ ਐਂਟੀਸਾਈਕੋਟਿਕਸ ਨੂੰ ਤਰਜੀਹ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ?
正页:document_12069_page_4_en(corpus-id=4640,score=2)
特点:Query 和答案为旁遮普语,相关页面为英文,明确测试跨语种视觉检索。

MonoBench

  • MonoBench 覆盖 ar/bn/de/en/es/fr/gu/hi/it/ja/kn/ko/ml/mr/or/pa/ru/sa/ta/te/th/zh 共 22 种语言。每种语言约 200 条 Query、固定 1,000 张候选页。
  • 本地合计 4,399 条 Query、22,000 条 corpus 和 6,082 条 qrels;英语本地为 199 条 Query,其余规模以本地文件为准,不应机械写成每种语言恰好 200 条。
  • MonoBench 存在多正例和分级相关性。以英语为例,平均每个 Query 有 2.40 条 qrels,最多 7 条,score 可为 12。应使用支持 graded relevance 和多正例的指标实现。

CrossBench-v3

  • CrossBench-v3 本地有 1,000 条 Query、5,873 张候选页和 3,142 条 qrels,Query 实际覆盖 20 种语言。
  • 每个 Query 平均 3.14 个正例,最多 5 个;本地 qrels 的 score 均为 2。正页语言可以与 Query 语言不同,跨语种匹配本身就是任务目标。
  • CrossBench 的 corpus 是一个共享跨语种候选池;不得按 Query 语言裁剪文档,也不得与任一 MonoBench 的 1,000 页候选池拼接。

字段与 RAG 使用边界

queries:query-id, query, language, gpt-4o-reasoning, answer
corpus:corpus-id, image, doc-id
qrels:query-id, corpus-id, is-answerable, answer, score
  • 本地检查中,MonoBench 与 CrossBench-v3 的 qrels 均标为 fully answerableanswer 可用于检索后的 RAG 辅助生成评测,例如在固定召回结果上报告答案质量,但不能替代检索指标。
  • Query 侧的 gpt-4o-reasoning、答案以及 qrels 中的可回答性、答案和分数都是冻结标注,即使字段为空或可由模型重建,也不得用于训练、CoT 蒸馏、合成问题或筛选负例。
  • Mono 与 Cross 必须分别建候选池、分别报告检索指标和 RAG 辅助指标;将两类结果平均成一个分数会掩盖单语与跨语种能力差异。

本地复核导出

  • 已向 开源数据样本/NayanaIR-Bench/ 导出 100 条样本,覆盖 22 个 MonoBench 语言和 CrossBench-v3 共 23 个桶,每桶 4–5 条。
  • CrossBench-v3 的 4 条抽样均为跨语种正例,包括 pa→enkn→taes→kohi→zh;其中旁遮普语样例命中 document_12069_page_4_en。Query 答案、GPT-4o reasoning、可回答性和 qrel 答案只写入带 _review_only 后缀的字段。

8. ViDoSeek

ViDoSeek 本地路径为 data/ViDoSeek/,约 1.6G。它没有预先展开成页面级 Parquet,而是由 JSON 问题标注和两个压缩 PDF 文档库组成:vidoseek.jsonslidevqa_refined.jsonvidoseek_pdf_document.zipslidevqa_pdf_document.zip

真实 Case

[ViDoSeek / text / single_hop]
Query:Apply for Nordic Swan Ecolabel license, what is recommended as a web browser
       according to the Nordic Ecolabelling Portal instructions?
Answer:Microsoft Edge or Google Chrome.
PDF:03c7d62afbcc088cad1c810c09a71df29a29c968.pdf
Reference page:[4]
[ViDoSeek / 2d_layout / single_hop]
Query:What is the first step in the Nordic Swan Ecolabel license application process
       according to the Application Guide?
Answer:Sign in and change your password.
PDF:03c7d62afbcc088cad1c810c09a71df29a29c968.pdf
Reference page:[3]
[ViDoSeek / chart / multi_hop]
Query:Which etiology is identified as causing the highest number of liver
       transplantation cases in 2020 according to the Stanford MEDICINE report?
Answer:Alcohol
PDF:00635dc8c9b99e2c839ade4ee486b54a1bf70a67.pdf
Reference page:[3]
[SlideVQA-Refined / multi_hop]
Query:What is the title of the presentation made by Alcatel-Lucent, the company
       that won 7 Nobel Prizes, for the OVERVIEW of 2012?
Answer:AT THE SPEED OF IDEAS
PDF:alcatel-lucenteesoverview-120403090342-phpapp01_95.pdf
Reference pages:[1, 5]

vidoseek.json

  • 包含 1,142 条 Query、290 份唯一 PDF;其中 645single_hop497multi_hop
  • 来源类型为 2d_layout 730table 175chart 157text 80。这使它适合同时评测布局、表格、图表和普通文本页面的检索与回答。
  • 本地 全部 1,142 条 标注的 reference_page 长度都是 1,包括所有 497multi_hop。因此这里的 multi-hop 可以表示同一页内的多步推理,不应自动解释成跨页检索。

slidevqa_refined.json

  • 包含 2,020 条 Query、400 份唯一 PDF;其中 1,486single_hop534multi_hop
  • 来源类型为 single_span 1,347non_span 358multi_span 315
  • 与 ViDoSeek 主集不同,SlideVQA-Refined 的 534 条 multi-hop 全部至少有 2 个证据页:533 条有 2 页,1 条有 3 页。此处必须支持多页召回和多证据生成。

PDF 渲染、候选池与冻结边界

  • 实际运行视觉检索/RAG 前,需要解压 PDF,并按标注页码渲染证据页;同时还要渲染候选文档的其他页面,建立可复现的 PDF + page number → image 映射。页码基准应通过真实样例人工核对。
  • reference_page 只定义相关证据,不定义候选池。官方文档库中的原始 PDF/页面必须保留为完整候选集合,不能只渲染证据页后在“全是正例”的小池中评测。
  • 检索阶段可报告页面召回,生成阶段可在固定召回结果上比较 reference_answer;两阶段结果应分开,避免答案正确掩盖检索失败。
  • PDF、Query、reference_answerreference_pagequery_typesource_type 全部属于冻结评测信息,不得用于训练、合成、证据页提示调优或多跳轨迹蒸馏。

本地复核导出

  • 已向 开源数据样本/ViDoSeek/ 导出 100 条样本:ViDoSeek 与 SlideVQA-Refined 各 50 条;两边均覆盖 single-hop/multi-hop 和各自全部 source type。
  • 脚本直接从两个 ZIP 读取 PDF,按已核验的 1-based 页码渲染首个 reference_page,不完整解压文档库。100 条均保留全部证据页列表,其中 26 条还有额外证据页;这些附加页只记录标注,本次每条仍只导出首个证据页 PNG。

9. ViDoRe 评测资产(v1 / v2 / v3)

三套目录均固定 evaluation_only。本地路径:data/eval(v1,约 2.3G)、data/eval_v2(v2,约 2.3G)、data/eval_v3(v3,约 49G)。它们是当前最重要的视觉文档检索榜资产,也是与训练侧最容易上游重合的冻结评测集。

9.1 ViDoRe v1(data/eval

  • 形态:单文件 Query–页面隐式正对(多数行自带 image),不是独立 corpus/qrels。
  • 10 个子集与本地行数:
子集 行数 非空 Query 说明
arxivqa_test_subsampled 500 500 学术图文;含 options/answer
docvqa_test_subsampled 500 500 工业文档;answer 字段可空
infovqa_test_subsampled 500 500 信息图;含 OCR
tabfquad_test_subsampled 280 280 法语表格;70 张唯一图,同页多问
tatdqa_test 1,663 1,663 财报表;277 张唯一图
shiftproject_test 1,000 100 900 空 Query = 候选页
syntheticDocQA_* ×4 各 1,000 各 100 同上;AI/energy/gov/healthcare
  • 合计约 8,443 行;其中合成/Shift 子集的空 Query 行是 corpus 候选页,不能当正例 Query。
  • Case:docvqa “What is the dividend payout in 2012?”;syntheticDocQA_energy “What types of road improvements are planned for Greenmount Road...?”。
  • 风险:与 colpali_train_settabfquad_train_settatdqa_train、VisRAG 测试同源名高度重叠;评测必须按子集独立建池。

9.2 ViDoRe v2(data/eval_v2

  • 形态:标准 corpus / queries / qrels(部分含 docs)。
  • 规模:
任务 Queries Corpus Qrels 语言
biomedical_lectures 640 1,016 2,060 en/fr/es/de 各 160
economics_reports 232 452 3,628 四语各 58
esg_reports 228 1,538 888 四语各 57
esg_reports_human_labeled test 52 / train 52 test/train 各 1,538 各 128 人工标注;只用 test
  • biomedical/economics/esg_reports 的 qrels score 全为 2,并带 answer;多正例常见(economics 每 Query 正例 max 113)。
  • esg_reports_human_labeled 有 train/test;corpus-id 两端都从 0 起且完全重叠编号,评测只取 test,严禁把 train 当开放评测或合成材料。
  • Case:biomedical “What are the specific outcomes of using autologous chondrocyte implantation in canine studies?” → 多页正例 + 答案摘要。

9.3 ViDoRe v3(data/eval_v3

  • 形态:每领域 6 语 ×({lang}-corpus|queries|qrels);本地 schema 偏 MTEB 扁平版:corpus=image,id,queries=language,id,text,qrels=query-id,corpus-id,score。官方 HF 还有 markdown、bbox、reference answer 等更富字段,本地副本未带齐。
  • 8 个公开领域;Queries 与 Corpus 取 English 副本,Qrels 为本地六语合池原始行数:
领域 English Queries Corpus 页 Qrels(六语合池)
computer_science 215 1,360 6,294
energy 308 2,225 6,618
finance_en 309 2,942 8,766
finance_fr 320 2,384 8,808
hr 318 1,110 10,386
industrial 283 5,244 9,684
pharmaceuticals 364 2,313 10,392
physics 302 1,674 13,068
合计 2,419 19,252 74,016
  • 多语副本:corpus 图跨语种 MD5 相同;queries 为翻译;同一套 qrels 文件合入了 6 语全部 Query ID(如 hr:318×6=1,908)。评测某语时必须按该语 queries.id 过滤 qrels。
  • score:1=critically relevant2=fully relevant;每 Query 多正例(p50 约 2–5)。
  • corpus-test-* / query-test-* ID 按领域重置,跨领域不能混池。
  • Case:finance_en “Did JPMorganChase execute more than half of its planned $30 billion stock repurchase program by year-end?” → score 2 + score 1 多页。

9.4 冻结边界

  • 全部 Query、图片、答案、reasoning、qrels、bbox 均不得进入训练/合成/调参。
  • v1 空 Query 行只作候选页;v2 human-labeled 只用 test;v3 按领域×语言分别建池并过滤 qrels。
  • 与训练侧(ColPali/TabFQuAD/TAT-DQA/VDR_Energy 等)的上游重合审计尚未做;合成 blocklist 仍未覆盖 eval*
  • 本地已向 开源数据样本/ViDoRe_v1/ViDoRe_v2/ViDoRe_v3/ 各导出 100 条 review-only 样本(v1 仅非空 Query;v2 human-labeled 仅 test;v3 默认 English 并按语种过滤 qrels)。

10. 统一比较与结论

  • JinaVDR:隐式正例、多子集、每子集独立 corpus。 它的主要风险不是缺少数据,而是误删空 Query 候选行,或把 42 个任务混成一个候选池。应按非空行构建 Query–隐式正例,按全部唯一图片构建各子集 corpus,并把本地数与官方原始数分别报告。
  • MIRACL-VISION:标准 qrels、大规模多语种候选库、仅部分语言有 OCR。 它最接近标准检索协议,但多正例不能截断;本地只有英语额外提供截图 OCR,跨语言比较时必须说明输入字段并不完全对称。
  • NayanaIR-Bench:Mono + Cross、跨语种正例、答案支持 RAG 辅助评测。 Mono 衡量同语种能力,Cross 使用共享多语种候选池并允许 Query 与正页语言不同。答案可增加固定召回下的 RAG 辅助指标,但答案、推理与 qrels 仍是严格冻结标注。
  • ViDoSeek:JSON + PDF、同时覆盖检索与生成、运行前必须渲染 PDF。 候选池应来自完整原始文档而非证据页集合。特别是本地 ViDoSeek 主集的 multi-hop 实际全部只有一个 reference page,主要反映单页内多步推理;SlideVQA-Refined 才是明确的多证据页场景。
  • 四者都应保留官方候选池和多正例,记录本地版本、字段差异、渲染参数及任何清洗副本。领域敏感内容、OCR 噪声、合成 Query、跨语种答案和页码基准都需要人工抽查,但不能借抽查结果反复选择模型或阈值。
  • 本地人工复核抽取已经完成:JinaVDR、MIRACL-VISION、NayanaIR-Bench、ViDoSeek 各 100 条,每个目录均有 100samples.jsonl 记录和 100 张可解码图片。该导出只是 review-only 小样本,不替代也不缩减官方完整候选池。
  • ViDoRe v1/v2/v3:结构与 Case 已登记。 v1 是隐式正对(合成子集大量空 Query 候选页);v2/v3 是标准 qrels,且 v3 多语共享图、qrels 合池。泄漏审计与 blocklist 仍未完成,故仍不能作为正式 Release 依据。
由本地 docs/开源测试集分析.md 自动构建 · 本地 Markdown 是内容源