冻结评测
候选池、qrels、Case 与评测边界
开源测试集分析
本文是冻结评测资产的事实账本:记录候选池、Query/qrels、真实 Case、抽样和使用边界。项目状态只在 STATUS.md 维护。评测页、Query、答案、qrels、证据及其近重复项不得用于训练、合成、hard-negative 挖掘、模型选择或阈值调参。
统一约束
- HuggingFace 元数据中的 split 名称不是训练许可。
eval.parquet、上游 benchmark 定义和本项目的逻辑角色优先于其train标签。 - 必须保留原始 Query–正页面/qrels 关系和候选库规模;清洗副本与官方原始评测必须分别报告。
- 下文的重合检查均为页面 ID 或规范化文本的精确匹配,不能替代全量图片感知去重。
1. vdr-multilingual-test
这是 vdr-multilingual-train 对应的多语种视觉检索 benchmark。
- 路径:
data/vdr-multilingual-test/;5 种语言de/en/es/fr/it,每种语言使用eval.parquet。 - 每种语言
3,000页,共15,000页;字段为id、query、image、pagetype、language,没有answer、negatives或显式 qrels。 - 每种语言有
visual、mix、text三个独立子 benchmark。每类都是1,000页、100条 Query。 - 每个
1,000行区段的前100行有 Query;非空 Query 所在行及其同一行图片是隐式 Query–正页面对,余下900行组成候选页。 - 评测粒度固定为
语言 × pagetype,即 15 个 benchmark;不得将不同语言或类型的候选页混入同一1,000页候选池。
真实 Case
[de / visual]
Query:Wie viel kostet der HERMA Ordner A4 Social Icons?
正页面 ID:de_10_638be5d4e15a73ebefd68f8107a8d56a2c914a25[en / visual]
Query:What is the quarter-on-quarter growth rate of Klook in Asia-Pacific as of October 2022?
正页面 ID:en_38_ad48ef166177e56ece9322605f7492caf3d345ed[en / mix]
Query:What was the average growth rate of Jack pines?
正页面 ID:en_22_825138bf832d7e63bce7a8453e156d4636f94ba7[es / mix]
Query:¿Cuál es el año de publicación del Reglamento de la Comisión Asesora de la UNRWA?
正页面 ID:es_70_f4f0afb2d3eaf881be0f4e6b5c8c3284a29955fa[it / visual]
Query:Qual è il documento regionale di adattamento della Lombardia?
正页面 ID:it_30_8a6af5057bce0f34eb939f91ddd443a154c35400本地导出抽样
以下图片与字段直接对应 Git 忽略目录 开源数据样本/vdr-multilingual-test/ 的 samples.jsonl:
[sample #1 | de / visual]
图片:de_visual_0000.jpg
Query:Wie viel kostet der HERMA Ordner A4 Social Icons?
正页面 ID:de_10_638be5d4e15a73ebefd68f8107a8d56a2c914a25[sample #2 | de / mix]
图片:de_mix_1000.jpg
Query:Welche Filme wurden beim Camerimage Festival in Bydgoszcz mit goldenen Fröschen ausgezeichnet?
正页面 ID:de_27_4b3abd7225bcb43abba795c72c28d7d8c03c96f8与训练集的隔离检查
- 五种语言的测试页面
id与vdr-multilingual-train的页面id交集均为0。 - 德语、英语、法语、意语的非空 Query 与训练 Query 精确交集均为
0。 - 西语有 1 条文本重合:
¿Cuántos centros Adobe Authorized Training Center hay en España?。训练页为es_3_ddbd30b209d74aaa53933b274c1dd10f0de79755,测试页为es_3_ae1c7d70e787eb8b92d334f1586e9249a579b76d。构建零测试文本泄漏的自定义训练副本时,应过滤该训练 Query。 - 法语
text子集的 IDfr_1_513e8e20fb267438be90ee1860d7188668d02c4c及其 Query 在第2027和2071行重复。官方评测保留原始重复;内部去重版须另命名并同时报告原始分数。
真实页面图片、Query 与行号已导出到 Git 忽略目录 开源数据样本/vdr-multilingual-test/。
2. VisRAG-Ret-Test-*(6 个)
这 6 个检索 benchmark 不包含 language、text/visual/mix 字段;它们按文档任务域划分,使用显式三段式评测结构:
corpus:候选页面图片(corpus-id, image)
queries:问题与参考答案(query-id, query, answer, options, is_numerical)
qrels:正页面关系(query-id, corpus-id, score)- 所有 qrels 都能指向现有 corpus 页面,且分数均为
1。 - ArxivQA、ChartQA、InfoVQA、MP-DocVQA、PlotQA 的每个 Query 有 1 个正页。
- SlideVQA 有
556条 Query 和702条 qrels,其中146条 Query 有 2 个正页,评测不能只保留一个正页。
规模与真实 Case
[ArxivQA | 8,066 页 / 816 Query]
Query:Which statement best describes the relationship between the components labeled 'Myosin' and 'Actin filament'?
Answer:C
正页面:1508.06771_0.jpg
Options:C) Myosin heads are bound to actin filaments.[ChartQA | 500 页 / 63 Query]
Query:How many more people felt inspired frequently than depressed frequently?
Answer:0.03
正页面:3960.png[InfoVQA | 459 页 / 718 Query]
Query:Which social media site was invented in 2002?
Answer:['friendster']
正页面:36966.jpeg[MP-DocVQA | 741 页 / 591 Query]
Query:Where is the birth defects clinical study center in Pennsylvania?
Answer:['Philadelphia']
正页面:ngxh0227_p74.jpg[PlotQA | 9,593 页 / 863 Query,其中 558 条数值题]
Query:Across all years, what is the minimum percentage of unemployed female labor force in Europe(all income levels)?
Answer:7.3613074550266
正页面:8111.png[SlideVQA | 1,284 页 / 556 Query / 702 qrels]
Query:In which year did the company that divested Eismann in 2004 achieve higher Organic Growth, 2003 or 2004?
Answer:2003
正页面:...presentation-7-1024.jpg、...presentation-13-1024.jpg与本地训练来源的泄漏
colpali_train_set含有108条 ArxivQA 测试泄漏记录:Query 相同,且正图文件名也与测试 qrel 的corpus-id相同。它不能与 ArxivQA 测试集同时用于独立泛化评测。VisRAG-Ret-Train-In-domain-data存在规范化精确 Query 重合:ArxivQA50、InfoVQA2、MP-DocVQA11、PlotQA136、SlideVQA1条;ChartQA 为0。其匹配的训练行数更高,因为训练集中存在重复 Query。VisRAG-Ret-Train-Synthetic-data与这 6 个测试集没有规范化精确 Query 重合。
若需基于本地训练来源评测这些 benchmark,必须构建过滤后的训练副本,并将过滤规则、删除数量和官方原始分数一并记录。
3. MMLongBench-Doc
这是面向长上下文多模态文档理解的 benchmark。虽然本地 Parquet split 名为 train,上游将其定义为 benchmark;项目内逻辑角色固定为 test。
- 路径:
data/MMLongBench-Doc/;135份 PDF 和1,091个问题,覆盖研究报告、教程/Workshop、学术论文、指南、Brochure、行业/行政文件、财报 7 类文档。 - 每份 PDF 有
3–18个问题。字段为doc_id、doc_type、question、answer、evidence_pages、evidence_sources、answer_format。 evidence_pages和evidence_sources保存为字符串化 Python 列表,读取时必须解析;文档页码含0,渲染时应按 PDF 页索引验证。360/1,091(33.0%)是跨页问题;244条answer_format=None,参考答案为Not answerable。- 证据类型出现次数:文本
298、Figure293、Table218、Chart178、布局文本119。
真实 Case
[Research report / Chart]
文档:PH_2016.06.08_Economy-Final.pdf
Question:According to the report, how do 5% of the Latinos see economic upward mobility for their children?
Answer:Less well-off
Evidence:page [5] / Chart[Academic paper / Table + Layout]
文档:2005.12872v3.pdf
Question:According to the DETR PyTorch inference code, what is the output dimension of the linear_class layer?
Answer:92
Evidence:page [26] / Table, Generalized-text (Layout)[Cross-page / Table]
文档:PH_2016.06.08_Economy-Final.pdf
Question:According to the report, which one is greater in population in the survey? Foreign born Latinos, or the Latinos interviewed by cellphone?
Answer:Latinos interviewed by cellphone
Evidence:pages [19, 20] / Table[Guidebook / Figure]
文档:honor_watch_gs_pro.pdf
Question:What is the time on the gallery screenshot when demostrating how to set galley watch faces?
Answer:10:08AM
Evidence:pages [39, 40, 41] / Figure[Unanswerable]
文档:Independents-Report.pdf
Question:What's the percentage of people who are democrats and voted in the last election compared to the entire population in 2024?
Answer:Not answerable
Evidence:[] / None标注边界与隔离检查
- 有
9条可回答问题的evidence_pages=[],另有7条不可回答问题仍有证据页;空证据页不能单独作为不可回答判断。 - 与本地
colpali_train_set、VisRAG Synthetic、VisRAG In-domain 的 Query 做规范化精确匹配,交集均为0;尚未完成 PDF/图片级感知去重。 - 后续本地样本将按 7 类文档、跨页、数值和不可回答等维度分层选择
12个问题,并将每题全部证据页渲染为 PNG。
4. 前三套评测的共同边界
允许:使用冻结的原始 Query、候选页和 qrels/证据页计算指标;
分别报告原始 benchmark 与显式命名的内部清洗 benchmark;
在 Git 忽略目录导出少量图片供人工检查。
禁止:将测试页面、Query、答案、qrels、证据页或近重复项加入训练;
用测试集生成合成 Query、负样本或蒸馏样本;
使用测试集反复选择 Prompt、模型版本、训练轮次或阈值后仍报告为独立泛化结果。5. JinaVDR
JinaVDR 是视觉文档检索评测集合,而不是一份可以统一打散的训练数据。官方项目见 jina-ai/jina-vdr;本地路径为 data/JinaVDR/,约 15G,共 42 个子数据集。本地所有配置合计 60,845 行。
真实 Case
[europeana-it-scans / 意大利历史扫描件]
Query:Quali sono gli insegnamenti che il discorso di Andreotti suggerisce?
正页面:images/446__ASILS_Fondo_Giulio_Andreotti_Discorsi0090.jpg
特点:意大利语历史档案,页面含印刷或手写内容,并附 Europeana 来源链接和署名信息。[shanghai_master_plan / 中文城市规划]
Query:上海市城市总体规划2017-2035生态网络布局图
正页面:page_67.jpg
特点:需要从中文总体规划的地图、布局和文字中完成检索。[ChartQA / 图表]
Query:What was the average ticket price in the 2006/07 season?
正图 ID:1500
特点:同一图表可对应多个问题;本地 1,000 个问题行实际对应 834 张唯一图片。[medical-prescriptions / 医疗文档]
Query:What is Dexter's Patient Health Questionnaire 2 item (PHQ-2) total score [Reported] on 2020-08-29?
正图 ID:img_36
特点:包含医疗处方或健康记录,既有专业缩写,也有隐私与合规风险。[jdocqa / 日文文档]
Query:八王子神社は「はちおっつぁん」と呼ばれ住民に親しまれていますが、
事故が起きたような言い伝えはありますか。
正图 ID:0
特点:自由回答式日文问题,本节只使用其 Query–页面关系做冻结检索评测。[airbnb-synthetic-retrieval / 中文合成检索]
Query:在East Village找一个地方从Dec 01, 2018到Dec 04, 2018价格低于$78。
正页面:5118de5d-2b2d-4fa0-b656-34d238e1b3dc.png
特点:中文条件查询对应英文地点、日期与价格信息组成的渲染表格。行结构与空 Query 的正确解释
- 多数子集使用
query、image、image_filename、text_description四个核心字段;部分子集另有links、attributions等来源信息。text_description通常是 OCR 文本,不是额外的相关性标注。 - JinaVDR 没有统一的显式 qrels。对非空 Query 行,该行图片就是隐式正页面;候选库则由当前子数据集的全部唯一
image_filename构成。 - 空 Query 行不是数据损坏。 官方统计表把 Queries 和 Documents 分开报告,而本地 Parquet 将问题行与仅作为候选文档的行放在同一结构中。本地全量审计得到
17,470 / 60,845 = 28.7%的空 Query 行,它们必须留在候选库中。 docvqa本地有38条非空 Query、499张唯一文档和461条空 Query 候选行;官方原始表报告39 Queries / 499 Documents。空 Query 与非空 Query 的image_filename交集为0。airbnb-synthetic-retrieval本地有4,952条非空 Query、10,000张唯一文档和5,048条空 Query 候选行;官方原始表报告4,953 Queries / 10,000 Documents。两类行的图片文件名交集同样为0。stanford_slide本地有13条非空 Query、994张唯一文档和987条空 Query 候选行;官方原始表报告14 Queries / 994 Documents。其 13 个问题落在少量被重复提问的页面上,因此行数不能直接当作文档数。ChartQA等子集没有空 Query 行,但会让同一图片对应多个问题。候选库仍应按唯一图片构建,而不能把 1,000 个问题行误算成 1,000 张候选图。
评测口径与质量边界
- 评测时必须按
42个子数据集分别建候选池、分别计算指标;先过滤空 Query 以形成问题集合,同时保留该子集的每一张唯一图片作为 corpus。 - 非空 Query 所在图片构成隐式正例。不能把空 Query 行删掉后再建 corpus,否则会系统性缩小候选库并虚高检索分数。
- 本地 Query 数与官方表在
docvqa、Airbnb、Stanford Slide 等任务上各有 1 条差异,较可能来自数据版本或过滤规则变化,不能静默改写成同一口径。报告中应同时列出官方原始 benchmark 数和本地实际运行数。 - OCR、图片、Query、隐式正例及候选文档均属于冻结评测资产;不得用于训练、合成 Query、OCR 蒸馏或 hard-negative 挖掘。医疗处方等敏感领域样本还应限制人工复核范围和传播方式。
本地复核导出
- 已向
开源数据样本/JinaVDR/导出100条 review-only 样本,覆盖全部42个子数据集,每个子集2–3条;100 条均为非空 Query 行,且 Query–图片对无重复,没有把 corpus-only 空 Query 行误当成问题。 - 每条 manifest 保留子数据集、Query、
image_filename、仅供复核的text_description预览、来源 Parquet 与本地行号;正图写入images/。这些产物均标记evaluation_only=true,不属于训练导出。
6. MIRACL-VISION
MIRACL-VISION 是标准 BEIR 风格的多语种视觉检索 benchmark。本地路径为 data/miracl-vision/,约 91G,覆盖 ar/bn/de/en/es/fa/fi/fr/hi/id/ja/ko/ru/sw/te/th/yo/zh 共 18 种语言。
真实 Case
[en]
Query ID:910
Query:On what TV network did Scooby-Doo first air?
正文章:Scooby-Doo, Where Are You!
Corpus ID / Image ID:2610234 / i13[zh]
Query ID:7443372
Query:联合国五常国家有哪些?
正文章:联合国安全理事会常任理事国
Corpus ID / Image ID:49655 / i632[ja]
Query ID:4
Query:森上亜希子の出身はどこ
正文章:森上亜希子
Corpus ID / Image ID:329100 / i15378[ar]
Query ID:8574
Query:في أي عام تأسست منظمة الدول المصدرة للنفط أوبك؟
正文章:أوبك
Corpus ID / Image ID:233622 / i9502结构、规模与多正例
- 每种语言都有独立的
queries.parquet、corpus.parquet、qrels.parquet和images.parquet。本地合计7,898条 Query、338,734条 corpus/image 和10,094条 qrels。 - 代表性规模为:英语
447 Query / 42,971 corpus / 623 qrels,中文189 / 8,672 / 269,阿拉伯语2,127 / 75,444 / 2,558。候选池应按语言隔离,不能将 18 种语言的图片合并后冒充官方指标。 - Query 字段为
_id、text;qrels 字段为query-id、corpus-id、score,本地相关性分数均为1。 - corpus 字段为
_id、text、title、image_id、text_downloaded_from_Wikipedia。本地只有英语 corpus 额外含text_obtained_via_ocr_from_screenshots;不能假设其余 17 种语言也有同等 OCR 字段或 OCR 质量。 - 一个问题可以有多个正文档。英语平均每个 Query 有
623 / 447 = 1.39个正例,单个 Query 最多7个;只保留第一条 qrel 会错误惩罚其他有效命中。
冻结评测边界
- 该数据适合测试大规模多语种视觉检索:Query 用目标语言表达,corpus 同时提供 Wikipedia 文本、标题和页面截图图像。
- 官方评测应保留每种语言完整的大候选库和全部多正例 qrels。图片与 corpus 通过
image_id对齐,不能仅用标题命中替代视觉页面检索结果。 - Query、qrels、corpus 文本、页面图片以及英语特有 OCR 都是冻结测试信息。它们不得进入训练、数据合成、负例挖掘、检索器蒸馏或生成模型提示优化;尤其不能把 corpus/OCR 当成“无标签语料”回流训练。
本地复核导出
- 已向
开源数据样本/miracl-vision/导出100条样本,覆盖全部 18 种语言,每种语言5–6条;选中 qrels 的本地score均为1。 - 导出先用轻量 ID 列完成
qrels → query/corpus → corpus.image_id → images.file_name连接,再只读取选中图片所在 row group。manifest 保留语言、Query/Corpus ID、标题和 review-only 文本预览,100 张正图均可解码。
7. NayanaIR-Bench
本地 data/NayanaIR-Bench/ 约 11G,由单语的 MonoBench 和跨语种的 CrossBench-v3 两类 benchmark 组成。二者任务定义与候选池不同,不能混合统计。
真实 Case
[MonoBench-en]
Query:What was the preference for the basketball court flooring as stated by Mr. Siciliano?
Answer:Mr. Siciliano stated that the preference for the basketball court would be a wood floor.
正页:document_27791_page_0_en(score=2)、
document_27791_page_1_en(score=1)[MonoBench-zh]
Query:文本中提到的曾孙的总数是多少?
Answer:有2个曾孙。
正页:document_13834_page_1_zh(score=2)[MonoBench-hi]
Query:स्वास्थ्य और शिक्षा आयोग के लिए नियमित बैठक एजेंडा पर अंतिम आइटम क्या है?
Answer:नियमित बैठक के एजेंडे पर अंतिम आइटम 'स्थगन' है।
正页:document_2899_page_1_hi(score=2)[CrossBench-v3 / 旁遮普语 Query → 英文文档]
Query:ਦੂਜੀ-ਪੀੜ੍ਹੀ ਦੇ ਐਂਟੀਸਾਈਕੋਟਿਕਸ ਨੂੰ ਸ਼ਾਈਜ਼ੋਫਰੀਅਨੀਆ ਦੇ ਇਲਾਜ ਵਿੱਚ
ਪਹਿਲੇ ਪੀੜ੍ਹੀ ਐਂਟੀਸਾਈਕੋਟਿਕਸ ਨੂੰ ਤਰਜੀਹ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ?
正页:document_12069_page_4_en(corpus-id=4640,score=2)
特点:Query 和答案为旁遮普语,相关页面为英文,明确测试跨语种视觉检索。MonoBench
- MonoBench 覆盖
ar/bn/de/en/es/fr/gu/hi/it/ja/kn/ko/ml/mr/or/pa/ru/sa/ta/te/th/zh共 22 种语言。每种语言约200条 Query、固定1,000张候选页。 - 本地合计
4,399条 Query、22,000条 corpus 和6,082条 qrels;英语本地为199条 Query,其余规模以本地文件为准,不应机械写成每种语言恰好 200 条。 - MonoBench 存在多正例和分级相关性。以英语为例,平均每个 Query 有
2.40条 qrels,最多7条,score可为1或2。应使用支持 graded relevance 和多正例的指标实现。
CrossBench-v3
- CrossBench-v3 本地有
1,000条 Query、5,873张候选页和3,142条 qrels,Query 实际覆盖 20 种语言。 - 每个 Query 平均
3.14个正例,最多5个;本地 qrels 的score均为2。正页语言可以与 Query 语言不同,跨语种匹配本身就是任务目标。 - CrossBench 的 corpus 是一个共享跨语种候选池;不得按 Query 语言裁剪文档,也不得与任一 MonoBench 的 1,000 页候选池拼接。
字段与 RAG 使用边界
queries:query-id, query, language, gpt-4o-reasoning, answer
corpus:corpus-id, image, doc-id
qrels:query-id, corpus-id, is-answerable, answer, score- 本地检查中,MonoBench 与 CrossBench-v3 的 qrels 均标为
fully answerable。answer可用于检索后的 RAG 辅助生成评测,例如在固定召回结果上报告答案质量,但不能替代检索指标。 - Query 侧的
gpt-4o-reasoning、答案以及 qrels 中的可回答性、答案和分数都是冻结标注,即使字段为空或可由模型重建,也不得用于训练、CoT 蒸馏、合成问题或筛选负例。 - Mono 与 Cross 必须分别建候选池、分别报告检索指标和 RAG 辅助指标;将两类结果平均成一个分数会掩盖单语与跨语种能力差异。
本地复核导出
- 已向
开源数据样本/NayanaIR-Bench/导出100条样本,覆盖 22 个 MonoBench 语言和 CrossBench-v3 共23个桶,每桶4–5条。 - CrossBench-v3 的 4 条抽样均为跨语种正例,包括
pa→en、kn→ta、es→ko、hi→zh;其中旁遮普语样例命中document_12069_page_4_en。Query 答案、GPT-4o reasoning、可回答性和 qrel 答案只写入带_review_only后缀的字段。
8. ViDoSeek
ViDoSeek 本地路径为 data/ViDoSeek/,约 1.6G。它没有预先展开成页面级 Parquet,而是由 JSON 问题标注和两个压缩 PDF 文档库组成:vidoseek.json、slidevqa_refined.json、vidoseek_pdf_document.zip、slidevqa_pdf_document.zip。
真实 Case
[ViDoSeek / text / single_hop]
Query:Apply for Nordic Swan Ecolabel license, what is recommended as a web browser
according to the Nordic Ecolabelling Portal instructions?
Answer:Microsoft Edge or Google Chrome.
PDF:03c7d62afbcc088cad1c810c09a71df29a29c968.pdf
Reference page:[4][ViDoSeek / 2d_layout / single_hop]
Query:What is the first step in the Nordic Swan Ecolabel license application process
according to the Application Guide?
Answer:Sign in and change your password.
PDF:03c7d62afbcc088cad1c810c09a71df29a29c968.pdf
Reference page:[3][ViDoSeek / chart / multi_hop]
Query:Which etiology is identified as causing the highest number of liver
transplantation cases in 2020 according to the Stanford MEDICINE report?
Answer:Alcohol
PDF:00635dc8c9b99e2c839ade4ee486b54a1bf70a67.pdf
Reference page:[3][SlideVQA-Refined / multi_hop]
Query:What is the title of the presentation made by Alcatel-Lucent, the company
that won 7 Nobel Prizes, for the OVERVIEW of 2012?
Answer:AT THE SPEED OF IDEAS
PDF:alcatel-lucenteesoverview-120403090342-phpapp01_95.pdf
Reference pages:[1, 5]vidoseek.json
- 包含
1,142条 Query、290份唯一 PDF;其中645条single_hop、497条multi_hop。 - 来源类型为
2d_layout 730、table 175、chart 157、text 80。这使它适合同时评测布局、表格、图表和普通文本页面的检索与回答。 - 本地 全部 1,142 条 标注的
reference_page长度都是1,包括所有497条multi_hop。因此这里的 multi-hop 可以表示同一页内的多步推理,不应自动解释成跨页检索。
slidevqa_refined.json
- 包含
2,020条 Query、400份唯一 PDF;其中1,486条single_hop、534条multi_hop。 - 来源类型为
single_span 1,347、non_span 358、multi_span 315。 - 与 ViDoSeek 主集不同,SlideVQA-Refined 的
534条 multi-hop 全部至少有 2 个证据页:533条有 2 页,1条有 3 页。此处必须支持多页召回和多证据生成。
PDF 渲染、候选池与冻结边界
- 实际运行视觉检索/RAG 前,需要解压 PDF,并按标注页码渲染证据页;同时还要渲染候选文档的其他页面,建立可复现的
PDF + page number → image映射。页码基准应通过真实样例人工核对。 reference_page只定义相关证据,不定义候选池。官方文档库中的原始 PDF/页面必须保留为完整候选集合,不能只渲染证据页后在“全是正例”的小池中评测。- 检索阶段可报告页面召回,生成阶段可在固定召回结果上比较
reference_answer;两阶段结果应分开,避免答案正确掩盖检索失败。 - PDF、Query、
reference_answer、reference_page、query_type和source_type全部属于冻结评测信息,不得用于训练、合成、证据页提示调优或多跳轨迹蒸馏。
本地复核导出
- 已向
开源数据样本/ViDoSeek/导出100条样本:ViDoSeek 与 SlideVQA-Refined 各50条;两边均覆盖 single-hop/multi-hop 和各自全部 source type。 - 脚本直接从两个 ZIP 读取 PDF,按已核验的 1-based 页码渲染首个
reference_page,不完整解压文档库。100 条均保留全部证据页列表,其中26条还有额外证据页;这些附加页只记录标注,本次每条仍只导出首个证据页 PNG。
9. ViDoRe 评测资产(v1 / v2 / v3)
三套目录均固定 evaluation_only。本地路径:data/eval(v1,约 2.3G)、data/eval_v2(v2,约 2.3G)、data/eval_v3(v3,约 49G)。它们是当前最重要的视觉文档检索榜资产,也是与训练侧最容易上游重合的冻结评测集。
9.1 ViDoRe v1(data/eval)
- 形态:单文件 Query–页面隐式正对(多数行自带
image),不是独立 corpus/qrels。 - 10 个子集与本地行数:
| 子集 | 行数 | 非空 Query | 说明 |
|---|---|---|---|
arxivqa_test_subsampled |
500 | 500 | 学术图文;含 options/answer |
docvqa_test_subsampled |
500 | 500 | 工业文档;answer 字段可空 |
infovqa_test_subsampled |
500 | 500 | 信息图;含 OCR |
tabfquad_test_subsampled |
280 | 280 | 法语表格;70 张唯一图,同页多问 |
tatdqa_test |
1,663 | 1,663 | 财报表;277 张唯一图 |
shiftproject_test |
1,000 | 100 | 900 空 Query = 候选页 |
syntheticDocQA_* ×4 |
各 1,000 | 各 100 | 同上;AI/energy/gov/healthcare |
- 合计约
8,443行;其中合成/Shift 子集的空 Query 行是 corpus 候选页,不能当正例 Query。 - Case:
docvqa“What is the dividend payout in 2012?”;syntheticDocQA_energy“What types of road improvements are planned for Greenmount Road...?”。 - 风险:与
colpali_train_set、tabfquad_train_set、tatdqa_train、VisRAG 测试同源名高度重叠;评测必须按子集独立建池。
9.2 ViDoRe v2(data/eval_v2)
- 形态:标准
corpus/queries/qrels(部分含docs)。 - 规模:
| 任务 | Queries | Corpus | Qrels | 语言 |
|---|---|---|---|---|
biomedical_lectures |
640 | 1,016 | 2,060 | en/fr/es/de 各 160 |
economics_reports |
232 | 452 | 3,628 | 四语各 58 |
esg_reports |
228 | 1,538 | 888 | 四语各 57 |
esg_reports_human_labeled |
test 52 / train 52 | test/train 各 1,538 | 各 128 | 人工标注;只用 test |
biomedical/economics/esg_reports的 qrels score 全为2,并带answer;多正例常见(economics 每 Query 正例 max113)。esg_reports_human_labeled有 train/test;corpus-id 两端都从 0 起且完全重叠编号,评测只取 test,严禁把 train 当开放评测或合成材料。- Case:
biomedical“What are the specific outcomes of using autologous chondrocyte implantation in canine studies?” → 多页正例 + 答案摘要。
9.3 ViDoRe v3(data/eval_v3)
- 形态:每领域 6 语 ×(
{lang}-corpus|queries|qrels);本地 schema 偏 MTEB 扁平版:corpus=image,id,queries=language,id,text,qrels=query-id,corpus-id,score。官方 HF 还有 markdown、bbox、reference answer 等更富字段,本地副本未带齐。 - 8 个公开领域;Queries 与 Corpus 取 English 副本,Qrels 为本地六语合池原始行数:
| 领域 | English Queries | Corpus 页 | Qrels(六语合池) |
|---|---|---|---|
| computer_science | 215 | 1,360 | 6,294 |
| energy | 308 | 2,225 | 6,618 |
| finance_en | 309 | 2,942 | 8,766 |
| finance_fr | 320 | 2,384 | 8,808 |
| hr | 318 | 1,110 | 10,386 |
| industrial | 283 | 5,244 | 9,684 |
| pharmaceuticals | 364 | 2,313 | 10,392 |
| physics | 302 | 1,674 | 13,068 |
| 合计 | 2,419 | 19,252 | 74,016 |
- 多语副本:corpus 图跨语种 MD5 相同;queries 为翻译;同一套 qrels 文件合入了 6 语全部 Query ID(如 hr:318×6=
1,908)。评测某语时必须按该语queries.id过滤 qrels。 - score:
1=critically relevant,2=fully relevant;每 Query 多正例(p50 约 2–5)。 corpus-test-*/query-test-*ID 按领域重置,跨领域不能混池。- Case:
finance_en“Did JPMorganChase execute more than half of its planned $30 billion stock repurchase program by year-end?” → score 2 + score 1 多页。
9.4 冻结边界
- 全部 Query、图片、答案、reasoning、qrels、bbox 均不得进入训练/合成/调参。
- v1 空 Query 行只作候选页;v2 human-labeled 只用 test;v3 按领域×语言分别建池并过滤 qrels。
- 与训练侧(ColPali/TabFQuAD/TAT-DQA/
VDR_Energy等)的上游重合审计尚未做;合成 blocklist 仍未覆盖eval*。 - 本地已向
开源数据样本/ViDoRe_v1/、ViDoRe_v2/、ViDoRe_v3/各导出100条 review-only 样本(v1 仅非空 Query;v2 human-labeled 仅 test;v3 默认 English 并按语种过滤 qrels)。
10. 统一比较与结论
- JinaVDR:隐式正例、多子集、每子集独立 corpus。 它的主要风险不是缺少数据,而是误删空 Query 候选行,或把 42 个任务混成一个候选池。应按非空行构建 Query–隐式正例,按全部唯一图片构建各子集 corpus,并把本地数与官方原始数分别报告。
- MIRACL-VISION:标准 qrels、大规模多语种候选库、仅部分语言有 OCR。 它最接近标准检索协议,但多正例不能截断;本地只有英语额外提供截图 OCR,跨语言比较时必须说明输入字段并不完全对称。
- NayanaIR-Bench:Mono + Cross、跨语种正例、答案支持 RAG 辅助评测。 Mono 衡量同语种能力,Cross 使用共享多语种候选池并允许 Query 与正页语言不同。答案可增加固定召回下的 RAG 辅助指标,但答案、推理与 qrels 仍是严格冻结标注。
- ViDoSeek:JSON + PDF、同时覆盖检索与生成、运行前必须渲染 PDF。 候选池应来自完整原始文档而非证据页集合。特别是本地 ViDoSeek 主集的 multi-hop 实际全部只有一个 reference page,主要反映单页内多步推理;SlideVQA-Refined 才是明确的多证据页场景。
- 四者都应保留官方候选池和多正例,记录本地版本、字段差异、渲染参数及任何清洗副本。领域敏感内容、OCR 噪声、合成 Query、跨语种答案和页码基准都需要人工抽查,但不能借抽查结果反复选择模型或阈值。
- 本地人工复核抽取已经完成:JinaVDR、MIRACL-VISION、NayanaIR-Bench、ViDoSeek 各
100条,每个目录均有100条samples.jsonl记录和100张可解码图片。该导出只是 review-only 小样本,不替代也不缩减官方完整候选池。 - ViDoRe v1/v2/v3:结构与 Case 已登记。 v1 是隐式正对(合成子集大量空 Query 候选页);v2/v3 是标准 qrels,且 v3 多语共享图、qrels 合池。泄漏审计与 blocklist 仍未完成,故仍不能作为正式 Release 依据。