统一身份与谱系
Dataset、Document、Page、Pair 分层建模;用稳定 ID、文件哈希和感知哈希追踪跨库同源关系。
面向视觉文档检索的统一数据中台:覆盖多语言、图表、论文、财报、工业文档与长文档评测,贯通资产登记、样本复核、合成质检、泄漏审计和版本发布。
不同来源在任务、粒度、许可证、质量和评测协议上都不相同。中台的价值,是让每条数据都可识别、可审计、可追溯、可复现。
Dataset、Document、Page、Pair 分层建模;用稳定 ID、文件哈希和感知哈希追踪跨库同源关系。
区分严格 pass、观察用 provisional 和 fail;OCR、Markdown、HTML 只做离线验证,不进入生成 Prompt。
评测 Query、页面、答案、qrels、证据和近重复项禁止进入训练、合成、负例挖掘与调参。
当前前两阶段已经收口,项目正进入完整泄漏审计。只有通过审计和 Registry,才能形成正式训练 Release。
数据规模不能简单相加:文档、页面、QA 轮次和检索 Pair 是不同统计单位。这里展示各资产在系统中的真实角色。
当前最大规模开放域文档视觉检索对。每条包含 1 个正例与 20 个 hard negatives,依赖 Docmatix images 关联。
约 216 万英文 PDF、约 1,800 万页。它是预训练材料,不是现成检索 Pair;与 Docmatix 通过 PDFA key 建立同源谱系。
44,002 个 NQ 训练 Query 连接 1,267,874 张 Wikipedia 页面截图;测试集采用开放域全库检索。
图表图片配套 Markdown / HTML 离线真值,是当前严格证据校验最强的合成来源之一。
按角色过滤或搜索名称、领域和风险。训练与评测资产在逻辑角色和本地 manifest 中均保持隔离。
| 角色 | 资产 | 规模 / 结构 | 覆盖 | 关键边界 |
|---|---|---|---|---|
| TRAIN | ColPali train | 118,195 对 | DocVQA / 图表 / 论文 | 含 108 条 ArxivQA Query + 正图泄漏 |
| TRAIN | VisRAG Synthetic | 239,358 对 | 手册 / 教材 / ICML / NeurIPS | 需过滤空 Query、弱 Query 与超长文本 |
| TRAIN | VisRAG In-domain | 122,752 对 | 图表 / 信息图 / 文档 / 幻灯片 | 与 5 个 VisRAG 测试集有精确 Query 重合 |
| TRAIN | VDR Multilingual | 280,679 Query | de / en / es / fr / it | 保留 hard negatives;西语有 1 条测试 Query 重合 |
| TRAIN | TAT-DQA / TabFQuAD | 13,251 / 1,552 | 财务表格 / 法语表格 | 自带 eval 或与 ViDoRe 上游重合风险 |
| TRAIN | VDR Domain × 4 | 656,102 行 | 军事 / 能源 / 氢能 / 法语岩土 | train/test 隔离;filtered OCR 只供校验 |
| TRAIN | Wiki-SS-NQ + Corpus | 44,002 Query / 1.27M 页 | 维基截图 / 自然问题 | test 无正例,必须走完整 corpus 检索 |
| TRAIN | Docmatix-IR | 5,612,890 对 | 开放域文档 | 依赖 Docmatix 图片 join;需按 PDFA key 去重 |
| PRETRAIN | PDFA | 约 216 万 PDF / 1,800 万页 | 英文 PDF | 不是监督 Pair;与 Docmatix 同源 |
| DOCVQA | Docmatix | 约 127 万文档 / 950 万 QA | 多页、多轮 DocVQA | 改造后才能进入检索监督 |
| SYNTHESIS | Shennong Chart | 172,975 张图表 | 中文图表 / 结构化真值 | Markdown / HTML 只用于离线验证 |
| EVAL | VDR Multilingual test | 5 语言 × 3 页面类型 | 多语言视觉检索 | 15 个 1,000 页候选池必须独立 |
| EVAL | VisRAG Tests | 6 个 benchmark | 论文 / 图表 / 信息图 / 文档 / 幻灯片 | 保留 corpus / queries / 多正例 qrels |
| EVAL | MMLongBench-Doc | 1,091 问题 / 135 PDF | 长文档 / 跨页理解 | 33% 跨页;含不可回答问题 |
| EVAL | JinaVDR | 42 子集 / 60,845 行 | 截图 / 扫描 / 图表 / 多语 | 空 Query 可定义 corpus;按子集建池 |
| EVAL | MIRACL-VISION / NayanaIR | 18 语言 / 22 Mono + Cross | 多语言 / 跨语言 | 保留多正例与跨语协议 |
| EVAL | ViDoSeek | 1,142 Query + 2,020 SlideVQA | PDF RAG / 多跳 | 完整 PDF 候选池;页码映射 |
| EVAL | ViDoRe v1 / v2 / v3 | v3:8 领域 × 6 语言 | 生医 / 能源 / 金融 / 工业等 | 按领域 × 语言建池并过滤 qrels |
Qwen3.6-27B 仅接收页面图片与固定 Prompt;两批共请求 1,300 页。结果用于验证链路和观察趋势,不是正式训练 Release。
来源:两组 v1.1-relaxed 趋势批次 · 2026-07-27
单位:QC 候选条数;总计 1,248
下面展示合成链路的代表性输出。严格通过依赖独立证据命中;人工看图正确但无文本真值的样本仍标记 provisional。
图中占比最大的 DDoS 攻击类型是什么?
What is the title of the Grade 8 sample lesson plan shown in the document?
Quelle est la nature du sol d'assise pour le sondage RF1 ?
How many F-16s does Belgium plan to provide to Ukraine by 2028?
评测协议不是一张统一表:隐式正对、开放域 corpus、多正例 qrels、PDF 页码、多语过滤都必须原样保留。
MIRACL-VISION 18 种语言;NayanaIR 同时覆盖 Mono 与 Cross;VDR 多语言按语言 × 页面类型形成 15 个独立候选池。
ViDoRe v3 覆盖计算机、能源、金融、人力、工业、制药和物理等 8 领域,每个领域包含 6 种语言。
MMLongBench-Doc 中 33% 为跨页问题;ViDoSeek 使用完整 PDF 候选池,覆盖检索、多跳推理和生成。
“数据到齐”不等于“可以开训”。当前工作重点是把已知重合、潜在同源和协议差异变成可执行的审计规则。
ColPali 含 108 条 ArxivQA Query + 正图重合;VisRAG In-domain 与 5 个测试集有精确 Query 重合。
需核查 ViDoRe v1/v2/v3 与 ColPali、TabFQuAD、TAT-DQA、VDR Energy 等训练来源的重合。
PDFA、Docmatix、Docmatix-IR 必须按 PDFA key、页序和图片感知哈希完成同源登记。
JinaVDR、ViDoRe v1 的空 Query 行可能定义 corpus;ViDoRe v3 必须按领域 × 语言过滤 qrels。
1,029 条 provisional 只代表结构通过、缺少独立文本证据,不得包装成严格训练样本。
正式 Release 必须绑定 Registry 版本、清洗规则、泄漏报告、质量阈值与文件校验和。
目标不是继续无边界募集数据,而是完成治理闭环,并用受控训练和统一评测证明数据质量的实际价值。
计划内训练与评测全部落盘、分析和抽样。
图片输入、断点续跑、QC、终审和审计链路跑通。
Query、ID、感知哈希、PDF 与上游来源。
稳定身份、谱系、许可、版本和审计报告。
来源消融、质量消融、多语言与跨 benchmark 泛化。
本页和全部子页面由本地 docs/*.md 构建。发生冲突时,以 STATUS 和事实账本为准。
资产募集、Case 分析和合成原型已经收口;正式训练前仍须完成完整泄漏审计、Registry 与 Release。
资产募集与分析(完成)打开完整 STATUS
→ 本地抽样与合成原型(完成)
→ 完整泄漏审计(当前下一步)
→ Registry 与正式 Release
→ 外部训练、统一评测和发布