Visual Document Retrieval · Data Infrastructure

把多源文档数据
治理成可信 Release

面向视觉文档检索的统一数据中台:覆盖多语言、图表、论文、财报、工业文档与长文档评测,贯通资产登记、样本复核、合成质检、泄漏审计和版本发布。

VDRDATA OS
MULTILINGUAL DOCUMENT AI EVAL FIREWALL TRACEABLE RELEASE
15训练侧资产已完成分析
2,215训练与评测复核样本
5.61M最大检索监督源 Pair
18MPDFA 预训练页面量级
8 × 6ViDoRe v3 领域 × 语言
Why · System

不是“堆数据”,而是建立数据操作系统

不同来源在任务、粒度、许可证、质量和评测协议上都不相同。中台的价值,是让每条数据都可识别、可审计、可追溯、可复现。

01 / IDENTITY

统一身份与谱系

Dataset、Document、Page、Pair 分层建模;用稳定 ID、文件哈希和感知哈希追踪跨库同源关系。

02 / QUALITY

证据驱动的质量门控

区分严格 pass、观察用 provisional 和 fail;OCR、Markdown、HTML 只做离线验证,不进入生成 Prompt。

03 / FIREWALL

冻结评测防火墙

评测 Query、页面、答案、qrels、证据和近重复项禁止进入训练、合成、负例挖掘与调参。

Pipeline

从原始资产到版本化 Release

当前前两阶段已经收口,项目正进入完整泄漏审计。只有通过审计和 Registry,才能形成正式训练 Release。

资产募集训练 / 预训练 / 合成材料 / 冻结评测
Case 与抽样真实结构、字段、规模与人工复核窗口
合成原型图片输入、结构化生成、QC 与审计跑通
泄漏审计Query、ID、图片/PDF、上游来源与近重复
Registry稳定身份、角色、血缘、许可与质量记录
Release版本、manifest、校验和、审计报告
已完成当前阶段后续门槛
Assets · Scale

四类资产,构成多域视觉文档底座

数据规模不能简单相加:文档、页面、QA 轮次和检索 Pair 是不同统计单位。这里展示各资产在系统中的真实角色。

5.61M

Docmatix-IR 检索监督

当前最大规模开放域文档视觉检索对。每条包含 1 个正例与 20 个 hard negatives,依赖 Docmatix images 关联。

PDFADocmatixDocmatix-IR
18M

PDFA 页面预训练底库

约 216 万英文 PDF、约 1,800 万页。它是预训练材料,不是现成检索 Pair;与 Docmatix 通过 PDFA key 建立同源谱系。

PDFPageOCR Verify
1.27M

Wiki-SS 维基截图 Corpus

44,002 个 NQ 训练 Query 连接 1,267,874 张 Wikipedia 页面截图;测试集采用开放域全库检索。

NQ QuerydocidWiki Screenshot
173K

Shennong 图表合成材料

图表图片配套 Markdown / HTML 离线真值,是当前严格证据校验最强的合成来源之一。

ImageQwen 27BOffline Evidence
Explorer

可检索的资产清单

按角色过滤或搜索名称、领域和风险。训练与评测资产在逻辑角色和本地 manifest 中均保持隔离。

显示 18 / 18 训练与评测在逻辑角色上隔离
角色资产规模 / 结构覆盖关键边界
TRAINColPali train118,195 对DocVQA / 图表 / 论文含 108 条 ArxivQA Query + 正图泄漏
TRAINVisRAG Synthetic239,358 对手册 / 教材 / ICML / NeurIPS需过滤空 Query、弱 Query 与超长文本
TRAINVisRAG In-domain122,752 对图表 / 信息图 / 文档 / 幻灯片与 5 个 VisRAG 测试集有精确 Query 重合
TRAINVDR Multilingual280,679 Queryde / en / es / fr / it保留 hard negatives;西语有 1 条测试 Query 重合
TRAINTAT-DQA / TabFQuAD13,251 / 1,552财务表格 / 法语表格自带 eval 或与 ViDoRe 上游重合风险
TRAINVDR Domain × 4656,102 行军事 / 能源 / 氢能 / 法语岩土train/test 隔离;filtered OCR 只供校验
TRAINWiki-SS-NQ + Corpus44,002 Query / 1.27M 页维基截图 / 自然问题test 无正例,必须走完整 corpus 检索
TRAINDocmatix-IR5,612,890 对开放域文档依赖 Docmatix 图片 join;需按 PDFA key 去重
PRETRAINPDFA约 216 万 PDF / 1,800 万页英文 PDF不是监督 Pair;与 Docmatix 同源
DOCVQADocmatix约 127 万文档 / 950 万 QA多页、多轮 DocVQA改造后才能进入检索监督
SYNTHESISShennong Chart172,975 张图表中文图表 / 结构化真值Markdown / HTML 只用于离线验证
EVALVDR Multilingual test5 语言 × 3 页面类型多语言视觉检索15 个 1,000 页候选池必须独立
EVALVisRAG Tests6 个 benchmark论文 / 图表 / 信息图 / 文档 / 幻灯片保留 corpus / queries / 多正例 qrels
EVALMMLongBench-Doc1,091 问题 / 135 PDF长文档 / 跨页理解33% 跨页;含不可回答问题
EVALJinaVDR42 子集 / 60,845 行截图 / 扫描 / 图表 / 多语空 Query 可定义 corpus;按子集建池
EVALMIRACL-VISION / NayanaIR18 语言 / 22 Mono + Cross多语言 / 跨语言保留多正例与跨语协议
EVALViDoSeek1,142 Query + 2,020 SlideVQAPDF RAG / 多跳完整 PDF 候选池;页码映射
EVALViDoRe v1 / v2 / v3v3:8 领域 × 6 语言生医 / 能源 / 金融 / 工业等按领域 × 语言建池并过滤 qrels
没有匹配的资产,试试换个关键词或回到「全部」。
Synthesis · QC

27B 多模态合成链路已经跑通

Qwen3.6-27B 仅接收页面图片与固定 Prompt;两批共请求 1,300 页。结果用于验证链路和观察趋势,不是正式训练 Release。

1,300 页合成请求的质量分层

来源:两组 v1.1-relaxed 趋势批次 · 2026-07-27

142
1,029
77
52
142严格 pass
1,029provisional
77QC fail
52未进入 QC / 请求缺失
关键判断大规模结构化生成可运行;真正限制严格通过率的不是格式,而是页面是否具备独立文本真值。

候选 Query 语言分布

单位:QC 候选条数;总计 1,248

英语 en
805
法语 fr
286
中文 zh
96
德语 de
20
西语 es
20
意语 it
20
阿语 ar
1
Real Cases

从页面到可检索问题

下面展示合成链路的代表性输出。严格通过依赖独立证据命中;人工看图正确但无文本真值的样本仍标记 provisional。

VISUAL DOCUMENTPAGE 09
Quarterly Infrastructure & Energy Review
SHENNONG CHART · ZHPASS
图中占比最大的 DDoS 攻击类型是什么?
SYN-Flood · 证据:SYN-Flood 36%
PDFA · ENPASS
What is the title of the Grade 8 sample lesson plan shown in the document?
Stroke Prevention · 命中 OCR 预览
VDR GEOTECHNIE · FRPROVISIONAL
Quelle est la nature du sol d'assise pour le sondage RF1 ?
2a – Granite décomposé · 人工看图正确
VDR MILITARY · ENPROVISIONAL
How many F-16s does Belgium plan to provide to Ukraine by 2028?
30 · 无独立页面文本真值
Evaluation · Firewall

覆盖多语言、多领域与长文档的评测防线

评测协议不是一张统一表:隐式正对、开放域 corpus、多正例 qrels、PDF 页码、多语过滤都必须原样保留。

MULTILINGUAL

跨语言泛化

MIRACL-VISION 18 种语言;NayanaIR 同时覆盖 Mono 与 Cross;VDR 多语言按语言 × 页面类型形成 15 个独立候选池。

MULTI-DOMAIN

领域纵深

ViDoRe v3 覆盖计算机、能源、金融、人力、工业、制药和物理等 8 领域,每个领域包含 6 种语言。

LONG DOCUMENT

跨页与 RAG

MMLongBench-Doc 中 33% 为跨页问题;ViDoSeek 使用完整 PDF 候选池,覆盖检索、多跳推理和生成。

Risk Control

已知风险不回避,Release 门槛明确

“数据到齐”不等于“可以开训”。当前工作重点是把已知重合、潜在同源和协议差异变成可执行的审计规则。

CONFIRMED / HIGH

已确认训练—测试重合

ColPali 含 108 条 ArxivQA Query + 正图重合;VisRAG In-domain 与 5 个测试集有精确 Query 重合。

PENDING / PRIORITY

ViDoRe 上游同源审计

需核查 ViDoRe v1/v2/v3 与 ColPali、TabFQuAD、TAT-DQA、VDR Energy 等训练来源的重合。

LINEAGE / PRIORITY

PDFA 数据家族谱系

PDFA、Docmatix、Docmatix-IR 必须按 PDFA key、页序和图片感知哈希完成同源登记。

PROTOCOL

候选池不能拍平

JinaVDR、ViDoRe v1 的空 Query 行可能定义 corpus;ViDoRe v3 必须按领域 × 语言过滤 qrels。

QUALITY

provisional 不是金标

1,029 条 provisional 只代表结构通过、缺少独立文本证据,不得包装成严格训练样本。

RELEASE

“最终文件”不等于 Release

正式 Release 必须绑定 Registry 版本、清洗规则、泄漏报告、质量阈值与文件校验和。

Roadmap

下一阶段:从可运行原型到可信数据产品

目标不是继续无边界募集数据,而是完成治理闭环,并用受控训练和统一评测证明数据质量的实际价值。

资产收口

计划内训练与评测全部落盘、分析和抽样。

合成原型

图片输入、断点续跑、QC、终审和审计链路跑通。

完整泄漏审计

Query、ID、感知哈希、PDF 与上游来源。

Registry & Release

稳定身份、谱系、许可、版本和审计报告。

训练与统一评测

来源消融、质量消融、多语言与跨 benchmark 泛化。

核心研究命题经过统一身份、质量治理和测训隔离的多源 VDR 数据,能否比简单拼接带来更稳定的跨域、跨语言泛化?
Knowledge Base

项目文档中心

本页和全部子页面由本地 docs/*.md 构建。发生冲突时,以 STATUS 和事实账本为准。

STATUS SYNC · 2026-07-27

首页状态与唯一事实源同步

资产募集、Case 分析和合成原型已经收口;正式训练前仍须完成完整泄漏审计、Registry 与 Release。

资产募集与分析(完成)
→ 本地抽样与合成原型(完成)
→ 完整泄漏审计(当前下一步)
→ Registry 与正式 Release
→ 外部训练、统一评测和发布
打开完整 STATUS