VDR · 多模态检索
2026-07-31 · DATA + MODEL

多模态检索
引擎

文档 · 图像 · 音视频统一检索底座。当前先打通文档页这一刀,数据洗干净再训模型。

VDR DATA ENGINE 712,459 干净训练集 v1.2
77.6万清洗前有效对
71.2万导出训练集
0.544bidir · ViDoRe v3@10
0.9163-seed · ViDoRe v1@5

数据资产

训练 · 预训练 · 合成 · 冻结评测
RETRIEVAL PAIRS 5.61M

Docmatix-IR

1 个正例 + 20 个 hard negatives;依赖 Docmatix 图片关联。

PRETRAIN PAGES 18M

PDFA

约 216 万 PDF、1,800 万页;作为页面预训练底库。

OPEN CORPUS 1.27M

Wiki-SS

44,002 个训练 Query,连接 126 万张维基页面截图。

SYNTHESIS MATERIAL 173K

Shennong Chart

中文图表 + Markdown / HTML 真值,用于离线证据校验。

PDFA 数据家族 三层资产按 key / 页序 / 图像指纹登记同源
PDFADocmatixDocmatix-IR
6当前 v1.2 训练源
4主评测:ViDoRe v1/v2/v3 + JinaVDR
5现有多语训练语言
角色资产规模覆盖
TRAINColPali118KDocVQA / 图表 / 论文
TRAINVisRAG Synthetic239K手册 / 教材 / 论文
TRAINVisRAG In-domain123K图表 / 信息图 / 幻灯片
TRAINVDR Multilingual281Kde / en / es / fr / it
TRAINTAT-DQA + TabFQuAD14.8K财务 / 法语表格
PRETRAINPDFA18M 页英文 PDF
CORPUSWiki-SS1.27M 页维基截图
SYNTHShennong Chart173K 图中文图表
EVALViDoRe v1 / v2 / v3多版本多领域 / 多语言
EVALJinaVDR42 子集截图 / 扫描 / 图表 / 多语
EVALMIRACL-VISION18 语言多语言检索
EVALMMLongBench / ViDoSeekPDF 级长文档 / 多跳

数据漏斗

单位:训练对
775,635
100%
757,389
97.6%
757,214
97.6%
712,459
91.9%

模型情况

现在可训 · 有对比 · 有下一步
CURRENT MODEL ColQwen3.5 · 4.5B

v1.2 干净集上的首轮 LoRA 已完成,causal / bidir 都有完整评测。

LoRALate InteractionViDoRe + Jina
VERIFIED DIRECTION bidir / hard-neg

bidir 优于 causal;10k hard-neg 优于 plain in-batch。

架构负样本
SCALE & BASELINE 3-seed / Nemotron

3-seed 融合优于单模型;Nemotron 4B / 8B 作为外部强基线。

融合强基线

v1.2 · causal vs bidir

干净集首轮
ViDoRe v1 nDCG@5
causal0.357
bidir0.371
ViDoRe v2 nDCG@5
causal0.448
bidir0.490
ViDoRe v3 nDCG@10
causal0.517
bidir0.544
JinaVDR nDCG@5
causal0.467
bidir0.472

全量 / 10k / 外部对照

数据版本不完全相同,看方向
模型数据V1@5V2@5V3@10Jina@5
seed42~776K0.9120.5670.5640.756
seed_merged 3-seed~776K0.9160.6090.5930.768
10k plain10k0.8600.5200.513
10k hard-neg10k0.8850.5750.562
nemotron 4b0.9160.64562.04
nemotron 8b0.9270.65262.92

怎么做的

四步
01建清单统一指纹
02建候选去重 · 低信息 · 泄漏
03导出v1.2 训练集
04训练ColQwen LoRA