VDR DATA OS
VDR / 项目文档 / 合成结果

合成结果

27B 两组趋势批次的结果、Case 与问题

生成样本分析

本文只记录当前两组 27B 合成批次的结果与问题;流程规范见 数据合成流程.md,项目阶段见 STATUS.md。两组均为非思考、v1.1-relaxed 趋势批次,不是正式训练集;文件虽暂名 最终训练数据.jsonl,语义仍是 pass + provisional 趋势导出。

1. 先看结论

批次 请求 / 成功页 QC 候选 pass provisional fail 趋势导出
基础 7 源 × 100 700 / 694 673 90 555 28 645
扩展 6 源 × 100 600 / 600 575 52 474 49 526
合计(仅汇总,不是单一 Release) 1,300 / 1,294 1,248 142 1,029 77 1,171

两组均 reasoning_tokens=0 且边界审计通过。相比历史 84 页严格门控基线,规模已经足够观察趋势;但 1,029 条 provisional 不等于证据严格验证通过

人只需要看三样:

  1. 生成样本/:基础 7 源批次;
  2. 生成样本/新增训练源_6源各100条/:扩展 6 源批次;
  3. 各目录的 结果汇总.json最终训练数据.jsonl人工抽检结果.jsonl

2. 批次配置

  • 模型:ms-g9248pbm(Qwen3.6-27B)
  • 模式:严格非思考 + JSON Schema
  • Prompt / 门控:v1.1-relaxed
  • 输入:只给页面图片 + 固定 Prompt;OCR/Markdown 不进模型
  • 采样:temperature=0,每页 1 个候选,max_tokens=1024
  • 并发:基础批次 16,扩展批次 32;当前默认入口 32
  • 平均延迟:基础约 5.0s / 页,扩展约 5.5s / 页
  • Token:两批 prompt 合计约 300 万,completion 约 10 万,reasoning 0

3. 按来源看结果

来源 候选 pass provisional fail 导出
shennong2_chart 98 90 1 7 91
tabfquad_train_set 100 0 100 0 100
vdr-multilingual-train 98 0 98 0 98
VisRAG-Ret-Train-Synthetic-data 95 0 95 0 95
tatdqa_train 95 0 93 2 93
colpali_train_set 94 0 91 3 91
VisRAG-Ret-Train-In-domain-data 93 0 77 16 77
VDR_Military 93 0 88 5 88
VDR_Energy 94 0 94 0 94
VDR_Hydrogen 97 0 97 0 97
VDR_Geotechnie 98 0 97 1 97
pdfa-eng-wds 95 52 4 39 56
Docmatix 98 0 94 4 94

关键结论:

  • 主要 pass 来源是 shennong2_chartpdfa-eng-wds:前者有 Markdown/HTML,后者有首页 OCR 预览,能做 strict_text 校验。
  • 其余来源几乎全是 provisional,原因集中在 no_text_reference_soft_export:格式通过,但本地没有独立页面真值可自动核对。
  • In-domain 的主要问题是 批内重复 Query;PDFA 的主要问题是 OCR 验证未命中。
  • PDFA 的 39 条验证失败主要是 OCR 短预览未覆盖答案或存在 OCR 噪声;短预览不能等价于全页真值。

4. 语言与问法

语言分布:

语言 候选数
en 805
fr 286
zh 96
de / es / it 各 20
ar 1

问法类型:

query_type 候选数 主要来源
retrieval 670 VisRAG Synthetic、多语言、VDR_*、PDFA
field 287 ColPali、TAT-DQA、Docmatix
table 100 TabFQuAD
chart 98 神龙图表
visual 93 VisRAG In-domain

全部候选 answer_type=span。基础批次 Query 长度中位 67、P90 约 107、最长 232;两批整体都以短到中等长度事实型问题为主。

5. 真实例子

5.1 严格通过(神龙)

来源:shennong2_chart
Query:图中占比最大的DDoS攻击类型是什么?
Answer:SYN - Flood
Evidence:SYN - Flood 36%
状态:pass

这类样本说明:图生文 + Markdown/HTML 离线校验这条链路是通的。

5.2 宽松观察(无独立文本真值)

来源:VisRAG-Ret-Train-In-domain-data
Query:How many million native speakers does the infographic list for the Spanish language?
Answer:387
Evidence:Spanish 387 MILLION
状态:provisional
原因:no_text_reference_soft_export
来源:tabfquad_train_set
Query:Quel est le chiffre d'affaires pour la période avril-septembre 2011 ?
Answer:13 009
Evidence:Chiffre d'affaires 13 009
状态:provisional
来源:vdr-multilingual-train
Query:Welches Datum wird für die Veröffentlichung des Artikels in der Zeitschrift 'Contemporanul' angegeben?
Answer:16. Juni 1961
状态:provisional

这些样本看起来可读、可检索,但当前没有 OCR/Markdown 自动证据校验,所以只能作为趋势观察,不能当严格金标。

扩展来源的典型结果:

[VDR_Military] How many F-16s does Belgium plan to provide to Ukraine by 2028?
Answer:30(provisional,人工看图正确)

[VDR_Geotechnie] Quelle est la nature du sol d'assise pour le sondage RF1 ?
Answer:2a – Granite décomposé(provisional,法语自然)

[pdfa-eng-wds] What is the title of the Grade 8 sample lesson plan shown in the document?
Answer:Stroke Prevention(pass,命中 OCR 预览)

[Docmatix] What is the company name listed on the document?
Answer:HERBERT ULRICH FRICK LTD.(provisional,人工看图正确)

5.3 失败样本

批内重复:

Query:What is the title of the chart?
状态:fail
原因:duplicate_generated_query

同一句重复最多出现 14 次,集中在 VisRAG In-domain。说明 temperature=0 时,模型对图表页容易塌缩到标题类问题。

神龙读数失败:

Query:2019年0-14岁人口占总人口比例是多少?
Answer:约13%
状态:fail
原因:answer_not_found:约13%
Query:图中显示招行在4Q22到1Q23的变化百分比是多少?
Answer:-7.87%
状态:fail
原因:answer_not_found / evidence_not_found

神龙的失败主要是数值/百分比无法在 Markdown/HTML 中命中,不是 API 或格式问题。

6. 失败分布

失败发生在四个阶段:

阶段 条数 含义
candidate_schema 46 生成后字段/指代门控拒绝,未进入 QC 候选
post_validation 36 终审拦截:批内重复、官方/测试 Query 重合
verification 42 证据/答案未命中真值
generation 6 请求级失败,页面没有产出候选

进一步拆开:

  • schema:context_dependent_query 42,query_not_chinese 2,invalid_evidence 2
  • 终审:duplicate_generated_query 34,copied_official_query 1,matches_evaluation_query 1
  • 证据:42 条,扩展批次的 35 条主要来自 PDFA OCR 预览未命中
  • 请求:6 页全部是 TAT-DQA 的稳定长度截断;扩到更大 max_tokens 仍截断,已停止无效重试

7. 对 27B 生成趋势的判断

  1. 格式稳定:严格非思考 + JSON Schema 基本可用,没有 reasoning token,审计通过。
  2. 严格证据通过率取决于真值是否存在:神龙 Markdown/HTML 和 PDFA OCR 能产出 pass;无真值来源只能进 provisional
  3. 温度 0 会塌缩问法:标题类、坐标轴类 Query 重复明显。后续要多样性,需要提温度,或在 Prompt 中禁止通用标题问题,并加强批内语义去重。
  4. 页面依赖仍不少:两批共 42 条被强指代门控拦下;放宽后导出量上来了,但检索独立性还要继续看。
  5. 多语言链路可用:德/西/法/意都能产出自然检索问题;法语 TabFQuAD 100 条全部进入导出。
  6. TAT-DQA 有少量退化页:6 页稳定长度截断,建议后续单独抽样排查图片复杂度或 Prompt 适配,而不是无限加大 token。
  7. 扩展 6 源链路可规模化:600 页全部获得 API 响应,但标题型问题、指代门控和 PDFA 短 OCR 仍限制严格质量。

8. 怎么用这批数据

适合:

  • 看 27B 在不同来源上会问什么、答什么;
  • 对比神龙严格校验 vs 其他来源宽松观察;
  • 排查重复 Query、强指代、读数错误;
  • 作为后续 Prompt / 门控调整的对照批次。

不适合:

  • 直接当作正式严格训练金标;
  • 作为正式训练 Release 直接交给训练程序;
  • 把 1,029 条 provisional 等同于证据已验证;
  • 混入任何测试集或评测调参。

如果只看严格候选:两批共有 142 条 pass(基础 90,扩展 52)。它们仍需完整评测隔离和正式 Release 门禁,不能直接因 pass 命名进入训练。

9. 下一步建议

  1. 给无独立真值来源补 OCR 或页面文本,把更多 provisional 变成可验证 pass;PDFA 需要全页文本而非短预览。
  2. 开一版 temperature=0.7 小对比,专门看重复 Query 是否下降。
  3. Prompt 明确禁止 “What is the title of the chart/document?” 这类低信息问题。
  4. 神龙失败样本做人工抽检,区分“模型读错”和“Markdown/HTML 与图不一致”。
  5. 在 ViDoRe eval* 接入终审黑名单前,两批都只能作趋势观察,不能发布正式 Release。
由本地 docs/生成样本分析.md 自动构建 · 本地 Markdown 是内容源