VDR / 项目文档 / 合成结果
合成结果
27B 两组趋势批次的结果、Case 与问题
生成样本分析
本文只记录当前两组 27B 合成批次的结果与问题;流程规范见 数据合成流程.md,项目阶段见 STATUS.md。两组均为非思考、v1.1-relaxed 趋势批次,不是正式训练集;文件虽暂名 最终训练数据.jsonl,语义仍是 pass + provisional 趋势导出。
1. 先看结论
| 批次 | 请求 / 成功页 | QC 候选 | pass | provisional | fail | 趋势导出 |
|---|---|---|---|---|---|---|
| 基础 7 源 × 100 | 700 / 694 | 673 | 90 | 555 | 28 | 645 |
| 扩展 6 源 × 100 | 600 / 600 | 575 | 52 | 474 | 49 | 526 |
| 合计(仅汇总,不是单一 Release) | 1,300 / 1,294 | 1,248 | 142 | 1,029 | 77 | 1,171 |
两组均 reasoning_tokens=0 且边界审计通过。相比历史 84 页严格门控基线,规模已经足够观察趋势;但 1,029 条 provisional 不等于证据严格验证通过。
人只需要看三样:
生成样本/:基础 7 源批次;生成样本/新增训练源_6源各100条/:扩展 6 源批次;- 各目录的
结果汇总.json、最终训练数据.jsonl和人工抽检结果.jsonl。
2. 批次配置
- 模型:
ms-g9248pbm(Qwen3.6-27B) - 模式:严格非思考 + JSON Schema
- Prompt / 门控:
v1.1-relaxed - 输入:只给页面图片 + 固定 Prompt;OCR/Markdown 不进模型
- 采样:
temperature=0,每页 1 个候选,max_tokens=1024 - 并发:基础批次 16,扩展批次 32;当前默认入口 32
- 平均延迟:基础约 5.0s / 页,扩展约 5.5s / 页
- Token:两批 prompt 合计约 300 万,completion 约 10 万,reasoning 0
3. 按来源看结果
| 来源 | 候选 | pass | provisional | fail | 导出 |
|---|---|---|---|---|---|
| shennong2_chart | 98 | 90 | 1 | 7 | 91 |
| tabfquad_train_set | 100 | 0 | 100 | 0 | 100 |
| vdr-multilingual-train | 98 | 0 | 98 | 0 | 98 |
| VisRAG-Ret-Train-Synthetic-data | 95 | 0 | 95 | 0 | 95 |
| tatdqa_train | 95 | 0 | 93 | 2 | 93 |
| colpali_train_set | 94 | 0 | 91 | 3 | 91 |
| VisRAG-Ret-Train-In-domain-data | 93 | 0 | 77 | 16 | 77 |
| VDR_Military | 93 | 0 | 88 | 5 | 88 |
| VDR_Energy | 94 | 0 | 94 | 0 | 94 |
| VDR_Hydrogen | 97 | 0 | 97 | 0 | 97 |
| VDR_Geotechnie | 98 | 0 | 97 | 1 | 97 |
| pdfa-eng-wds | 95 | 52 | 4 | 39 | 56 |
| Docmatix | 98 | 0 | 94 | 4 | 94 |
关键结论:
- 主要
pass来源是shennong2_chart和pdfa-eng-wds:前者有 Markdown/HTML,后者有首页 OCR 预览,能做strict_text校验。 - 其余来源几乎全是
provisional,原因集中在no_text_reference_soft_export:格式通过,但本地没有独立页面真值可自动核对。 - In-domain 的主要问题是 批内重复 Query;PDFA 的主要问题是 OCR 验证未命中。
- PDFA 的 39 条验证失败主要是 OCR 短预览未覆盖答案或存在 OCR 噪声;短预览不能等价于全页真值。
4. 语言与问法
语言分布:
| 语言 | 候选数 |
|---|---|
| en | 805 |
| fr | 286 |
| zh | 96 |
| de / es / it | 各 20 |
| ar | 1 |
问法类型:
| query_type | 候选数 | 主要来源 |
|---|---|---|
| retrieval | 670 | VisRAG Synthetic、多语言、VDR_*、PDFA |
| field | 287 | ColPali、TAT-DQA、Docmatix |
| table | 100 | TabFQuAD |
| chart | 98 | 神龙图表 |
| visual | 93 | VisRAG In-domain |
全部候选 answer_type=span。基础批次 Query 长度中位 67、P90 约 107、最长 232;两批整体都以短到中等长度事实型问题为主。
5. 真实例子
5.1 严格通过(神龙)
来源:shennong2_chart
Query:图中占比最大的DDoS攻击类型是什么?
Answer:SYN - Flood
Evidence:SYN - Flood 36%
状态:pass这类样本说明:图生文 + Markdown/HTML 离线校验这条链路是通的。
5.2 宽松观察(无独立文本真值)
来源:VisRAG-Ret-Train-In-domain-data
Query:How many million native speakers does the infographic list for the Spanish language?
Answer:387
Evidence:Spanish 387 MILLION
状态:provisional
原因:no_text_reference_soft_export来源:tabfquad_train_set
Query:Quel est le chiffre d'affaires pour la période avril-septembre 2011 ?
Answer:13 009
Evidence:Chiffre d'affaires 13 009
状态:provisional来源:vdr-multilingual-train
Query:Welches Datum wird für die Veröffentlichung des Artikels in der Zeitschrift 'Contemporanul' angegeben?
Answer:16. Juni 1961
状态:provisional这些样本看起来可读、可检索,但当前没有 OCR/Markdown 自动证据校验,所以只能作为趋势观察,不能当严格金标。
扩展来源的典型结果:
[VDR_Military] How many F-16s does Belgium plan to provide to Ukraine by 2028?
Answer:30(provisional,人工看图正确)
[VDR_Geotechnie] Quelle est la nature du sol d'assise pour le sondage RF1 ?
Answer:2a – Granite décomposé(provisional,法语自然)
[pdfa-eng-wds] What is the title of the Grade 8 sample lesson plan shown in the document?
Answer:Stroke Prevention(pass,命中 OCR 预览)
[Docmatix] What is the company name listed on the document?
Answer:HERBERT ULRICH FRICK LTD.(provisional,人工看图正确)5.3 失败样本
批内重复:
Query:What is the title of the chart?
状态:fail
原因:duplicate_generated_query同一句重复最多出现 14 次,集中在 VisRAG In-domain。说明 temperature=0 时,模型对图表页容易塌缩到标题类问题。
神龙读数失败:
Query:2019年0-14岁人口占总人口比例是多少?
Answer:约13%
状态:fail
原因:answer_not_found:约13%Query:图中显示招行在4Q22到1Q23的变化百分比是多少?
Answer:-7.87%
状态:fail
原因:answer_not_found / evidence_not_found神龙的失败主要是数值/百分比无法在 Markdown/HTML 中命中,不是 API 或格式问题。
6. 失败分布
失败发生在四个阶段:
| 阶段 | 条数 | 含义 |
|---|---|---|
| candidate_schema | 46 | 生成后字段/指代门控拒绝,未进入 QC 候选 |
| post_validation | 36 | 终审拦截:批内重复、官方/测试 Query 重合 |
| verification | 42 | 证据/答案未命中真值 |
| generation | 6 | 请求级失败,页面没有产出候选 |
进一步拆开:
- schema:
context_dependent_query42,query_not_chinese2,invalid_evidence2 - 终审:
duplicate_generated_query34,copied_official_query1,matches_evaluation_query1 - 证据:42 条,扩展批次的 35 条主要来自 PDFA OCR 预览未命中
- 请求:6 页全部是 TAT-DQA 的稳定长度截断;扩到更大
max_tokens仍截断,已停止无效重试
7. 对 27B 生成趋势的判断
- 格式稳定:严格非思考 + JSON Schema 基本可用,没有 reasoning token,审计通过。
- 严格证据通过率取决于真值是否存在:神龙 Markdown/HTML 和 PDFA OCR 能产出
pass;无真值来源只能进provisional。 - 温度 0 会塌缩问法:标题类、坐标轴类 Query 重复明显。后续要多样性,需要提温度,或在 Prompt 中禁止通用标题问题,并加强批内语义去重。
- 页面依赖仍不少:两批共 42 条被强指代门控拦下;放宽后导出量上来了,但检索独立性还要继续看。
- 多语言链路可用:德/西/法/意都能产出自然检索问题;法语 TabFQuAD 100 条全部进入导出。
- TAT-DQA 有少量退化页:6 页稳定长度截断,建议后续单独抽样排查图片复杂度或 Prompt 适配,而不是无限加大 token。
- 扩展 6 源链路可规模化:600 页全部获得 API 响应,但标题型问题、指代门控和 PDFA 短 OCR 仍限制严格质量。
8. 怎么用这批数据
适合:
- 看 27B 在不同来源上会问什么、答什么;
- 对比神龙严格校验 vs 其他来源宽松观察;
- 排查重复 Query、强指代、读数错误;
- 作为后续 Prompt / 门控调整的对照批次。
不适合:
- 直接当作正式严格训练金标;
- 作为正式训练 Release 直接交给训练程序;
- 把 1,029 条
provisional等同于证据已验证; - 混入任何测试集或评测调参。
如果只看严格候选:两批共有 142 条 pass(基础 90,扩展 52)。它们仍需完整评测隔离和正式 Release 门禁,不能直接因 pass 命名进入训练。
9. 下一步建议
- 给无独立真值来源补 OCR 或页面文本,把更多
provisional变成可验证pass;PDFA 需要全页文本而非短预览。 - 开一版
temperature=0.7小对比,专门看重复 Query 是否下降。 - Prompt 明确禁止 “What is the title of the chart/document?” 这类低信息问题。
- 神龙失败样本做人工抽检,区分“模型读错”和“Markdown/HTML 与图不一致”。
- 在 ViDoRe
eval*接入终审黑名单前,两批都只能作趋势观察,不能发布正式 Release。