文章背景与核心概要
本文深入研究了用于文档理解的视觉语言模型(VLM)中的转写忠实度(transcription faithfulness)。作者通过研究发现,VLM在面对不完美或受扰动的文本时,往往不会扮演忠实的转写者,而是倾向于将其“重写”为更合理的标准形式——这种行为在传统的干净文本OCR基准测试中往往被掩盖。
为了量化这一现象,研究人员推出了 FaithC4,这是一个包含英语、中文和韩语的1,455页单页文档的多语言扰动基准测试。对15个不同系统的评估揭示了在文本扰动下字错误率(WER)恶化的显著差异。此外,对 Qwen3-VL-4B 的逐层探测(layer-by-layer probing)以及对单词长度效应的分析,为模型何时以及为何选择“重写”而非“阅读”提供了机制层面的深刻见解。
视觉语言模型是在阅读还是在重写?探究视觉语言模型中的转写忠实度
Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models
作者: Gwang Gook Lee, Kenan Emir Ak, Jay Mohta, Yan Xu, Dimitrios Dimitriadis
学科领域: 人工智能 (cs.AI);计算与语言 (cs.CL)
arXiv: 2607.21617v2 [cs.AI]
提交时间: 2026年5月29日;最后修订:2026年9月2日
📌 摘要
📌 Summary
本文研究了用于文档理解的视觉语言模型(VLM)中的转写忠实度。作者揭示,VLM不仅没有充当忠实的转写者,反而经常将不完美或受到干扰的文本“重写”成更合理的表单——这种行为被传统的纯文本OCR基准测试所掩盖。
为了量化这一点,研究人员引入了 FaithC4,这是一个多语言扰动基准测试,包含英语、中文和韩语的1,455个单页文档。对15个不同系统的评估显示,在文本扰动下,字错误率(WER)的退化存在显著差异。此外,对 Qwen3-VL-4B 的逐层探测以及对字长效应的分析,为模型何时以及为何选择重写而不是阅读提供了机制上的见解。
📋 核心发现与洞察
📋 Key Findings & Insights
- 重写现象: 当遇到不完美的文本时,VLM通常会产生幻觉或将文本纠正为标准的、合理的表单,而不是忠实地记录视觉输入。
- The Rewriting Phenomenon: When encountering imperfect text, VLMs often hallucinate or correct text into a standard, plausible form rather than faithfully recording the visual input.
- FaithC4 基准测试: 一个新的多语言扰动基准测试,包含1,455个文档,横跨三种语言(英语、中文、韩语)以及三类扰动系列:
- 乱序重排(Scramble)
- 随机替换(Random substitution)
- 视觉相似替换(Visually similar substitution)
- FaithC4 Benchmark: A new multilingual perturbation benchmark featuring 1,455 documents spanning three languages (English, Chinese, Korean) and three perturbation families:
- Scramble
- Random substitution
- Visually similar substitution
- 系统对比(英语WER退化表现):
- 通用型 VLM: 退化高达 6.9个百分点。
- OCR专用 VLM: 退化 0.1 到 3.4个百分点。
- 传统 OCR 管道: 退化小于 0.8个百分点。
- System Comparisons (English WER Degradation):
- General-purpose VLMs: Degrade by up to 6.9 points.
- OCR-specialized VLMs: Degrade by 0.1 to 3.4 points.
- Traditional OCR pipelines: Degrade by less than 0.8 points.
- 机制探测(
Qwen3-VL-4B): - 只有当受扰动单词的最后一层 FFN 表示与其原始编码保持接近时,重写现象才会严格发生。
- 当表示发生足够大的分歧时,模型会恢复到忠实转写。
- Mechanistic Probing (
Qwen3-VL-4B): - Rewriting occurs strictly when a perturbed word's final-layer FFN representation remains close to its original encoding.
- When the representation diverges sufficiently, the model reverts to faithful transcription.
- Mechanistic Probing (
- 单词长度敏感性:
- 短单词(4-6个字符)被重写的概率高达 10%。
- 在 8个字符 处存在一个明显的截断点,超过该长度,重写率会降至 0%。
- Word Length Sensitivity:
- Short words (4–6 characters) are rewritten up to 10% of the time.
- There is a sharp cutoff at 8 characters, above which rewriting drops to 0%.
🔗 链接与资源
🔗 Links & Resources
- 全文访问: 查看 PDF | HTML 版本(实验性)
- Full-Text Access: View PDF | HTML Version (Experimental)
- DOI: 10.48550/arXiv.2607.21617
- 许可证: 知识共享署名 4.0

- License: Creative Commons Attribution 4.0

- License: Creative Commons Attribution 4.0