跳转至

文章背景与核心概要

本文深入研究了用于文档理解的视觉语言模型(VLM)中的转写忠实度(transcription faithfulness)。作者通过研究发现,VLM在面对不完美或受扰动的文本时,往往不会扮演忠实的转写者,而是倾向于将其“重写”为更合理的标准形式——这种行为在传统的干净文本OCR基准测试中往往被掩盖。

为了量化这一现象,研究人员推出了 FaithC4,这是一个包含英语、中文和韩语的1,455页单页文档的多语言扰动基准测试。对15个不同系统的评估揭示了在文本扰动下字错误率(WER)恶化的显著差异。此外,对 Qwen3-VL-4B 的逐层探测(layer-by-layer probing)以及对单词长度效应的分析,为模型何时以及为何选择“重写”而非“阅读”提供了机制层面的深刻见解。


视觉语言模型是在阅读还是在重写?探究视觉语言模型中的转写忠实度

Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models

作者: Gwang Gook Lee, Kenan Emir Ak, Jay Mohta, Yan Xu, Dimitrios Dimitriadis
学科领域: 人工智能 (cs.AI);计算与语言 (cs.CL)
arXiv: 2607.21617v2 [cs.AI]
提交时间: 2026年5月29日;最后修订:2026年9月2日


📌 摘要

📌 Summary

本文研究了用于文档理解的视觉语言模型(VLM)中的转写忠实度。作者揭示,VLM不仅没有充当忠实的转写者,反而经常将不完美或受到干扰的文本“重写”成更合理的表单——这种行为被传统的纯文本OCR基准测试所掩盖。

为了量化这一点,研究人员引入了 FaithC4,这是一个多语言扰动基准测试,包含英语、中文和韩语的1,455个单页文档。对15个不同系统的评估显示,在文本扰动下,字错误率(WER)的退化存在显著差异。此外,对 Qwen3-VL-4B 的逐层探测以及对字长效应的分析,为模型何时以及为何选择重写而不是阅读提供了机制上的见解。


📋 核心发现与洞察

📋 Key Findings & Insights

  • 重写现象: 当遇到不完美的文本时,VLM通常会产生幻觉或将文本纠正为标准的、合理的表单,而不是忠实地记录视觉输入。
    • The Rewriting Phenomenon: When encountering imperfect text, VLMs often hallucinate or correct text into a standard, plausible form rather than faithfully recording the visual input.
  • FaithC4 基准测试: 一个新的多语言扰动基准测试,包含1,455个文档,横跨三种语言(英语、中文、韩语)以及三类扰动系列:
  • 乱序重排(Scramble)
  • 随机替换(Random substitution)
  • 视觉相似替换(Visually similar substitution)
    • FaithC4 Benchmark: A new multilingual perturbation benchmark featuring 1,455 documents spanning three languages (English, Chinese, Korean) and three perturbation families:
    • Scramble
    • Random substitution
    • Visually similar substitution
  • 系统对比(英语WER退化表现):
  • 通用型 VLM: 退化高达 6.9个百分点
  • OCR专用 VLM: 退化 0.1 到 3.4个百分点
  • 传统 OCR 管道: 退化小于 0.8个百分点
    • System Comparisons (English WER Degradation):
    • General-purpose VLMs: Degrade by up to 6.9 points.
    • OCR-specialized VLMs: Degrade by 0.1 to 3.4 points.
    • Traditional OCR pipelines: Degrade by less than 0.8 points.
  • 机制探测(Qwen3-VL-4B):
  • 只有当受扰动单词的最后一层 FFN 表示与其原始编码保持接近时,重写现象才会严格发生。
  • 当表示发生足够大的分歧时,模型会恢复到忠实转写。
    • Mechanistic Probing (Qwen3-VL-4B):
    • Rewriting occurs strictly when a perturbed word's final-layer FFN representation remains close to its original encoding.
    • When the representation diverges sufficiently, the model reverts to faithful transcription.
  • 单词长度敏感性:
  • 短单词(4-6个字符)被重写的概率高达 10%
  • 8个字符 处存在一个明显的截断点,超过该长度,重写率会降至 0%
    • Word Length Sensitivity:
    • Short words (4–6 characters) are rewritten up to 10% of the time.
    • There is a sharp cutoff at 8 characters, above which rewriting drops to 0%.

🔗 链接与资源