跳转至

InSituMeasure:利用多模态大模型探究工业场景中的情境化测量基础

文章背景与核心概要

尽管人类操作员只需极少的专业知识就能轻松、可靠地读取仪表并进行连续值测量,但多模态大模型(MLLMs)在处理此类任务时表现却不尽如人意,尽管它们在通用基准测试中表现优异。当前的评估数据集将测量任务与现实的、基于知识的环境隔离开来——缺乏情境上下文、专业仪器、真实世界的噪声以及可操作的失败注释。

为了解决这一问题,作者推出了 InSituMeasure,这是一个专为评估工业场景中情境化测量基础而设计的综合基准。该数据集包含 2,922 个真实工业监控场景,涵盖八个功能类别的专业工程仪器,并配有密集的仪表属性注释和噪声标签,以便进行严格的失效诊断。

对 24 个最先进的多模态大模型进行的评估揭示了显著的性能差距:联合值-单位准确率最高模型仅达到 25.7%,而置信度-诊断 F1 值最高仅为 51.8%。根本原因分析表明,模型的失效源于文本引发的捷径、过度自信的幻觉,以及真实的工业挑战(如混合干扰、视角偏差、遮挡和环境干扰)。


论文元数据

  • arXiv 标识符: arXiv:2609.04014 [cs.AI]
  • 提交日期: 2026年9月3日
  • 主要学科: 人工智能 (cs.AI)
  • 作者:
  • Chao Shen
  • Xinyuan Li
  • Yunfan Zhou
  • Jianguo Yao
  • Haibing Guan
  • Zhihai Wang
  • Xijun Li

链接与资源