InSituMeasure:利用多模态大模型探究工业场景中的情境化测量基础
文章背景与核心概要
尽管人类操作员只需极少的专业知识就能轻松、可靠地读取仪表并进行连续值测量,但多模态大模型(MLLMs)在处理此类任务时表现却不尽如人意,尽管它们在通用基准测试中表现优异。当前的评估数据集将测量任务与现实的、基于知识的环境隔离开来——缺乏情境上下文、专业仪器、真实世界的噪声以及可操作的失败注释。
为了解决这一问题,作者推出了 InSituMeasure,这是一个专为评估工业场景中情境化测量基础而设计的综合基准。该数据集包含 2,922 个真实工业监控场景,涵盖八个功能类别的专业工程仪器,并配有密集的仪表属性注释和噪声标签,以便进行严格的失效诊断。
对 24 个最先进的多模态大模型进行的评估揭示了显著的性能差距:联合值-单位准确率最高模型仅达到 25.7%,而置信度-诊断 F1 值最高仅为 51.8%。根本原因分析表明,模型的失效源于文本引发的捷径、过度自信的幻觉,以及真实的工业挑战(如混合干扰、视角偏差、遮挡和环境干扰)。
论文元数据
- arXiv 标识符: arXiv:2609.04014 [cs.AI]
- 提交日期: 2026年9月3日
- 主要学科: 人工智能 (
cs.AI) - 作者:
- Chao Shen
- Xinyuan Li
- Yunfan Zhou
- Jianguo Yao
- Haibing Guan
- Zhihai Wang
- Xijun Li