跳转至

GUI元素定位中的词汇耦合:句子嵌入在移动端与Web端的标签追踪表现

文章背景与核心概要

在图形用户界面(GUI)元素定位任务中,通常将UI元素以文本元数据的形式呈现。目前的研究往往将指令与元素嵌入之间的“高相似度”视为语义定位成功的确凿证据。然而,本文通过对三个移动端和Web端基准测试的深入分析,揭示了这一评估范式中存在的潜在偏差。

研究发现,嵌入模型的相似度得分往往受到“可见标签恢复(visible-label recovery)”的混淆,即模型仅仅是匹配了文本字面量而非理解了语义。词汇基准模型在Top-1准确率上依然具有极强的竞争力,且对于缺乏标签的目标元素,纯文本方法表现依然薄弱。作者指出,基于嵌入的评估往往混淆了简单的标签匹配与真正的语义定位,并建议未来的研究应引入词汇基准、标签类型分层及可部署融合诊断,以更客观地评估模型性能。


摘要概要

在评估图形用户界面(GUI)元素定位(即将UI元素作为文本元数据暴露)时,指令与元素嵌入之间的高相似度往往被错误地视为语义定位成功的确凿证据。

When evaluating Graphical User Interface (GUI) element grounding—where UI elements are exposed as text metadata—high similarity between instructions and element embeddings is often incorrectly treated as definitive evidence of true semantic grounding.

通过分析三个移动端和Web端基准测试,本文证明了: * 嵌入相似度经常受到可见标签恢复的混淆。 * 词汇基准在Top-1准确率上依然保持竞争力。 * 标签稀缺的目标始终是纯文本方法的弱点。 * 编码器的Top-1命中率很大程度上可以根据词汇排名、候选池大小和标签类型进行预测。

By analyzing three mobile and web benchmarks, this paper demonstrates that: * Embedding similarity is frequently confounded by visible-label recovery. * Lexical baselines continue to remain competitive at top-1 accuracy. * Label-poor targets consistently remain weak spots for text-only methods. * Encoder top-1 hits are largely predictable based on lexical rank, candidate-pool size, and label type.

作者将每个用户操作评估为同屏排序任务,对比了五种现成的单向量编码器与简单的词汇基准。虽然编码器成功恢复了一些词汇匹配失败的情况,但可部署的融合增益明显小于目标感知的预言机(oracle)增益。这些发现强调了基于嵌入的评估可能会将简单的可见标签恢复与真正的语义GUI定位混为一谈。

The authors evaluate each user action as a same-screen ranking task, contrasting five off-the-shelf single-vector encoders against simple lexical baselines. While encoders successfully recover some lexical misses, deployable fusion gains are significantly smaller than target-aware oracle gains. These findings highlight that embedding-based evaluations can conflate simple visible-label recovery with genuine semantic GUI grounding.

未来评估建议

该研究建议,基于嵌入的GUI评估应始终报告以下内容: 1. 词汇基准 2. 标签类型分层 3. 可部署融合诊断

Recommendations for Future Evaluations

The study suggests that embedding-based GUI evaluations should consistently report: 1. Lexical baselines 2. Label-type stratification 3. Deployable-fusion diagnostics


元数据与参考信息

Metadata & Reference Information