跳转至

拒绝双关:用于以人为中心的LLM评估的合理未知姓名(PUN)

文章背景与核心概要

在评估大语言模型(LLM)的事实性、隐私泄露、偏见及拒答能力时,研究人员经常使用人名作为提示词变量。然而,如果这些姓名缺乏受控的证据状态,评估结果往往会混淆模型对信息的记忆、检索能力、姓名先验知识以及对错误对象的归因,从而导致测量偏差。

为了解决这一问题,作者将“未知姓名”定义为:具有合理的“名-姓”结构,但在索引中缺乏全名证据,且在标准验证流程中不表现出歧义信号的姓名。为此,作者提出了 PUN (Plausible Unknown Names) 协议,通过结合维基数据(Wikidata)组件、基于网络的LLM筛选以及受控搜索重验证,系统性地构建并验证此类姓名。

该研究通过包含204名参与者的人类研究验证了其有效性。结果显示,PUN生成的姓名在“姓名感”上优于对照组,且人类参与者仅能在3%的情况下检索到真实的人员证据。作者同时开源了包含300个姓名及其对照组的数据集,为以人为中心的LLM评估提供了更严谨的基准工具。


📄 摘要

Person names are widely used as prompt variables in LLM evaluations of factuality, privacy leakage, bias and abstention, but when a name's evidential status is uncontrolled, measurements may conflate memorisation, retrieval, name priors and wrong-person attribution. We operationalise an unknown name as one with plausible First-Last form, no indexed full-name evidence, and no ambiguity signals under a documented validation run, and introduce PUN (Plausible Unknown Names), a protocol for constructing and validating such names, combining Wikidata-derived components, web-enabled LLM screening, and controlled search revalidation. We report acceptance rate, reproducibility, ablations, and a 204-participant human study, finding accepted names are more name-like than controls while participants recover person evidence in only 3% of cases. We release 300 names with comparison controls.

在LLM的事实性、隐私泄露、偏见和拒答评估中,人名被广泛用作提示变量。然而,当姓名的证据状态不受控时,测量结果可能会混淆记忆、检索、姓名先验和错误归因。我们将“未知姓名”定义为具有合理的“名-姓”形式、无索引全名证据且在记录在案的验证运行中无歧义信号的姓名,并引入了 PUN(合理未知姓名),这是一种用于构建和验证此类姓名的协议,结合了维基数据组件、基于网络的LLM筛选和受控搜索重验证。我们报告了接受率、可重复性、消融研究以及一项204名参与者的人类研究,发现被接受的姓名比对照组更具“姓名感”,而参与者仅在3%的情况下能恢复出人员证据。我们发布了300个带有比较对照的姓名。


🔗 快速链接与资源


🖼️ 文章许可与媒体

license icon 查看许可协议 (知识共享 署名-非商业性使用-禁止演绎 4.0 国际)