表面公平?大语言模型推荐系统中隐藏输出公平性差距的基准测试
文章背景与核心概要
当前针对大语言模型(LLM)推荐系统的公平性审计主要依赖于可观测的输出结果,这种方法隐含了一个假设:稳定的推荐结果反映了模型内部稳定的计算过程。然而,这种“黑盒”审计方式往往忽略了模型内部表征可能存在的偏差。
本文提出了 FairGap,这是首个旨在联合评估推荐系统在“可观测输出偏移(OBS)”和“隐藏表征偏移(IBS)”两个层面公平性的基准测试。通过跨性别、年龄和种族的受控反事实身份探测,研究人员引入了“表征-输出对齐(ROA)”指标,揭示了模型内部表征与最终输出之间普遍存在的脱钩现象。
研究发现,ROA 指标极低,且通过激活引导(Activation Steering)改善内部公平性往往会恶化输出层面的公平性。这一发现揭示了内部公平性与输出公平性之间存在本质的张力,证明了仅依赖输出审计的局限性,为未来构建更透明、更公平的推荐系统提供了关键的诊断框架。
📌 执行摘要
Current fairness audits for LLM (Large Language Model) recommenders rely heavily on observable outputs, assuming that consistent final recommendations reflect stable underlying computations. This paper introduces FairGap, the first benchmark designed to jointly evaluate recommendation fairness across two distinct levels: 1. Observable Output Shift (OBS) 2. Hidden Representation Shift (IBS)
Using controlled counterfactual identity probes across gender, age, and race, the authors measure Representation-Output Alignment (ROA) to identify hidden-output mismatches. Testing across six open-weight LLM families and three domains reveals a pervasive decoupling—ROA rarely exceeds 0.22. Furthermore, attempts to improve internal fairness via activation steering often degrade output-level fairness, highlighting an intrinsic tension that output-only audits fail to capture.
📋 论文元数据
| 字段 | 详情 |
|---|---|
| 主要学科 | 人工智能 (cs.AI) |
| 引用格式 | arXiv:2608.08284 [cs.AI] |
| DOI | 10.48550/arXiv.2608.08284 |
| 全文访问 | • PDF 预览 • HTML 版本 • TeX 源码 |
🔍 摘要
基于大语言模型的推荐系统,其公平性审计在很大程度上集中于可观测的输出,隐含地假设稳定的推荐反映了稳定的内部处理过程。我们通过 FairGap 对这一假设提出了挑战,这是首个在两个层面联合评估推荐公平性的基准测试:可观测输出偏移(OBS)和隐藏表征偏移(IBS),并通过跨性别、年龄和种族的受控反事实身份探测进行测量。
它们之间的关系通过 表征-输出对齐(ROA) 进行总结,并利用象限诊断来识别用户层面的隐藏-输出不匹配。FairGap 应用于三个领域中的六个开源 LLM 系列,揭示了普遍存在的隐藏-输出脱钩现象:ROA 很少超过 0.22,且相当一部分用户尽管内部存在显著偏移,但输出却保持稳定——这种模式是仅关注输出的审计设计所无法检测到的。
此外,将 IBS 降低多达 8 倍的激活引导(Activation Steering)同时恶化了 OBS,这证明了内部公平性和输出级公平性之间存在根本性的张力,而现有的框架尚无法诊断这种张力。
🛠️ 相关工具与资源
- 文献工具: Bibliographic Explorer, Connected Papers, Litmaps, scite Smart Citations
- 代码与数据: alphaXiv, CatalyzeX Code Finder, DagsHub, Gotit.pub, Hugging Face, ScienceCast
- 交互式演示: Replicate, Hugging Face Spaces, TXYZ.AI
- 研究参考: NASA ADS, Google Scholar, Semantic Scholar