首页 > AI前沿 > 语言模型认为谁更有能力?职业偏见的机制性分析

语言模型认为谁更有能力?职业偏见的机制性分析

arXiv自然语言 2026-06-15 23:03 16 阅读 查看原文
语言模型(LMs)在行为层面的偏见评估中常常表现良好,但一个关键问题依然悬而未决:这些模型是否真的不再表征那些可能引发偏见的潜在关联,还是仅仅学会了在输出时抑制这些偏见的表达?这一区别对于理解模型内部状态和确保其公平性至关重要。 为了深入探究这个问题,我们引入了一个因果分析框架,将职业偏见系统地分解为两个不同的测量点。第一个测量点是模型内部对用户能力的表征,即模型在深层网络中如何编码关于用户专业水平的信息。第二个测量点是模型可观察的输出,即模型最终生成的文本或决策。 我们的方法核心在于为“用户专业水平”这一内部表征推导出引导向量(steering vectors)。这些向量能够捕捉模型中与能力判断相关的特定方向。通过在问答任务和招聘任务中进行干预实验,我们验证了这些引导向量确实在因果层面上中介了模型的行为,这意味着改变这些内部表征会直接导致模型输出的改变。 我们将此框架应用于多个开放权重模型,以检验其普遍性。实验结果揭示了一个重要的现象:人口统计学属性,例如用户的性别、种族和社会经济地位,会显著影响模型对用户专业水平的内部表征。这种影响甚至在那些行为层面指标完全检测不到任何群体间差异的案例中也依然存在。 这一发现表明,模型可能在内部仍然编码了基于人口统计学特征的偏见性关联,尽管它们在生成文本时学会了不在表面上展现这些偏见。这种“隐性”的表征偏见比显性的行为偏见更为隐蔽,也更难被传统的评估方法所捕捉。 进一步的分析显示,这些带有偏见的内部表征在特定干预条件下能够影响模型的下游行为。例如,当我们通过引导向量人为地增强或削弱模型对某个用户专业水平的内部表征时,模型在后续任务中的决策会随之发生显著变化。这揭示了潜在的系统性失败模式。 这种失败模式的存在意味着,仅仅依赖行为指标来评估模型公平性是远远不够的。一个模型可能在所有标准测试中都表现出色,但其内部状态仍然可能包含有害的偏见,并在特定情境下被激活,导致不公平的决策。 我们的研究强调了进行机制性分析(mechanistic analysis)的必要性,即不仅要看模型“做了什么”,更要理解模型“为什么这么做”。通过深入模型内部,我们能够发现那些被表面行为掩盖的深层问题,为构建更公平、更可靠的AI系统提供重要的诊断工具。 总而言之,这项工作表明,语言模型中的职业偏见问题远比表面看起来更为复杂和根深蒂固。我们的因果框架为检测和理解这些隐性偏见提供了新的途径,并为未来开发更全面的模型评估和干预方法奠定了基础。