AI偏见是指AI模型在训练和推理中体现出的不公平或歧视性倾向。
来源:训练数据中某些群体代表性不足;互联网文本含大量偏见言论;标注数据中人类主观偏见;模型优化目标可能忽视公平性。
典型例子:护士默认输出女性、医生默认输出男性;少数族裔面部识别准确率更低。
检测:WinoBias(性别偏见)、BBQ(问答偏见)、StereoSet(刻板印象)。
缓解:训练数据去偏和平衡、RLHF中训练标注员关注公平性、输出后处理过滤、模型透明度(公布评测结果)。
2026年,完全消除偏见不可能(人类社会本身就是有偏见的),但控制在社会可接受的水平是现代AI产品的基线要求。