⚖️

AI偏见 (AI Bias)

AI Bias
前沿概念
AI伦理安全

AI偏见是指AI模型在训练和推理中体现出的不公平或歧视性倾向。

来源:训练数据中某些群体代表性不足;互联网文本含大量偏见言论;标注数据中人类主观偏见;模型优化目标可能忽视公平性。

典型例子:护士默认输出女性、医生默认输出男性;少数族裔面部识别准确率更低。

检测:WinoBias(性别偏见)、BBQ(问答偏见)、StereoSet(刻板印象)。

缓解:训练数据去偏和平衡、RLHF中训练标注员关注公平性、输出后处理过滤、模型透明度(公布评测结果)。

2026年,完全消除偏见不可能(人类社会本身就是有偏见的),但控制在社会可接受的水平是现代AI产品的基线要求。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。