数据投毒(Data Poisoning)是一种针对AI模型的攻击方式:攻击者通过在训练数据中注入精心构造的恶意样本,让模型在训练后产生攻击者期望的行为——如错误分类、输出有害内容或植入“后门”。
为什么防不胜防
- 大模型训练依赖从互联网抓取的海量数据,来源复杂、难以完全审查
- 数据规模巨大,人工逐一审核不现实
- 攻击者可以伪装成正常内容,躲过自动化过滤
常见类型
- 后门攻击:植入特定“触发器”(如某个符号、特定措辞),平时不影响模型,触发时输出攻击者预设的结果
- 偏斜攻击:大量注入某类错误样本,让模型产生系统性偏差
- 可用性攻击:污染数据以降低模型整体性能
现实威胁
- 大模型厂商清洗训练数据时已面临此类风险
- 开源社区和众包数据可能成为投毒入口
- 研究显示,少量恶意数据就可能影响模型行为
防御手段
- 数据来源审核与去重清洗
- 异常样本检测与剔除
- 训练后的模型行为审计
- 数据贡献者信誉与溯源机制