☠️

数据投毒(Data Poisoning)

Data Poisoning
安全治理
安全攻击

数据投毒(Data Poisoning)是一种针对AI模型的攻击方式:攻击者通过在训练数据中注入精心构造的恶意样本,让模型在训练后产生攻击者期望的行为——如错误分类、输出有害内容或植入“后门”。

为什么防不胜防

  • 大模型训练依赖从互联网抓取的海量数据,来源复杂、难以完全审查
  • 数据规模巨大,人工逐一审核不现实
  • 攻击者可以伪装成正常内容,躲过自动化过滤

常见类型

  • 后门攻击:植入特定“触发器”(如某个符号、特定措辞),平时不影响模型,触发时输出攻击者预设的结果
  • 偏斜攻击:大量注入某类错误样本,让模型产生系统性偏差
  • 可用性攻击:污染数据以降低模型整体性能

现实威胁

  • 大模型厂商清洗训练数据时已面临此类风险
  • 开源社区和众包数据可能成为投毒入口
  • 研究显示,少量恶意数据就可能影响模型行为

防御手段

  • 数据来源审核与去重清洗
  • 异常样本检测与剔除
  • 训练后的模型行为审计
  • 数据贡献者信誉与溯源机制
数据投毒与数据安全、供应链安全密切相关,是AI安全体系中必须正视的一环。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0