联邦学习(Federated Learning)由 Google 于 2016 年首次提出,是一种在保护数据隐私前提下训练 AI 模型的分布式方法。
工作原理
1. 中心服务器发布初始模型给所有参与设备 2. 每个设备用本地数据训练模型,产生梯度更新 3. 只将梯度更新(而非原始数据)上传到服务器 4. 服务器聚合所有梯度,更新全局模型 5. 循环迭代
核心优势
- 数据不出设备:训练数据始终留在用户设备上,满足隐私法规
- 降低通信成本:只传梯度(几 MB)而非原始数据(几 GB)
- 利用分散数据:每个用户的少量数据难以单独训练,但聚合后效果强大
实际应用
- Google Gboard:用联邦学习优化手机键盘输入法的下一词预测,数亿设备参与
- 医疗影像:多家医院共享模型而不共享病人数据
- 金融反欺诈:银行间联合训练欺诈检测模型
挑战
非 IID 数据分布(各设备数据不同质)、通信效率、恶意设备攻击。联邦学习与差分隐私、安全多方计算等技术共同构成隐私计算的技术栈。