联邦学习是什么?
常规训练要把所有数据集中到一个地方,这在小数据、隐私数据上都很难:医院不能随便交出病历,手机厂商也不愿把用户数据上传。联邦学习反其道而行——数据留在本地,只把「模型学到的更新」传回中心服务器汇总,大家一起训一个模型,却谁也不用交出原始数据。它是怎么工作的?
模型下发服务器先把一个初始模型发给各个参与方。
本地训练
各方用自己手里的数据,在本地把这个模型再训练一小步。
只传更新
各方只把「模型权重变化」传回服务器,原始数据一个字都不上传。
聚合更新
服务器把各方传来的更新做聚合(如加权平均),得到一个更好的全局模型,再下发给各方。如此循环。
它解决了什么问题?
隐私保护原始数据不出设备,敏感信息大幅降低泄露风险。
数据孤岛
让分散在医院、银行、手机里的数据,能「间接」合力训练,而不必先汇聚。
合规
在 GDPR 等数据法规越来越严的今天,联邦学习提供了一条合规路径。
它的挑战是什么?
设备算力、网络都不稳定,各方数据分布也未必一致(非独立同分布),训练收敛更慢、更困难。通信开销和「恶意参与者」投毒攻击,也需要专门的技术来应对。一句话记住:联邦学习让「数据不出门,模型到处学」,既合作训练,又守住了各自的隐私。
评论