隐私计算技术:为什么它是大数据时代的“隐形降落伞”?
前阵子跟一个做银行风控的老大哥吃饭,酒过三巡他拍桌子吐槽,现在做业务简直是戴着镣铐跳舞——想拉着外部数据优化模型,敢碰一下用户原始数据,搞不好就是百万罚单,甚至负责人要担责任。
没人敢拿前途换KPI,对吧?这两年隐私计算能火成这样,说白了就是刚需撞在了合规的枪口上,刚好解决了所有人都头疼的大问题。
别扯虚的,隐私计算到底解决了什么破问题?
早在十年前,国内大数据行业就是裸奔状态。跨机构合作直接交换原始数据,大家你用我的我用你的,闷声发大财,没人管隐私不隐私。自从《个人信息保护法》落地,数据合规的弦一下子绷紧了,这条路彻底走不通了。
举个最常见的例子:银行要做小微企业信贷风控,手上只有企业对公流水数据,缺企业的发票数据、水电缴纳数据、甚至电商平台的经营数据,这些数据分散在税务局、供电局、互联网平台手里,谁都不敢把原始数据给银行。难不成银行就不做业务了?
以前试过匿名化脱敏,对吧?说把用户姓名身份证去掉就安全了。说实话,早就有N多研究证明,只要拿到一点点外部信息,哪怕你去掉了所有标识,也能在几分钟内把个人精准识别出来。脱敏就是个自欺欺人的东西。
隐私计算的核心,就是一句话:数据可用不可见,价值不落地。所有计算过程都在加密状态下完成,各家的原始数据永远不出自己的机房,最后大家只拿到联合计算的结果——也就是模型或者统计值,谁都拿不到对方的原始数据。
隐私计算数据可用不可见原理示意图
之前看到一个真实案例,两家头部机构,一家握有海量出行数据,一家握有海量消费数据,想联合给用户做精准营销标签。换放在十年前,直接交换完数据就跑模型了,放在今天,两个人用隐私计算跑了三天,出来的模型精度和直接用原始数据跑的差不到1%,谁也没摸着对方的原始数据,合规落地,皆大欢喜。
这不比拿着数据铤而走险强一万倍?
主流隐私计算技术,真的像厂商吹的那么神吗?
现在市面上吹的隐私计算,其实不是单一技术,是一堆技术方案的统称,最常见的就是三个方向:联邦学习、安全多方计算、可信执行环境。我接触过不下十家隐私计算厂商,每家都说自己的技术是最好的,说白了,都是各有各的坑,没有完美的方案。
用的最多的是联邦学习,尤其是金融行业,几乎大项目都是它打头阵。优点太明显了,对原来的模型改造很小,精度损失非常低,部署成本也不高,分个横向纵向联邦,能适配大部分场景。但是呢,它也不是无懈可击,最近三四年学术界出了好多攻击方法,什么梯度反演攻击,就是能从迭代的梯度里偷出原始的训练数据,虽然现在已经有了很多加固方案,但加固之后,计算性能掉的可不是一点半点,鱼和熊掌没法兼得。
然后是安全多方计算,这个是真·理论无条件安全,不需要依赖任何第三方,也不需要硬件支持,理论上只要算法设计对了,谁都偷不到数据。但是缺点也非常突出,计算开销太大了,早些年只能跑点小样本的统计查询,跑个逻辑回归都要等大半天,最近两年算法优化加上硬件性能上去了,也能跑大模型了,但是单位算力成本还是比别的方案高一大截,不是所有机构都用得起。
最后是可信执行环境(TEE),这个是硬件派的代表,靠CPU把一块加密的计算区域隔出来,叫“飞地”,所有原始数据的计算都在飞地里完成,外面谁都看不到内容,算完就销毁,速度比前两个都快,性能损耗很小。但是问题在哪?它依赖硬件厂商啊,万一硬件本身有漏洞呢?前几年Intel SGX不就爆出过好几个漏洞,能被人偷出飞地里的数据?而且跨不同厂商的硬件适配太麻烦了,要是你用Intel我用华为,对接起来够技术团队喝一壶的。
主流隐私计算技术优缺点对比表
不过话说回来,现在成熟的厂商都不会死磕一种技术,都是混搭着来。联邦加TEE补安全,安全多方计算加联邦降成本,怎么适配场景怎么来,毕竟客户要的是解决问题,又不是选技术选美。
隐私计算接下来的爆点,我看好两个方向
隐私计算接下来的爆点,我看好两个方向
第一个方向,肯定是和大模型绑定。现在训大模型,拼的就是高质量数据,哪家公司能攒齐全领域的高质量数据?大部分公司都缺数据,爬数据吧,现在合规查的这么严,分分钟挨罚。那怎么办?隐私计算刚好能解决,多家机构把数据放在各自的机房,用隐私计算联合训大模型,原始数据谁都不碰,训出来的模型大家一起用,完美解决数据来源合规的问题。上个月看国内好几家头部大模型厂商都放出了落地成果,确实跑通了,就是现在成本还高,估计再过两三年,成本降下来,这个方向肯定会爆。
第二个方向,就是数据要素流通。现在全国各地都建了数据交易所,这么多年成交量一直上不去,核心痛点是什么?卖方怕卖了原始数据之后被买方拷贝滥用,以后再也卖不上价,还违规;买方怕你给的数据质量差,不看到数据我不敢掏钱。隐私计算刚好把这个死结解开了,买方不用拿原始数据,直接在隐私计算平台上调用你的数据做计算,用完就清零,数据一直留在卖方手里,既买到了数据的价值,又不会泄露原始数据,这不就是为数据流通量身定做的技术吗?现在不少地方数交所已经把隐私计算当成标配了,后续成交量起来是早晚的事。
经常听到有人吐槽,隐私计算就是资本炒出来的伪需求,全是概念没有落地。我一开始也半信半疑,直到去年看到某股份制银行的落地数据,他们用隐私计算联合互联网平台做消费信贷风控,模型AUC提了快8个点,坏账率降了14%,全程没碰过对方的原始数据,完全合规,你说这是伪需求吗?当然,行业里确实有泡沫,一堆小公司凑个开源项目改改UI就出来卖方案骗项目,但是不能因为有骗子就否定技术本身,它确实解决了以前解决不了的真问题。
很多人说,大数据时代,你要么交出隐私换便利,要么守住隐私回到过去。现在看来,本来就不是一道单选题。
隐私计算就是给那些想合规做生意的人,撑了一把隐形的伞。路对了,剩下的就是等技术慢慢成熟而已。