聊聊隐私计算技术:数据可用不可见的生意,已经做到哪了?
我上个月跟一个做互联网广告的老朋友吃饭,他吐槽说现在拿用户数据做投放太怕了,前两年被罚的那家头部平台,几个亿的罚款掏出去,整个部门都裁了!他说现在想做精准投放,又不敢碰原始用户数据,头发都快掉光了。
其实不止他,金融、医疗、零售,凡是要碰用户数据的行业,现在都在挠这个头。想挖数据的价值,又怕踩隐私合规的红线。这两年火起来的隐私计算,刚好卡在这个需求点上。它早就不是实验室里堆着的论文概念了,已经真金白银落地赚钱了。
隐私计算数据不出域业务流程示意图
现在主流的三个技术路线,各有各的适用场景。安全多方计算纯靠密码学,不用依赖特定硬件,安全性最高,但计算速度最慢,成本也高;联邦学习是现在落地最多的,适合跨机构联合建模,广告和金融行业用得最多,唯一的小缺点是模型精度会比原始数据训练稍差一点;可信执行环境靠硬件加密隔离,速度快,就是成本高,小公司玩不起,一般只有银行、互联网大厂才用得起。
没有哪个技术路线能通吃所有场景,现在行业里也都是混着用,按需选方案,对吧?
互联网广告隐私计算联合投放架构图
金融行业更夸张,银行之间联合反欺诈,跨机构做征信建模,现在都开始用隐私计算了。你在A银行有逾期记录,B银行给你放贷款前要核查,不用求A银行把你的原始记录给出来,用隐私计算一跑,几秒就能拿到结果,你的信息根本不会流出去,既解决了信息孤岛的问题,又完全合规。
不过话说回来,现在行业里的坑也不少。很多传统做集成的公司,换个皮就说自己做隐私计算,把原来几百万的项目包装一下卖上千万,割客户的韭菜,外行根本分辨不出来。劣币驱逐良币的事,现在还是时有发生。
隐私计算技术离大规模普及,还有几道坎?
哪怕现在落地案例已经很多,我跟几个做技术的朋友聊,他们都说,隐私计算还远没到成熟的时候,还有好几个坎要跨。
第一道坎是性能和成本。数据全加密计算,肯定比直接用裸数据慢,处理亿级别的大规模数据的时候,很多现有方案的延迟还是高,满足不了实时性要求高的场景。成本也降不下来,算力成本比传统计算高好几倍,很多中小公司还是用不起。现在很多科研团队都在做算法优化,已经降了不少了,但是还要再磨个两三年才能到亲民的价位。
第二道坎是互联互通。现在各家厂商的技术方案都是自己做的,标准不统一,你用A家的平台,我用B家的,跨机构合作的时候还要重新做适配,折腾半天,成本又上去了。这两年行业协会也在推统一标准,估计再过两年能解决这个问题。
第三道坎,也是最核心的,就是绝对的安全还做不到。去年就有北大的科研团队爆出,联邦学习框架存在梯度泄露漏洞,攻击者可以通过梯度信息反推用户的原始数据,哪怕数据不出域也能偷到信息。当然现在已经有对应的防护方案了,但也说明,隐私计算的安全还在迭代,没有到万无一失的地步。
我倒是觉得,这些问题都很正常。哪有新技术刚出来就完美无缺的?十几年前云计算刚出来的时候,一堆人喊着上云不安全,结果现在几乎所有企业都把业务放云上了。
现在全国建了几十家数据交易所,很多交易所成交量一直上不去,核心问题就是数据所有者不敢卖,怕卖数据违规,怕用户信息泄露。隐私计算刚好解决了这个核心痛点,数据的使用权和所有权分开,所有权还是你的,我只用使用权,还碰不到你的原始数据,这下大家都敢交易了。
别觉得隐私计算离你很远,你申请信用卡、骑共享单车、刷短视频,背后可能已经跑过好几轮隐私计算了。它默默帮企业合规,也默默保护你的隐私,你根本感觉不到。
这才是技术该有的样子,对吧?
别被名词唬住,隐私计算技术的核心就一句话
什么联邦学习、安全多方计算、可信执行环境...一堆专业名词扔过来,很多外行直接懵了。说实话,拆穿了就很简单,核心就是 数据能用,但你拿不到原始信息。 举个最常见的例子:城商银行想做消费信贷,缺用户的线上消费数据;本地电商平台有海量消费数据,但是不敢把用户信息随便给银行,违法不说,还砸自己招牌。放十年前,两边要么暗戳戳做数据交换,出事一起蹲局子;要么各玩各的,银行瞎放贷款,坏账一堆。 现在用隐私计算怎么玩?两边的数据都不出自己的服务器域,只把加密后的计算过程和中间结果传出来,最后联合训练出信贷风控模型。银行能拿到更准的风控结果,电商能靠数据赚授权费,用户的原始隐私信息自始至终都没离开过原来的平台,三方都赢。
隐私计算数据不出域业务流程示意图
现在主流的三个技术路线,各有各的适用场景。安全多方计算纯靠密码学,不用依赖特定硬件,安全性最高,但计算速度最慢,成本也高;联邦学习是现在落地最多的,适合跨机构联合建模,广告和金融行业用得最多,唯一的小缺点是模型精度会比原始数据训练稍差一点;可信执行环境靠硬件加密隔离,速度快,就是成本高,小公司玩不起,一般只有银行、互联网大厂才用得起。
没有哪个技术路线能通吃所有场景,现在行业里也都是混着用,按需选方案,对吧?
吹了好几年,隐私计算技术真的能赚钱了吗?
前几年资本热的时候,一堆创业公司冲出来喊“万亿数据市场”,融完资才发现,全行业都在观望,没人敢第一个掏钱落地。很多公司靠着政府项目熬着,熬不住的已经倒闭了一批。 这两年不一样了。《个人信息保护法》《数据安全法》落地之后,监管红线越划越清,哪个企业敢乱碰用户原始数据,真的是吃不了兜着走。需求倒逼之下,单子慢慢就多了。去年信通院出的行业报告,国内隐私计算市场规模已经突破120亿,同比增长超过100%,增速快得吓人。 现在落地最多的两个行业,一个是互联网广告,一个是金融。 你现在刷朋友圈、刷短视频看到的精准广告,很大概率背后就有隐私计算在跑。以前中小广告平台想跟头部平台做联合投放,必须交换用户数据,现在不用了,两边用隐私计算对齐用户,只算重合度,不交换原始信息,精准投放能做,合规也没问题。头部平台早就把隐私计算平台开放给客户了,巨量、微信广告都在推,现在已经成了行业标配。
互联网广告隐私计算联合投放架构图
金融行业更夸张,银行之间联合反欺诈,跨机构做征信建模,现在都开始用隐私计算了。你在A银行有逾期记录,B银行给你放贷款前要核查,不用求A银行把你的原始记录给出来,用隐私计算一跑,几秒就能拿到结果,你的信息根本不会流出去,既解决了信息孤岛的问题,又完全合规。
不过话说回来,现在行业里的坑也不少。很多传统做集成的公司,换个皮就说自己做隐私计算,把原来几百万的项目包装一下卖上千万,割客户的韭菜,外行根本分辨不出来。劣币驱逐良币的事,现在还是时有发生。
隐私计算技术离大规模普及,还有几道坎?
隐私计算技术离大规模普及,还有几道坎?
哪怕现在落地案例已经很多,我跟几个做技术的朋友聊,他们都说,隐私计算还远没到成熟的时候,还有好几个坎要跨。
第一道坎是性能和成本。数据全加密计算,肯定比直接用裸数据慢,处理亿级别的大规模数据的时候,很多现有方案的延迟还是高,满足不了实时性要求高的场景。成本也降不下来,算力成本比传统计算高好几倍,很多中小公司还是用不起。现在很多科研团队都在做算法优化,已经降了不少了,但是还要再磨个两三年才能到亲民的价位。
第二道坎是互联互通。现在各家厂商的技术方案都是自己做的,标准不统一,你用A家的平台,我用B家的,跨机构合作的时候还要重新做适配,折腾半天,成本又上去了。这两年行业协会也在推统一标准,估计再过两年能解决这个问题。
第三道坎,也是最核心的,就是绝对的安全还做不到。去年就有北大的科研团队爆出,联邦学习框架存在梯度泄露漏洞,攻击者可以通过梯度信息反推用户的原始数据,哪怕数据不出域也能偷到信息。当然现在已经有对应的防护方案了,但也说明,隐私计算的安全还在迭代,没有到万无一失的地步。
我倒是觉得,这些问题都很正常。哪有新技术刚出来就完美无缺的?十几年前云计算刚出来的时候,一堆人喊着上云不安全,结果现在几乎所有企业都把业务放云上了。
现在全国建了几十家数据交易所,很多交易所成交量一直上不去,核心问题就是数据所有者不敢卖,怕卖数据违规,怕用户信息泄露。隐私计算刚好解决了这个核心痛点,数据的使用权和所有权分开,所有权还是你的,我只用使用权,还碰不到你的原始数据,这下大家都敢交易了。
别觉得隐私计算离你很远,你申请信用卡、骑共享单车、刷短视频,背后可能已经跑过好几轮隐私计算了。它默默帮企业合规,也默默保护你的隐私,你根本感觉不到。
这才是技术该有的样子,对吧?