锁在牢笼里的运算:机密计算如何重构数据信任
很多人都碰到过这种两难:医院手里有十万份病历,想找AI公司训练一个肿瘤识别模型,直接把病历给对方,违反患者隐私保护规定;不给吧,模型根本训不出来。金融机构要和互联网平台合作做反欺诈,一方有交易数据,一方有社交行为数据,谁都不愿意把自己的明文数据交出去。
这种两难卡了行业快十年,直到那个概念走进大众视野。
被打破的边界,重建不了的信任
过去我们说数据安全,大多是静态保护:数据存在硬盘里,加密锁起来,传输的时候套一层SSL,要用的时候拿出来解密。这套逻辑在数据只待在自己地盘的时候没问题,一旦要流动,要跨主体合作,就全漏了——解密用的时候,数据就是明文,只要有权限接触系统的人,不管是管理员还是黑客,都能拿走。
很多人试过折中,说把数据脱敏再出域。可脱敏真的靠谱吗?去年就有案例,某机构发布的脱敏出行数据,结合公开的社交数据,居然百分之八十以上的用户都能被重新识别出来。所谓的脱敏,很多时候就是给隐私穿了件透明衣服,看上去遮了,其实啥都挡不住。
传统数据加密使用阶段明文暴露示意图
数据要素要市场化,核心就是让数据动起来,可用又不可见,这句话喊了好多年,原来的技术做不到真正的不可见。这就是痛点。
它到底是怎么把运算藏起来的
核心逻辑其实不复杂:让数据解密之后,永远不跑出加密的隔离区域,整个运算过程都在黑盒子里完成,外部任何人、任何程序都看不到黑盒子里的内容,只有最终的运算结果能出来。
现在主流的实现路径分三大类,每类都有明确的适用场景和限制。
第一类,也是目前落地最多的,就是基于硬件的可信执行环境(TEE),靠CPU本身的硬件隔离划出一块加密飞地,操作系统、Hypervisor甚至云服务商都没法访问这块区域里的数据。它的优势是性能损耗很低,一般业务场景下损耗只有10%-20%,大部分业务都能接受。但它也有明确的限制:早期的Intel SGX方案单个飞地最大容量只有128MB,连稍大一点的深度学习模型都塞不下,新出的TDX已经支持整个加密虚拟机,容量限制放宽了,但依然依赖硬件厂商的可信根,信任链绕不开硬件厂商。
第二类是全同态加密,不需要硬件支持,数据从加密到运算全程都是密文,运算完解密出结果,整个过程不会出现明文。完美逻辑对不对?但它的问题也致命,现在的全同态加密性能损耗是普通运算的几百上千倍,只能做简单的加法乘法运算,稍微复杂点的模型训练根本跑不起来,目前还停留在实验室和小场景试点阶段,没法大规模落地。
第三类是多方安全计算,本质是把运算拆分到多个参与方,每个参与方只能拿到自己的分片,拼不出来完整明文。它的优势是不依赖硬件,适合多个参与方的联合计算,但是性能损耗同样不低,交互 overhead 很高,适合低并发的场景。
机密计算可信执行环境隔离架构图
很多人会问,哪个才是未来?其实没有所谓的正确答案,不同场景选不同方案,金融联合风控用TEE+MPC,中小企业小模型用全同态试点,本来就不是非此即彼的事。
不是银弹,它的边界在哪
不是银弹,它的边界在哪
现在行业里很多厂商吹得太过,说它能解决所有数据安全问题,这纯粹是扯淡。它有非常明确的应用边界和风险。
先说风险,基于TEE的方案,安全根在硬件,如果硬件本身出了漏洞呢?前几年SGX连续爆出多起侧信道攻击漏洞,黑客可以通过内存访问的时序差异、缓存变化,猜出飞地里的敏感数据,哪怕飞地隔离做得再好,硬件漏洞直接把底裤都扒了。也就是说,它的安全是相对的,不是绝对的,只是把攻击门槛提得非常高,不是无懈可击。
再说应用边界,哪些场景真的需要它?跨主体数据合作、敏感数据的云端运算、模型权重保护、用户隐私查询,这些场景它的价值非常明确。比如现在大模型推理,很多用户输入的提问是敏感信息,把整个推理过程放在加密飞地里,服务商也拿不到用户的明文提问,既用了大模型的能力,又保护了隐私,刚好匹配需求。
那哪些场景没必要?本身就是公开数据的业务,你加一层机密计算,完全是浪费成本,平白无故降低性能,纯属折腾。还有人说它能替代合规,这更是错得离谱,合规要求你数据收集合法、使用合法,技术只能保护使用过程中的隐私,解决不了本身来源不合法的问题,工具永远替代不了制度。
说实话,我接触过不少创业项目,拿着普通的磁盘加密就包装成相关方案,割投资人的钱,骗不懂技术的甲方,这个行业现在还在早期,鱼龙混杂,真真假假分不清。
不过话说回来,它解决了一个原来根本解决不了的问题:数据能用不可见。原来大家为了合作,只能赌对方不会偷数据,靠合同约束,出了问题再追责,现在有了技术手段,从根源上把风险堵死了。
大方向没错,只是路还长。