黑盒破局:模型可解释性到底解决了什么真问题
打开任何一本AI安全相关的会议集,十篇里至少有三篇沾那个绕不开的话题。大厂招算法岗,笔试题里冷不丁就会冒出来一问。普通用户刷到科普号,也会被灌输“黑盒模型不安全,一定要可解释”的概念。
上个月帮一家城商行改信贷模型的需求,对方负责人拍着桌子说,我就要全可解释的,出了问题我担不起责。聊了半小时才发现,他要的其实只是“拒贷原因能给用户说清楚,监管检查能拿出不存在歧视的证明”,并不是要把整棵决策树的每个分支都打印出来给所有人看。
不是所有“看不懂”都需要解释
很多新入行的研究员会有一个误区:觉得所有AI模型都必须做到完全透明,不然就是原罪。其实完全不是这么回事。
你用推荐模型刷短视频,猜错了你喜好又怎么样?大不了划走下一条。电商猜你想买什么错了,也不会有人因为这个告到法院去。这类场景下,性能优先,能提升点击率转化率就行,没人纠结你模型到底是怎么想的。
但换个场景就完全不一样了。临床AI判断你肺片里的结节是不是恶性,要开刀还是观察。自动驾驶决策踩不踩刹车。信贷审批给不给你额度。这些场景错一次,代价就是真金白银甚至生命,必须说清楚为什么。
甚至同一模型,不同环节对解释的要求都不一样。CT影像模型,训练的时候性能优先,哪怕用黑盒大模型把准确率提上去,没人说不对。但出结果给临床医生的时候,必须标出来是哪块像素判断出了恶性,不然医生不敢信。
人工智能风险场景可解释性需求分级图
两种路径的天生局限
现在主流的解决思路,掰开来就是两类,各有各的问题,谁也没法包打天下。
第一类是天生透明的事前可解释模型,线性回归、逻辑回归、传统决策树都是这类。每个参数的含义清清楚楚,每一步决策怎么来的写得明明白白。但问题是,能力有限。稍微复杂点的任务,比如图像识别、大语言语义理解,这类模型的性能掉的一塌糊涂,根本没法用。你拿线性回归去做大语言模型的语义理解任务?想都不要想。
第二类就是现在更火的事后解释方法,SHAP、LIME、对抗解释这些都是,针对已经训练好的黑盒大模型,单独训练一个解释模块,告诉你这个样本为什么会得到这个输出。很多人觉得这条路走得通,毕竟现在大模型性能好,我们只需要给它加个解释器就行。
但这里有个很多人不愿意提的坑:事后解释几乎都是局部的,只能解释单个样本,没法解释整个模型的行为。更要命的是,事后解释可以完全和模型真实逻辑不一致。我见过一个实验,把训练好的模型参数随机打乱,输出完全随机,SHAP还是能给每个输出做出“看起来非常合理”的解释。说白了,这个解释只是给你一个心理安慰,根本不是模型真实的思考逻辑。
黑盒模型SHAP局部解释结果偏差示例图
还有更现实的问题,你给一个没学过AI的普通用户扔一个SHAP热力图,他看得懂吗?他只需要知道“我为啥被拒贷”,你给他列一堆特征贡献值,他反而更懵。
被大多数人忽略的需求本质
被大多数人忽略的需求本质
说实话,现在这个领域大部分研究,都跑偏了。大家都在比谁的方法在公开数据集上的解释准确率更高,刷榜刷得不亦乐乎,但很少有人问一句:我们到底要解释给谁听?
给终端用户的解释,核心是“易懂”,要符合普通人的认知,不需要精确到每个参数。拒贷了,直接说“你近一年有三次逾期记录”就够了,不需要说“逾期这个特征的SHAP值是-0.82”。
给监管和审计的解释,核心是“合规和公平”,要证明模型没有歧视,不存在非法的特征关联,不需要给每个个案写解释。比如要证明模型没有性别歧视,只要证明性别这个特征,无论直接还是间接,都不对输出产生系统性偏差就够了。
给算法工程师的解释,核心是“排错和迭代”,要找到模型为什么会出系统性错误,是不是数据里有偏差,哪类样本泛化不好,这又是另一套需求。
说白了,很多人把可解释性本身当成了目的,而不是解决问题的工具。为了可解释牺牲十个点的准确率,为了可解释搞出一堆谁都看不懂的专业解释,这完全是买椟还珠。
接下来该往哪走
接下来该往哪走
不过话说回来,需求确实在那里,不能因为现有方法有问题就不做了。现在已经越来越多的人意识到,没必要非要把黑盒掰成白盒,场景化分层解释才是可行的方向。
什么叫分层解释?就是对着不同的角色给不同层级的解释。用户要个案的通俗解释,监管要公平性的合规报告,工程师要模型层面的偏差分析,各取所需,不需要所有人都拿到同一个完全透明的模型结构。
当然也要警惕风险。现在很多厂商拿事后解释当“遮羞布”,明明模型本身带偏差,拿一个看起来漂亮的解释就说自己合规了,最后出了问题甩锅给解释,说我们已经做到可解释了,这种情况已经出现不少了。
还有一点,可解释性不等于可信。一个完全可解释的模型,也可能因为训练数据的偏差得出错的结论。一个黑盒模型,也可以通过大量的测试验证它的稳定性和公平性。不要把所有的AI安全希望都寄托在可解释上。
别被概念带着跑。有人问你要不要做可解释,先别急着答应,也别急着拒绝,先问三个问题:给谁解释?解释了用来解决什么问题?达不到要求的代价是什么?想清楚这三个,比学一百种新方法都有用。