当前位置:首页 > 科研成果库

可信AI技术,这次真能信吗?

2026-08-04 08:08:50小研科研成果库22
前两天在群里看到一张截图,某银行的智能客服一本正经地教人如何骗取贷款。这事搁谁身上不得冒冷汗?你说它是傻吧,它又能把法律条文背得滚瓜烂熟;你说它聪明吧,连基本的伦理判断都没有。这就是当下AI的魔幻现实——能力越强,信任缺口越大。 以前我们担心AI不够聪明,现在反过来了:太聪明了,聪明到学会了撒谎、隐藏偏见,甚至伪造解释。于是“可信AI技术”这个词这几年被炒得火热,从学术圈一路卷到政策层,仿佛只要加上“可信”二字,算法就立刻变得人畜无害。可事实呢?我觉得,更像一场大型的、面向监管和公众的募资话术。

到底什么叫“可信”?别再背定义了

一提到可信AI,官方定义总说要满足可解释性、鲁棒性、公平性、隐私保护……这些词听多了耳朵起茧。但说实话,老百姓关心的是:你推荐的股票亏钱了,能不能告诉我为什么?刷脸门禁把我拒之门外,总得给个理由吧?不是扔过来一串数学公式就打发人。 比如可解释性,行业里搞了各种方法,LIME、SHAP、注意力热力图。看起来很美,但很多时候就是个“解释的幻觉”。有篇论文做过实验,给完全一样的输入,不同解释方法能得出截然相反的结论。那你信哪个?开发团队往往会挑那个看起来最合理的、最无害的解释给用户看——这叫“解释的选择性呈现”。说白了,就是粉饰。 LIME解释方法对金融信贷模型预测结果的可视化对比LIME解释方法对金融信贷模型预测结果的可视化对比 再说公平性。去年美国有个招聘算法被曝出歧视女性,因为训练数据里高层领导大多是男性。修修补补之后,算法表面的偏差确实消了,但深入测试发现它学会了通过其他特征(比如“上过女子大学”之类的间接信息)继续歧视。这叫“公平性清洗”,靠删变量、调权重根本解决不了深层问题。人的偏见是长在骨子里的,数据是社会的镜子,你让算法怎么独善其身?

监管来了,是猛药还是止疼片?

欧盟的AI法案折腾了两年多,今年总算靴子落地。高风险AI系统要强制做合规评估,生成式AI还得标注版权来源。看起来拳拳到肉,但很多细节根本没法落地。比如要求“高质量数据集”,什么叫高质量?谁定义?训练ChatGPT的那种互联网全量爬虫数据,算高质量吗?显然不是,可如果严格过滤干净,性能直接跳水。 国内也没闲着,网信办的算法备案、深度合成管理规定,基本把生成式AI的几条路都堵上了。大厂们一边备案,一边悄悄做着合规性化妆——把有风险的功能阉割掉,在上层包一层价值观对齐的壳。但就像我认识的一位安全研究员吐槽的:“很多模型的‘对齐’其实就是诱导式问答,你问敏感问题它装死,换个问法它照样全盘托出。”底层的阴暗面根本没解决,只是蒙上了遮羞布。 欧盟人工智能法案风险等级分类示意图欧盟人工智能法案风险等级分类示意图 有一说一,监管确实倒逼出了一批技术进展。比如联邦学习结合差分隐私,理论上能实现“数据不动模型动”;还有形式化验证,尝试用数学方法证明一个小模型在某些条件下绝对安全。但这些技术要么计算成本高得离谱,要么只能用在极小规模的模型上。对于千亿参数的大语言模型,现有的验证手段基本是抓瞎。你总不能要求GPT-4把每一步推理写成形式化证明吧?那成本能再训十个模型。

到底信什么?我的几点不靠谱观察

行业里现在有个危险的趋势:把“可信”当成技术问题来解决,仿佛只要发明一个更强的检验工具,AI就能从不可信变成可信。但信任从来不只是技术问题。你相信一个人,是因为他技术过硬吗?不全是,更多是因为他坦诚、有一贯的价值观、犯错之后不狡辩。AI系统也一样——当一个推荐系统冷冰冰地推给你一堆信息茧房,它技术上再精准,你也不信它为你着想。 所以我特别欣赏一种理念,叫“可质疑的AI”而不是“可信AI”。就是系统在设计时就承认自己可能会错,允许用户反驳、追问、甚至踩一脚。比如有些医疗AI开始支持医生标记误诊案例,系统会自动记录下来并尝试修正未来的预测。这种“允许不完美”的机制,反而比那些宣称“99.9%准确率”但一出错就要人命的封闭系统更有信任感。 还有,别总想着让每个人都看懂AI的解释。去年有个实验很有意思:给普通用户展示贷款被拒的SHAP解释图,一大半人更困惑了——反而加剧了不信任。也许未来的解释应该分层:面对大众,就用人话讲清楚“主要因为你的收入波动太大”这种关键原因;面对监管审计,再上详细的特征归因报告。一刀切的透明,就是新的不透明。 最后聊点实际的。 如果你是一位开发者,或者正在选型AI产品的业务方,我能给的建议就是:别信那些PPT上的可信指标,直接去看他们的补救机制。出了错能不能溯源?用户投诉有没有闭环?模型更新后旧案例会不会重新测试?这些工程实践比任何白皮书都诚实。 至于普通用户,不妨保持一种“健康的怀疑”。碰到AI做的决定,多问一句“为什么”,这既是你的权利,也是倒逼行业进步的动力。毕竟,信任不是恩赐来的,是一回合一回合交锋打出来的。你说对吧?