深度学习技术这十年:从学术炫技到行业地基
先说说我的一点烦躁
最近总有人问我:深度学习是不是快到头了?说实话听到这种问题就头疼。大模型不是刚把整个世界搅得天翻地覆吗?怎么就说“到头”了?
去年《Nature》上有篇论文把Transformer的注意力机制拆了个底朝天。那个团队用傅里叶分析去解析隐空间,发现某些频率分量直接对应着语义特征。你敢信?不过这事后来被人质疑实验设置有问题。但至少说明一个事:我们连自己造出来的东西都还没完全搞明白。
所以,别急着宣判死刑。
科研成果到底在忙什么
科研成果到底在忙什么
接着上面的说。现在学术界盯着的方向,其实已经和五年前完全不同了。效率和可解释性成了硬骨头。你看DeepMind去年发的《ICML》那篇文章,把稀疏混合专家模型做了个“权重共享”的变体,参数量砍了40%,但精度只掉了0.7%。这玩意儿在工业界就是钱——谁不想用更小的卡跑更大的模型?
还有个比较冷门的方向:时序卷积。大家都去搞Transformer了,反而没人管老本的CNN。但MIT一个组用纯卷积结构做长序列预测,效果竟然吊打了很多SOTA的注意力模型。哈哈哈哈,这算不算一种打脸?
注意上面这个图——卷积滤波器在图像边缘检测上其实有一种生物视觉皮层的相似性。有些团队正试着从神经科学里挖点灵感。可能下一个突破点就藏在这种“看起来过时”的东西里。
[IMG_MACHINE_LEARNING_MODEL_CONVOLUTION_FILTER_VISUALIZATION]但别以为卷积只有这点用。最近一篇预印本把卷积和Transformer做了个混合,在医学影像分割上拿到了新的SOTA。有人嘲讽说这是“缝合怪”,但你说缝得好是不是本事?
行业里的深度学习早就变味了
行业里的深度学习早就变味了
别光聊论文。你去看看现在的工业界,什么“深度学习”都成了标配,但用起来全是套路。比如自动驾驶领域,特斯拉的感知网络把占用网络(Occupancy Network)发扬光大以后,所有公司都在往这个方向上卷。有个朋友在某个新势力车企做感知工程,他吐槽说:“每天做的就是清洗数据,模型结构?那是算法组的装饰品。”是不是挺真实的?
但话说回来,这种卷也有价值。因为数据清洗和仿真闭环确实把深度学习技术的鲁棒性拉高了一个档次。最近Waymo公布的一项研究说,他们在模拟环境里给相机加了各种噪声——雨雾、逆光、甚至传感器坏点——然后发现模型性能下降的幅度比预期小很多。这说明什么?说明数据策略比模型结构更值钱,至少在工程层面是这样。
对了,别忘了芯片。英伟达刚发布的算力怪兽已经不是单纯堆CUDA核心了。张量内存这个新东西,把数据搬运的瓶颈给削掉不少。这直接影响深度学习技术能跑多快。你说这是硬件问题,但反过来,算法也得跟着改——比如混合精度训练从FP16变成了FP8,这背后的数值稳定性研究,想研究清楚就得再写十篇博士论文。
[IMG_GPU_TENSOR_MEMORY_HBM_CHIP_ARCHITECTURE_DIAGRAM]还有一个更隐形的变化:边缘设备上的深度学习。手机里的相册分类、语音助理,甚至你家的门铃摄像头,都在跑这些小模型。行业里管这叫“端侧智能”。说实话,这东西的工程难度比云端大模型还高,因为你只有一个指甲盖大小的芯片,还得把延迟压到几十毫秒。我见过一个团队为了把模型从100MB压缩到10MB,硬是花了三个月——然后发现精度掉了2%。最后他们换了个蒸馏方案,才勉强保住。这种苦逼事,论文里可不会写。
医疗领域的一个小奇迹
讲个我最近看得起鸡皮疙瘩的案例。德国有个团队用深度学习做视网膜OCT影像诊断,训练数据只有5000张图,但配合一个自监督的预训练策略,准确率居然达到了三甲医院主任医师的水平。主任医师啊兄弟!你要知道,数据量小一直是医疗AI的死穴,而自监督学习把这个问题撬开了一个口子。
后来他们又把模型迁移到别的影像设备上,不用重新标数据,直接微调几个epoch就落地了。这事的科研价值不亚于那些顶会论文——虽然它发在《Lancet Digital Health》上,但没多少人关注。有点可惜,对吧?
这才是深度学习技术最迷人的地方:它可以在数据贫瘠的领域里通过精巧的设计榨出水分。不是所有人都需要大数据上的大模型,那些小场景、小数据、小算力,才是普通人能参与的游戏。
大模型背后的残酷现实
大模型背后的残酷现实
既然说到了大模型,就得聊聊那些没写在新闻稿里的数字。训练一个千亿参数级别的Transformer,电费账单六位数美元起步,碳排放相当于几十辆汽车跑一年。更别提那些被卡在GPU集群里的试错成本——你调了半天学习率,结果损失函数还是纹丝不动。这时你会觉得,什么“智能”,本质上是电力和硅片的堆砌。
但残酷归残酷,这种堆砌也带来了意想不到的副产品。比如说,研究者为了省算力,发明了低秩适应(LoRA)——这玩意现在成了微调大模型的标准玩法。你看,预算上的窘迫反而逼出了优雅的解。人性就是这么奇怪。
别把深度学习当信仰
写到现在,发现我好像一直在夸。但这玩意儿也有很蠢的地方。比如你问它“1+1等于几”,它有时候答不上来,但能给你写一首关于数字的十四行诗。这种“不靠谱”就源于深度学习技术本身固有的不确定性——你没法保证它每次都正确,甚至没法保证在相同输入下给出相同输出。搞科研的管这个叫“随机性”,可部署到现实里就是事故。
你看,全球那么多团队在搞可验证神经网络,就是为了给这种随机性加个笼子。但进展吧,也就是能让一个三层小网络的鲁棒性被形式化验证,面对ResNet这种巨人就只能跪下。你说这不是打脸吗?
行吧,吐槽归吐槽。反正深度学习技术这十来年,已经从一个实验室玩具长成了整个数字社会的骨架。以后它会变成什么样?我猜不到。但至少有一点——只要还有人愿意去拆解那些注意力头,去寻找那些消失的梯度,去把损失面磨平,它就还远远没到墙角。
别信那些“AI寒冬”的鬼话。寒冬只会冻死没穿衣服的概念,以及没穿裤子的人。