神经形态计算:被低估的下一代AI芯片破局之路
你有没有算过,现在大模型跑一次完整推理,耗的电够普通三口家用一天?
不是危言耸听,摩尔定律走到今天,堆晶体管堆GPU的路子已经越来越累,涨价涨得离谱不说,功耗高到数据中心都要建在水电站边上。
大家都在找破局的方向,藏了几十年的神经形态计算,最近终于从实验室走到了聚光灯下。
冯诺依曼架构与神经形态计算原理对比图
神经形态计算不这么干。它直接模仿人脑的神经元和突触连接,把存储和计算做在了同一个地方,信号就是数据,算完直接存在本地突触里,根本不用来回搬。
你想想人脑,你一眼认出路口等你的朋友,整个过程功耗才不到10毫瓦。换成现在的GPU做同样的事,功耗要翻几百万倍。
这个概念真不新,八十年代就提出来了,那时候半导体工艺跟不上,做不了大规模的神经元连接,一直被雪藏。最近两年AI炸了,GPU不够用了,大家才想起这个被放了几十年的卫星居然真的能落地。
说实话,第一次看到神经形态芯片的功耗数据,我整个人都惊了。比同性能GPU低三个数量级啊!千分之一的功耗,这是什么概念?原来一块GPU用一天的电,现在能用近三年。
清华大学天机神经形态计算芯片实拍图
我前阵子看国内半导体所的最新成果,他们用基于忆阻器的神经形态阵列做手写数字识别,准确率做到98%以上,功耗比传统架构低了一千多倍。现在已经能做小批量流片了,离量产真的不远。
不过话说回来,问题也挺多。
最大的坎就是生态。现在所有的AI算法,不管是CNN还是Transformer,都是给冯诺依曼架构设计的,直接搬到神经形态芯片上根本跑不动,得重新设计适配脉冲神经网络的模型,整个开发工具链都要重新做,很多工程师还没转过这个弯来。
其次就是工艺,忆阻器是现在做突触的主流选择,但良率一直上不去,成本降不下来,没法做大批量的消费级芯片。还有稳定性,突触的电阻会漂移,用久了准确率会掉,这些都是还在解决的问题。
神经形态计算会取代GPU吗?别扯,先拿下边缘端再说
现在很多自媒体喜欢吹“颠覆GPU”“取代冯诺依曼”,我看了就想笑。
GPU这么多年堆出来的生态,训练大模型的能力,近十年之内神经形态计算根本碰不动。哪怕十年之后,大模型训练大概率还是靠堆异构计算GPU,轮不到神经形态。
那它的机会在哪?边缘端啊。
你家里的智能监控,你手上的智能手表,你车上的车载感知设备,这些场景不需要训练大模型,只要做低功耗实时推理,还要求本地处理不泄密,这不就是为神经形态计算量身定做的吗?
原来的监控要把所有视频传到云端处理,不仅延迟高,还容易泄露隐私,用神经形态芯片直接在本地就能识别异常行为,不用传任何原始数据到网上,既快又安全还省电,一块电池能用一年不用换。
还有脑机接口,现在的侵入式脑机接口,处理神经信号的功耗大到离谱,要是用神经形态芯片,本身就是模仿生物神经结构处理脉冲信号,匹配度简直是天生一对,未来植入式脑机接口的低功耗需求,只有神经形态计算能满足。
最近还有研究发现,神经形态计算天生适合做连续小样本学习,能像人脑一样,见到新东西学新东西,不用把整个模型重新训一遍,这对于需要不断学习新场景的机器人来说,简直是刚需。
现在整个行业都在卷大模型,卷参数,卷GPU产能,所有人挤破头往同一条路上走,价格涨上天,能耗下不来,很少有人愿意回头看看另一条路。
说不定再过十年,我们口袋里的手机,家里的智能设备,车上的感知芯片,用的都是神经形态计算的方案。
谁知道呢?科技从来都不按剧本走。
说人话,神经形态计算就是抄人脑的作业
现在我们用的所有芯片,几乎都是冯诺依曼架构,这个架构用了七十多年,最大的问题就是存储和计算是分开的。每次运算都要把数据从内存搬到计算单元,算完再搬回去,一来一回浪费了绝大多数的时间和功耗,这就是大家常说的冯诺依曼瓶颈。
就像你每次煮一碗面,都要开车去十公里外的仓库运面粉,煮完再把剩下的面粉送回去,折腾不折腾?
冯诺依曼架构与神经形态计算原理对比图
神经形态计算不这么干。它直接模仿人脑的神经元和突触连接,把存储和计算做在了同一个地方,信号就是数据,算完直接存在本地突触里,根本不用来回搬。
你想想人脑,你一眼认出路口等你的朋友,整个过程功耗才不到10毫瓦。换成现在的GPU做同样的事,功耗要翻几百万倍。
这个概念真不新,八十年代就提出来了,那时候半导体工艺跟不上,做不了大规模的神经元连接,一直被雪藏。最近两年AI炸了,GPU不够用了,大家才想起这个被放了几十年的卫星居然真的能落地。
说实话,第一次看到神经形态芯片的功耗数据,我整个人都惊了。比同性能GPU低三个数量级啊!千分之一的功耗,这是什么概念?原来一块GPU用一天的电,现在能用近三年。
现在的神经形态计算,真不是画饼,有实打实的成果
别以为这还停留在论文里,早就在跑出成果了。 英特尔去年推出的第二代Pohoiki Springs平台,已经集成了超过一亿个人工神经元,能跑完整的小型深度学习模型,用来做实时目标检测完全没问题。国内清华大学研发的天机芯片,几年前就登上了Nature,它同时支持传统AI和脉冲神经形态计算,已经成功用在自主行走的机器人控制上,功耗低到吓人。 更早的IBM TrueNorth芯片,整张卡的功耗才70毫瓦,比你手机的蓝牙模块功耗还低,就能跑完整的图像识别任务。
清华大学天机神经形态计算芯片实拍图
我前阵子看国内半导体所的最新成果,他们用基于忆阻器的神经形态阵列做手写数字识别,准确率做到98%以上,功耗比传统架构低了一千多倍。现在已经能做小批量流片了,离量产真的不远。
不过话说回来,问题也挺多。
最大的坎就是生态。现在所有的AI算法,不管是CNN还是Transformer,都是给冯诺依曼架构设计的,直接搬到神经形态芯片上根本跑不动,得重新设计适配脉冲神经网络的模型,整个开发工具链都要重新做,很多工程师还没转过这个弯来。
其次就是工艺,忆阻器是现在做突触的主流选择,但良率一直上不去,成本降不下来,没法做大批量的消费级芯片。还有稳定性,突触的电阻会漂移,用久了准确率会掉,这些都是还在解决的问题。
神经形态计算会取代GPU吗?别扯,先拿下边缘端再说
神经形态计算会取代GPU吗?别扯,先拿下边缘端再说
现在很多自媒体喜欢吹“颠覆GPU”“取代冯诺依曼”,我看了就想笑。
GPU这么多年堆出来的生态,训练大模型的能力,近十年之内神经形态计算根本碰不动。哪怕十年之后,大模型训练大概率还是靠堆异构计算GPU,轮不到神经形态。
那它的机会在哪?边缘端啊。
你家里的智能监控,你手上的智能手表,你车上的车载感知设备,这些场景不需要训练大模型,只要做低功耗实时推理,还要求本地处理不泄密,这不就是为神经形态计算量身定做的吗?
原来的监控要把所有视频传到云端处理,不仅延迟高,还容易泄露隐私,用神经形态芯片直接在本地就能识别异常行为,不用传任何原始数据到网上,既快又安全还省电,一块电池能用一年不用换。
还有脑机接口,现在的侵入式脑机接口,处理神经信号的功耗大到离谱,要是用神经形态芯片,本身就是模仿生物神经结构处理脉冲信号,匹配度简直是天生一对,未来植入式脑机接口的低功耗需求,只有神经形态计算能满足。
最近还有研究发现,神经形态计算天生适合做连续小样本学习,能像人脑一样,见到新东西学新东西,不用把整个模型重新训一遍,这对于需要不断学习新场景的机器人来说,简直是刚需。
现在整个行业都在卷大模型,卷参数,卷GPU产能,所有人挤破头往同一条路上走,价格涨上天,能耗下不来,很少有人愿意回头看看另一条路。
说不定再过十年,我们口袋里的手机,家里的智能设备,车上的感知芯片,用的都是神经形态计算的方案。
谁知道呢?科技从来都不按剧本走。