计算机视觉技术:从实验室玩具到生活刚需,我们走过了这些坑
上个月逛朋友开的无人社区水果店,挑了一袋车厘子,出门直接从账户扣钱,全程没收银员,连称都不用称——机器扫一眼就知道是车厘子,算出来分量和价格。放在十年前,谁敢信?那时候计算机视觉连放在白纸前的猫都认不准,现在居然能精准区分品种差不多的不同车厘子。
2012年AlexNet卷积神经网络结构示意图
那时候你去问做CV的人,这技术什么时候能落地,十个有八个摇头。手工标数据标到吐,模型换个场景就瞎,光线暗一点、角度偏一点,直接认不出来。我读硕士那时候,同实验室的师哥做路口车辆检测,就为了搞定阴天的识别率,整整调了三个半月,毕业答辩前还在改参数,头发掉得发际线后退了两厘米。说实话,那时候别说普通人,就连我们这些做相关研究的,都觉得计算机视觉就是个拿经费的实验室玩具,离生活远着呢。
农业无人机计算机视觉识别棉花杂草作业图
前阵子看中科院自动化所团队发的新成果,针对低光照场景的行人检测,在深夜无路灯的路口数据集上,准确率比之前的SOTA模型提了14.7个百分点,连戴着帽子口罩、只漏半张脸的行人都能精准识别。这放在五年前,想都不敢想。不过话说回来,现在的技术也不是没bug。我上周早高峰赶地铁,戴了个鸭舌帽,人脸识别闸机对着我扫了快半分钟,就是开不了,后面排了一堆人,尴尬到我想找个地缝钻进去。对吧,技术落地到不同场景,总有各种奇奇怪怪的问题要解决,哪有那么完美的事儿。现在还有不少创业公司拿计算机视觉割投资人韭菜,吹得天花乱坠,落地就是一堆问题,这种事见得也不少了。
下一个十年,计算机视觉技术会走到哪?
现在大模型火了,很多人说计算机视觉被大模型吞并了?不对,反而更重要了。大语言模型要能看懂图片看懂视频,就得靠计算机视觉把视觉信息转换成模型能读懂的特征,计算机视觉就是大模型的眼睛。现在行业里最火的方向是通用大视觉模型,原来做一个场景就要训一个模型,成本高到离谱,现在一个大模型就能搞定上万种视觉任务,中小企业也能用得起,成本直接砍到原来的十分之一不到。还有现在炒得很热的具身智能,机器人要自主走路、抓取东西,全靠高精度的计算机视觉提供环境信息,没有好的视觉,机器人连桌子上的杯子都抓不准,更别说帮你做家务了。
现在最大的痛点是什么?是小样本学习和隐私问题。人认一个新东西,只要看两三张图就会了,现在的模型还得喂几万几十万张才能训好,什么时候模型能做到看几张就会,那才是真的接近人的认知了。隐私这块,现在很多视觉数据都存在云端,容易泄露,现在做的端侧计算机视觉,所有运算都在你本地设备上完成,不用把你的人脸图像上传到服务器,既快又安全,这肯定是接下来的大方向。哦对,还有很多冷门的应用,比如考古,用计算机视觉扫描褪色的古代壁画,能还原出已经看不清的线条和文字,比考古学家手绘快了上百倍,不少之前解不开的古文字,靠着还原出来的纹路,终于读出了意思,这都是之前没人想到的方向。
昨天刷到一条短视频,一个国内团队做了基于计算机视觉的盲人辅助设备,扫一下前面的路,能准确告诉你前面有三阶台阶,高度多少,左边十米有个共享单车。放在二十年前,这种场景写进科幻小说,都有人觉得太天马行空。说白了,计算机视觉就是给机器装了一双能看懂世界的眼睛,从认对一张猫的图片,到帮农民省农药,帮盲人认路,一步步走过来,踩过的坑不计其数。现在很多人已经习惯了刷脸开门、刷脸支付,都不觉得这是什么黑科技了。本来就是这样啊,好的技术,最后都会变成生活里理所当然的一部分,你看不见它,但离不开它。
最早的计算机视觉,是个只会死记硬背的笨小孩
早在上世纪六十年代,学术界就提出了计算机视觉的概念,可一直到2012年之前,这玩意儿都没跳出实验室的圈子。那时候没有深度学习,所有的特征都得靠工程师手工写规则提取,什么SIFT特征、HOG特征,调参数调得人发疯。ImageNet图像识别大赛是当年圈里最火的擂台,2011年冠军的错误率还在25%以上,一百张图能认错四分之一。直到2012年,AlexNet横空出世,直接把错误率干到15.3%,比第二名低了快10个百分点,整个圈子直接炸了。
2012年AlexNet卷积神经网络结构示意图
那时候你去问做CV的人,这技术什么时候能落地,十个有八个摇头。手工标数据标到吐,模型换个场景就瞎,光线暗一点、角度偏一点,直接认不出来。我读硕士那时候,同实验室的师哥做路口车辆检测,就为了搞定阴天的识别率,整整调了三个半月,毕业答辩前还在改参数,头发掉得发际线后退了两厘米。说实话,那时候别说普通人,就连我们这些做相关研究的,都觉得计算机视觉就是个拿经费的实验室玩具,离生活远着呢。
现在的计算机视觉技术,早就偷偷藏在你身边了
很多人一提到计算机视觉,第一反应就是人脸打卡、手机解锁,这可太狭隘了。你刷短视频时的自动美颜、换背景,是计算机视觉在干活。你去医院拍肺部CT,AI帮医生圈出疑似结节的位置,准确率比不少年轻医生还高,靠的也是计算机视觉。现在新疆的棉农,用无人机打农药,计算机视觉能自动区分棉花和杂草,只给杂草喷药,一亩地能省三成农药钱。
农业无人机计算机视觉识别棉花杂草作业图
前阵子看中科院自动化所团队发的新成果,针对低光照场景的行人检测,在深夜无路灯的路口数据集上,准确率比之前的SOTA模型提了14.7个百分点,连戴着帽子口罩、只漏半张脸的行人都能精准识别。这放在五年前,想都不敢想。不过话说回来,现在的技术也不是没bug。我上周早高峰赶地铁,戴了个鸭舌帽,人脸识别闸机对着我扫了快半分钟,就是开不了,后面排了一堆人,尴尬到我想找个地缝钻进去。对吧,技术落地到不同场景,总有各种奇奇怪怪的问题要解决,哪有那么完美的事儿。现在还有不少创业公司拿计算机视觉割投资人韭菜,吹得天花乱坠,落地就是一堆问题,这种事见得也不少了。
下一个十年,计算机视觉技术会走到哪?
下一个十年,计算机视觉技术会走到哪?
现在大模型火了,很多人说计算机视觉被大模型吞并了?不对,反而更重要了。大语言模型要能看懂图片看懂视频,就得靠计算机视觉把视觉信息转换成模型能读懂的特征,计算机视觉就是大模型的眼睛。现在行业里最火的方向是通用大视觉模型,原来做一个场景就要训一个模型,成本高到离谱,现在一个大模型就能搞定上万种视觉任务,中小企业也能用得起,成本直接砍到原来的十分之一不到。还有现在炒得很热的具身智能,机器人要自主走路、抓取东西,全靠高精度的计算机视觉提供环境信息,没有好的视觉,机器人连桌子上的杯子都抓不准,更别说帮你做家务了。
现在最大的痛点是什么?是小样本学习和隐私问题。人认一个新东西,只要看两三张图就会了,现在的模型还得喂几万几十万张才能训好,什么时候模型能做到看几张就会,那才是真的接近人的认知了。隐私这块,现在很多视觉数据都存在云端,容易泄露,现在做的端侧计算机视觉,所有运算都在你本地设备上完成,不用把你的人脸图像上传到服务器,既快又安全,这肯定是接下来的大方向。哦对,还有很多冷门的应用,比如考古,用计算机视觉扫描褪色的古代壁画,能还原出已经看不清的线条和文字,比考古学家手绘快了上百倍,不少之前解不开的古文字,靠着还原出来的纹路,终于读出了意思,这都是之前没人想到的方向。
昨天刷到一条短视频,一个国内团队做了基于计算机视觉的盲人辅助设备,扫一下前面的路,能准确告诉你前面有三阶台阶,高度多少,左边十米有个共享单车。放在二十年前,这种场景写进科幻小说,都有人觉得太天马行空。说白了,计算机视觉就是给机器装了一双能看懂世界的眼睛,从认对一张猫的图片,到帮农民省农药,帮盲人认路,一步步走过来,踩过的坑不计其数。现在很多人已经习惯了刷脸开门、刷脸支付,都不觉得这是什么黑科技了。本来就是这样啊,好的技术,最后都会变成生活里理所当然的一部分,你看不见它,但离不开它。