计算机视觉技术:从实验室走到你我口袋里的隐形革命
前几天去楼下便利店买冰饮,我把手机往收银台一放,老板抬头扫了一眼我就走了。
不用掏码,不用输密码,靠脸搞定一切。你有没有想过,这件每天都在发生的小事,背后就是已经发展了半个世纪的计算机视觉技术。
2012ImageNet图像分类比赛AlexNet结果对比图
从那之后,深度学习彻底改变了计算机视觉技术的发展路径。原来要人工挖特征,现在让模型自己学,数据越多,模型越聪明。
说实话,速度快到吓人。十年时间,图像分类准确率从不到70%涨到了98%以上,超过了人类平均水平。原来要跑几个小时的识别任务,现在千元价位的手机就能实时跑。
简直是换了天地。
农业无人机计算机视觉病虫害识别作业实景图
最近火得一塌糊涂的多模态大模型,更是离不开CV。GPT-4V能看懂你拍的错题,能帮你改电路图,能看懂你拍的菜单推荐菜,核心就是计算机视觉技术把图像转成了模型能理解的特征。
自动驾驶更不用说,现在走纯视觉路线的厂商,靠八颗摄像头加CV模型,就能搞定大部分城市场景的自动驾驶,成本比激光雷达方案低了快一半,很多新手十万块的车就能用上自动驾驶,这里面CV功不可没。
原来只有高端设备才能玩的技术,现在已经下放到了普通人触手可及的地方。
计算机视觉技术接下来,还要踩哪些坑
发展得快,问题也不少。
第一个绕不开的问题就是数据依赖。现在主流的CV模型,性能全靠标好的数据堆,你要让它识别一种新的缺陷,没有几千张标注好的图片根本训不好。可很多场景里,根本没那么多数据。比如罕见的工业缺陷,一年出不了几十个,上哪找几千张图去?小样本学习现在说了很多年,落地的还是少。
第二个问题是泛化性差。实验室里训出来的模型,准确率九十九,拿到真实场景里,换个光照,沾点灰尘,准确率直接掉二十个点。太常见了。很多项目看着论文数据很好看,落地的时候卡在这里动不了。
还有就是大模型的端侧部署问题。现在性能好的CV模型越来越大,参数几个G,要放到手机、门禁这种小型设备上跑,就得压缩,压缩完性能就掉,怎么平衡速度和精度,至今还是很多研究者在抠的细节。
不过话说回来,这些坑其实都是发展中的问题。二十年前谁能想到,我们今天能靠CV靠脸买水,能靠CV让十万块的车实现自动驾驶?
机器要真正理解这个世界,首先得能看见这个世界。计算机视觉技术,就是给机器装眼睛的第一步。这步走了半个世纪,才刚走到能大规模用的阶段,接下来能变出什么花样,真的太值得期待了。
从「认不出」到「秒匹配」,这几十年走了多少弯路
早在上世纪六十年代,就有研究者提出,能不能让计算机看懂图片里的内容。那时候的思路有多笨?人工标特征,认人脸就标眼间距、鼻梁宽度、颧骨高度,认猫就标耳朵形状、尾巴长短,然后写规则让计算机比对。 结果呢?换个角度拍张照,直接认不出来。准确率能到百分之五十都算烧高香。 我之前听一位退休的CV老教授说,九十年代他带学生做项目,为了识别手写数字,整个实验室标了半年数据,最后跑出来的结果,还不如一个刚会写字的小孩。 转折点在2012年。那一届ImageNet图像分类比赛,Hinton和他的学生用AlexNet直接把错误率从之前的26%干到了15%,甩了第二名快10个百分点,整个领域直接炸了。
2012ImageNet图像分类比赛AlexNet结果对比图
从那之后,深度学习彻底改变了计算机视觉技术的发展路径。原来要人工挖特征,现在让模型自己学,数据越多,模型越聪明。
说实话,速度快到吓人。十年时间,图像分类准确率从不到70%涨到了98%以上,超过了人类平均水平。原来要跑几个小时的识别任务,现在千元价位的手机就能实时跑。
简直是换了天地。
现在的计算机视觉技术,早就不只是识别人脸了
很多人对CV的印象还停留在刷脸支付、小区监控,那可太局限了。 现在的计算机视觉技术,早就钻到了各行各业的骨头里。 比如消费电子里的防抖,你拿手机拍走路的视频,不抖得像过山车,靠的就是CV做运动估计。手机里的人像虚化,拍文档自动校正边框,全是CV的功劳。 工业领域更夸张。现在高端手机屏幕上的微米级划痕,人眼找一块要十分钟,还容易漏,计算机视觉一秒能扫四五块,准确率几乎百分之百。我认识一个做工业检测的创业者,他们靠CV给汽车厂商做零件缺陷检测,一条生产线一年能帮厂商省几百万的人工成本。 农业里也用得越来越多。无人机带着CV模型绕着田飞一圈,哪棵庄稼长了虫,哪块地缺肥,直接标出来,精准喷药施肥,比全田撒药省三分之一的农药钱。
农业无人机计算机视觉病虫害识别作业实景图
最近火得一塌糊涂的多模态大模型,更是离不开CV。GPT-4V能看懂你拍的错题,能帮你改电路图,能看懂你拍的菜单推荐菜,核心就是计算机视觉技术把图像转成了模型能理解的特征。
自动驾驶更不用说,现在走纯视觉路线的厂商,靠八颗摄像头加CV模型,就能搞定大部分城市场景的自动驾驶,成本比激光雷达方案低了快一半,很多新手十万块的车就能用上自动驾驶,这里面CV功不可没。
原来只有高端设备才能玩的技术,现在已经下放到了普通人触手可及的地方。
计算机视觉技术接下来,还要踩哪些坑
计算机视觉技术接下来,还要踩哪些坑
发展得快,问题也不少。
第一个绕不开的问题就是数据依赖。现在主流的CV模型,性能全靠标好的数据堆,你要让它识别一种新的缺陷,没有几千张标注好的图片根本训不好。可很多场景里,根本没那么多数据。比如罕见的工业缺陷,一年出不了几十个,上哪找几千张图去?小样本学习现在说了很多年,落地的还是少。
第二个问题是泛化性差。实验室里训出来的模型,准确率九十九,拿到真实场景里,换个光照,沾点灰尘,准确率直接掉二十个点。太常见了。很多项目看着论文数据很好看,落地的时候卡在这里动不了。
还有就是大模型的端侧部署问题。现在性能好的CV模型越来越大,参数几个G,要放到手机、门禁这种小型设备上跑,就得压缩,压缩完性能就掉,怎么平衡速度和精度,至今还是很多研究者在抠的细节。
不过话说回来,这些坑其实都是发展中的问题。二十年前谁能想到,我们今天能靠CV靠脸买水,能靠CV让十万块的车实现自动驾驶?
机器要真正理解这个世界,首先得能看见这个世界。计算机视觉技术,就是给机器装眼睛的第一步。这步走了半个世纪,才刚走到能大规模用的阶段,接下来能变出什么花样,真的太值得期待了。