计算机视觉技术:从实验室走到街头,悄悄改变了什么?
你早上掏出手机刷脸解锁,下楼买早餐刷脸支付,进公司门闸自动开,停车场杆子自动抬。
这些事你现在做起来习以为常对吧?
可你有没有想过,所有这一切背后,都是同一个技术在干活。
就是今天说的计算机视觉技术。
商场刷脸支付闸机计算机视觉应用场景
说实话,我前阵子打网约车,司机跟我聊起他那车的车道偏离提醒,原来也是计算机视觉实时读路面标线的,我当时还愣了一下,原来这也算啊。
现在的手机拍照,人像虚化、AI美颜、自动对焦追焦,甚至你拍文档自动裁边扶正,全是计算机视觉的功劳。哪怕你用美图秀秀P图,给你自动识别人脸补妆,也是它干的活。
过去十几年,这个领域发展快到吓人。十年前识别一张图片里的猫,准确率还不到70%,现在呢?识别人脸的准确率超过99%,比人眼认错的概率还低。
生成式计算机视觉3D房间重建效果对比图
斯坦福去年CVPR上放出来的那篇动态神经场论文,真的惊到我了。你拿普通手机绕着一个堆满杂物的房间拍10分钟,模型就能跑出精度不到1厘米的1:1 3D模型,连桌角掉的一块漆都能还原出来。
放在五年前,这种精度的3D重建,得用几十万的激光雷达设备扫大半天,还要后期处理好几天,现在普通人拿个手机就能搞定。这就是科研进步的威力啊。
不过话说回来,现在生成式还是有一堆没解决的问题。你随便找个AI生成图,是不是经常看到六根手指的人,扭曲变形的桌面椅子?本质上还是模型没真的理解三维空间的物理规则,只是学了个像素的概率分布。
现在CMU、MIT好多团队都在往这个方向砸钱,把物理常识、几何规则嵌入模型,就是想解决这个"瞎编"的问题。我上个月听一个华人教授的线上讲座,他们最新的成果已经把生成图的物理错误率降了快60%,再过两年说不定真的就能做到完全符合常识了。
行业爆火背后,藏着哪些没说出口的问题?
现在计算机视觉方向的应届生,起薪比很多传统方向高了一倍都不止,大厂抢着要,创业公司融资也拿的容易。
但泡沫也真的不少。
我见过太多创业团队,拿着计算机视觉的名头做项目,其实就是拿开源的预训练模型改改参数,套个业务场景就出来圈钱,核心技术一点都没有。风口一过,死的一大片。
除了行业泡沫,还有两个真正的大问题,好多人都没敢明说。
第一个是隐私。
你现在走在商业街上,平均每十分钟就会被摄像头抓拍到一次,很多摄像头背后都跑着计算机视觉算法,悄悄识别你的脸,记录你的出行轨迹,甚至分析你的年龄性别穿搭,给你推广告。
更吓人的是,现在已经有科研成果证明,计算机视觉能靠走路的姿态认出你,哪怕你戴口罩戴帽子蒙着脸,识别准确率都能超过90%。
想想看,不管你去哪,都有一双眼睛在盯着你认你,细思极恐对吧?
第二个是算法偏见。
前几年美国公路局测试一个行人检测的计算机视觉系统,发现对深色皮肤行人的识别准确率比浅色皮肤低了快30%,要是把这个系统用在自动驾驶上,那就是实打实的人命关天。
我们国家现在很多公共场景的人脸识别系统,也被爆出过对长相偏大众的少数民族识别错误率偏高的问题。这个不是简单的调参就能解决的,本质上是训练数据集里的样本就不均衡,很多小众群体的样本根本没采集够。
现在好多顶尖科研机构都把"算法公平性"做成了计算机视觉的新方向,就是想填这个坑。
我前阵子跟一个自动驾驶的资深工程师吃饭,他说他们现在最头疼的,不是晴天高速路认车,是雨天雾天夜路,玻璃上全是水珠,摄像头拍出来一片糊,模型立马就懵了,全团队天天蹲在雨场里测数据,就想解决这个极端场景的问题。
你看,哪怕是大家觉得已经成熟到不能再成熟的领域,其实还有一堆坑等着填。
对吧?
它不是什么魔法,也不是什么洪水猛兽,就是一个正在快速成长的工具。就像一百年前的电力,五十年前的计算机,现在慢慢渗进我们生活的每个缝隙。
今天你出门,不妨多留意两眼,说不定就能发现好几个藏在你身边的计算机视觉应用……
原来你天天在用,却未必发现它
我上个月陪我妈去派出所换身份证,全程自助拍照,机器自动裁图补光,调整机位帮你摆好姿势,十分钟就拿到了回执。 放在十年前,想都不敢想啊。 很多人对这个技术的印象,还停留在科幻电影里能看懂人的机器人,或者实验室里高大上的科研设备。其实早几年就已经铺满了大街小巷。
商场刷脸支付闸机计算机视觉应用场景
说实话,我前阵子打网约车,司机跟我聊起他那车的车道偏离提醒,原来也是计算机视觉实时读路面标线的,我当时还愣了一下,原来这也算啊。
现在的手机拍照,人像虚化、AI美颜、自动对焦追焦,甚至你拍文档自动裁边扶正,全是计算机视觉的功劳。哪怕你用美图秀秀P图,给你自动识别人脸补妆,也是它干的活。
过去十几年,这个领域发展快到吓人。十年前识别一张图片里的猫,准确率还不到70%,现在呢?识别人脸的准确率超过99%,比人眼认错的概率还低。
最近两年,这个领域最炸的科研突破是什么?
我去年帮一个学术会议审青年学者的投稿,最大的感受就是,整个领域的方向已经变了。 过去大半个世纪,计算机视觉做的核心都是判别式任务:输入一张图片,模型输出判断——这图里有什么,在哪,是什么东西。说白了就是让计算机学会"看",能看懂看见的东西。 这部分现在已经做得足够成熟,商业化也落地的七七八八了。 最近五年,顶会论文里占比越来越高的,是生成式计算机视觉。 从一开始的AI画图,到现在的3D重建、动态场景生成,甚至给视频换场景换人物,本质上都是让计算机不仅能看懂,还能"创造"出符合逻辑的新视觉内容。
生成式计算机视觉3D房间重建效果对比图
斯坦福去年CVPR上放出来的那篇动态神经场论文,真的惊到我了。你拿普通手机绕着一个堆满杂物的房间拍10分钟,模型就能跑出精度不到1厘米的1:1 3D模型,连桌角掉的一块漆都能还原出来。
放在五年前,这种精度的3D重建,得用几十万的激光雷达设备扫大半天,还要后期处理好几天,现在普通人拿个手机就能搞定。这就是科研进步的威力啊。
不过话说回来,现在生成式还是有一堆没解决的问题。你随便找个AI生成图,是不是经常看到六根手指的人,扭曲变形的桌面椅子?本质上还是模型没真的理解三维空间的物理规则,只是学了个像素的概率分布。
现在CMU、MIT好多团队都在往这个方向砸钱,把物理常识、几何规则嵌入模型,就是想解决这个"瞎编"的问题。我上个月听一个华人教授的线上讲座,他们最新的成果已经把生成图的物理错误率降了快60%,再过两年说不定真的就能做到完全符合常识了。
行业爆火背后,藏着哪些没说出口的问题?
行业爆火背后,藏着哪些没说出口的问题?
现在计算机视觉方向的应届生,起薪比很多传统方向高了一倍都不止,大厂抢着要,创业公司融资也拿的容易。
但泡沫也真的不少。
我见过太多创业团队,拿着计算机视觉的名头做项目,其实就是拿开源的预训练模型改改参数,套个业务场景就出来圈钱,核心技术一点都没有。风口一过,死的一大片。
除了行业泡沫,还有两个真正的大问题,好多人都没敢明说。
第一个是隐私。
你现在走在商业街上,平均每十分钟就会被摄像头抓拍到一次,很多摄像头背后都跑着计算机视觉算法,悄悄识别你的脸,记录你的出行轨迹,甚至分析你的年龄性别穿搭,给你推广告。
更吓人的是,现在已经有科研成果证明,计算机视觉能靠走路的姿态认出你,哪怕你戴口罩戴帽子蒙着脸,识别准确率都能超过90%。
想想看,不管你去哪,都有一双眼睛在盯着你认你,细思极恐对吧?
第二个是算法偏见。
前几年美国公路局测试一个行人检测的计算机视觉系统,发现对深色皮肤行人的识别准确率比浅色皮肤低了快30%,要是把这个系统用在自动驾驶上,那就是实打实的人命关天。
我们国家现在很多公共场景的人脸识别系统,也被爆出过对长相偏大众的少数民族识别错误率偏高的问题。这个不是简单的调参就能解决的,本质上是训练数据集里的样本就不均衡,很多小众群体的样本根本没采集够。
现在好多顶尖科研机构都把"算法公平性"做成了计算机视觉的新方向,就是想填这个坑。
我前阵子跟一个自动驾驶的资深工程师吃饭,他说他们现在最头疼的,不是晴天高速路认车,是雨天雾天夜路,玻璃上全是水珠,摄像头拍出来一片糊,模型立马就懵了,全团队天天蹲在雨场里测数据,就想解决这个极端场景的问题。
你看,哪怕是大家觉得已经成熟到不能再成熟的领域,其实还有一堆坑等着填。
对吧?
它不是什么魔法,也不是什么洪水猛兽,就是一个正在快速成长的工具。就像一百年前的电力,五十年前的计算机,现在慢慢渗进我们生活的每个缝隙。
今天你出门,不妨多留意两眼,说不定就能发现好几个藏在你身边的计算机视觉应用……