智慧安防技术研发:藏在摄像头背后的落地真相
从“看得见”到“看得懂”,研发卡在哪了
早十年的智慧安防技术研发,核心就是堆硬件。4K分辨率不够就上8K,镜头不够大就堆变焦倍数,拼到最后就是价格战。现在完全不一样。用户要的不是能拍清楚人脸的摄像头,是摄像头能自己告诉我,画面里这个人是不是小区的陌生人员,有没有翻墙,有没有在敏感区域长时间逗留。
真正卡脖子的从来都不是实验室里的算法精度,是真实场景下的落地能力。
智慧安防公共场所算法识别落地图
我认识一个算法研发组长,去年一整年,大半时间都泡在长三角一个老地铁站里。那个站点出入口逆光太严重,原来的算法,只要是下午三点以后进站,戴帽子戴口罩的乘客,人脸识别误检率超过15%,天天被乘客投诉。他带着团队蹲了四个月,调了上千版参数,就为了把误检率压到2%以下。
说实话,这种活儿发不了顶会论文,也刷不了业界常用的精度榜单,但是就是这种活儿,决定了你的产品能不能卖出去,能不能用得下去。很多创业公司拿着漂亮的实验室数据拿融资,一落地就翻车,就是从来没在这些破场景上花过功夫。不信你去看现在各地落地的智慧安防项目,出问题的十有八九不是大方向错了,就是这种犄角旮旯的细节没磨到位。
隐私红线,是研发绕不开的生死线
这两年最大的变化,就是研发的第一优先级从性能变成了合规。之前行业野蛮生长的时候,不少团队拿用户的人脸数据随便训练,存了几百万条全量数据,方便是方便,现在全是雷。
现在政策卡得严,用户对隐私也越来越敏感,所以智慧安防技术研发的半壁江山,都已经转到隐私保护技术上了。
智慧安防隐私计算加密研发流程图
我去年接触过一个做社区安防的研发团队,他们现在的方案很有意思:摄像头不会把用户的全量人脸数据传到后台,只在本地提取不可逆行加密的特征向量,后台只存特征向量,就算数据库被攻破,也根本倒推不出用户的长相对吧?还有现在流行的联邦学习,多个机构联合训练算法,根本不用交换原始数据,大家本地算完传梯度就行,既练了模型,又没碰数据。
吐槽一句,现在还有不少小公司打擦边球,偷偷存原始数据,靠着降低研发成本抢项目,看着赚了点小钱,其实就是在裸奔。哪天政策一收紧,或者出一次数据泄露,整个公司直接没了。可惜吗?有点可惜,但一点都不冤。做安防本来就是拿信任换饭吃,碰了隐私红线,谁都救不了。
下一个爆发点,端侧智能才是真未来
下一个爆发点,端侧智能才是真未来
现在绝大多数安防系统,还是把所有视频数据传到云端计算,不仅带宽成本高,延迟还大,遇上网络不好的时候,报警能慢好几分钟。现在研发的新方向,就是把算法直接嵌到摄像头里,端侧本地完成计算,只传结果,不传原始视频。既省带宽,又降延迟,还更安全,一举三得。
不过话说回来,端侧芯片的算力就那么点,不可能把几个G的大模型直接塞进去。所以现在最核心的研发难点就是模型压缩和稀疏化,怎么把大模型砍掉冗余,压缩到几兆大小,还不损失识别精度。这个真的是靠研发人员一点点抠出来的本事。我上个月看到国内一家芯片厂商的最新成果,已经能在一块不到一百块的端侧芯片上,实时跑16路的行为识别,延迟不到100毫秒。太惊艳了。
别小看这一百毫秒的延迟,真遇到有人闯银行、闯加油站这种紧急场景,提前半秒报警,可能就避免了一场恶性事件。现在还有团队做多模态融合,摄像头加毫米波雷达加麦克风,不是光靠看,还能靠感应靠声音判断,就算摄像头被树叶、障碍物挡住了,也能准确识别出非法入侵,比纯视觉方案靠谱太多了。
现在很多人吹大模型加智慧安防,什么通用安防大模型,听起来很玄乎,其实核心还是落地。谁能把大模型做小了,嵌到端侧,解决了真实场景的奇葩问题,还守得住隐私红线,谁就能拿到下一张门票。那些天天只吹概念的,迟早会被淘汰。说白了,做技术研发,从来都是拼解决真问题的能力,不是拼PPT做的好不好看。