当前位置:首页 > 科研成果库

咖啡馆里聊机器学习技术:它真不是你想的那样玄乎

2026-10-09 07:01:52小研科研成果库8
上个月9月23号,我在南京老门东巷口一家社区咖啡馆蹭网,碰到个刚读计算机大三的小孩,坐我旁边对着屏幕挠头,屏幕上亮着一片堆得密密麻麻的代码,标题栏写着机器学习入门作业。 他凑过来问我是不是做这行的,说翻了三天教程,全是一堆看不懂的公式,越看越觉得机器学习是天上飘着的黑科技,离普通人太远了。 我当时喝了一口冰美式,跟他说,你别被那些术语吓住。咱们掰碎了说,其实特别简单。

别背定义,先搞懂和传统编程的区别

很多人入门第一句话就看“机器学习是人工智能的一个分支...”,看完直接睡着了。 你换个角度想。我们以前写程序,是什么逻辑? 人先想清楚规则,再把规则写成代码,输入进去,机器按规则出结果。 比如你要做一个算员工工资的程序,规则很清楚:基本工资加绩效减社保减个税,每一步都写死,机器只要算数就行。对不对? 那要是规则你根本写不出来呢? 比如你要让机器帮你把相册里的猫和狗分开。你能把猫的规则写清楚吗? 你说猫有尖尖的耳朵?不对,折耳猫耳朵是圆的。你说猫体型小?不对,成年橘猫比小型犬还重。有的猫趴在沙发上露半个脑袋,有的在草地上跑只露个尾巴,你写一万条规则也覆盖不全。 这时候就轮到机器学习上场了。 传统编程与机器学习逻辑对比示意图传统编程与机器学习逻辑对比示意图 机器学习的逻辑反过来:你不用给它写规则,你只要把一堆“输入”和对应的“正确结果”给它,比如一万张已经标好“这是猫”“这是狗”的照片,让机器自己跑,自己从里面摸出规律来。 等它摸完规律,你再给它一张没标过的新照片,它就能自己告诉你,这是猫还是狗。 说实话,我刚入行的时候,花了快半年才绕过来这个弯。之前总觉得机器学习就是程序员堆了一堆复杂规则,只是我看不懂而已。绕过来之后才发现,这个反转才是整个机器学习技术最核心的东西。 就像你教小孩认苹果,你不用跟他讲“苹果是蔷薇科苹果属植物的果实,直径一般五到十厘米,颜色多为红色”,你只要拿十个苹果十个梨给他看几遍,他下次自然能认出来。对吧? 机器学习干的就是这事。

我们天天都在碰,只是你没察觉

别觉得机器学习是实验室里的东西,离你生活远。 你早上醒了刷短视频,刷到的内容都是机器学习给你推的,它摸出来你喜欢看猫片还是足球比赛,就使劲给你推。你付款的时候用人脸解锁,你打输入法的时候出来的联想词,你点外卖的时候显示的“预计30分钟送达”,全是机器学习跑出来的结果。 我前两年在南京做过一个物流的项目,帮快递公司找异常件。之前都是老分拣员人工翻,一天几千单,要翻三四个小时,眼睛都看花,还经常漏。 我们怎么做的?把过去三年所有的运单数据拉出来,哪件迟到了,哪件丢了,哪件破损了,全都标好,把这些数据喂给模型,让它自己找规律。 最后训练出来的模型,几千单一秒就能筛完,把有问题的挑出来,准确率比干了十年的老分拣员还高。工人只需要处理挑出来的那几十个就行,一天能省好几个小时。 物流异常件机器学习筛选工作界面图物流异常件机器学习筛选工作界面图 你说这东西玄乎吗?其实一点都不,就是解决了一个人干着累的活而已。 不过话说回来,现在网上对机器学习的误解真的太多。 打开手机全是“机器学习颠覆一切”“十年后取代百分之八十的工作”,看得人慌得不行。其实呢,现在所有能用在生产里的机器学习,都是人给数据,人定目标,它只负责找规律。 它不会自己说“我要取代人类”,它连“我要做什么”这个目标都得人给它定。 很多人说机器学习就是人工智能,其实不对,机器学习只是实现人工智能的一种方法而已,离大家怕的那种“有自我意识的AI”,差了十万八千里。

机器学习也有绕不开的边界

机器学习也有绕不开的边界机器学习也有绕不开的边界 干这行久了,我现在最怵的就是碰到张口就要“做个万能AI”的产品经理。 上来就说“我们要用机器学习做个智能客服,解决所有用户问题”,我每次都得泼冷水,机器学习不是万能的,它有自己搞不定的事。 第一个死穴,数据不好,它直接废了。 你给它喂一堆乱标的数据,它找出来的规律就是错的。我之前有个做风控的朋友,帮公司做信贷审批模型,拿了一批业务员随便标的数据训练,结果模型放了一堆不该放的贷款,最后坏了几千万的账,老板差点把他开了。说起来好笑,其实就是这么回事,你喂进去垃圾,出来的只能是垃圾。 第二个问题,它只会找相关性,不会找因果。 之前看到过一个很经典的案例,工程师训练了一个识别图片里有没有奶牛的模型,测了一万张正确率百分之九十九,大家都觉得没问题。结果有人拿了一张雪地的照片进去,模型说这里面有奶牛。 为啥?原来训练集里所有奶牛的照片,都是晴天拍的,背景都很亮。模型摸出来的规律是“亮背景=有奶牛”,它根本不知道奶牛才是核心,亮只是刚好碰上而已。 它分不清楚什么是因什么是果,只会从数据里找统计上的关联。这就意味着,只要数据里有偏差,它就会跑偏,偏得还特别离谱。 还有,从来没见过的东西,它根本认不出来。你拿训练过猫和狗的模型去看一只美洲狮,它大概率会说这是猫,因为它没见过美洲狮,只会按之前学的规律硬套。 说真的,到今天为止,机器学习能做好的,永远只有一类问题:你有大量的过往数据,你要做的就是判断、预测、分类,这类问题它干得比人好,又快又便宜。超出这个范围,它真不行。 那天走的时候,那个小孩跟我说,原来机器学习这么接地气,我之前白怕了这么久。 其实我一直觉得,现在太多人把机器学习技术吹得太神,神到像是魔法一样。本质上它就是个工具,和我们家里的电饭煲,工地的挖掘机没区别。你用它蒸饭,用它挖煤,它帮你省力气,帮你干你干不了的活,这就够了。 不用捧得太高,也不用怕它。会用就行。