科研成果评价中的标杆对比分析:别拿错尺子量自己
去年帮基金委做青基项目结题评审,翻了三十多份材料,一半以上的申请人做成果总结,都栽在标杆对比上。
要么就是拿个顶刊大牛的成果往那儿一放,把自己的数据一摆,哦我差了多少,我还要努力,整篇总结全是自我否定。
要么就是挑个没什么人做的冷门小成果对标,我各个指标都超了,我就是国际领先,水分大得能养鱼。
科研成果标杆对比分析选错标杆案例表
标杆对比分析的核心,从来不是找最牛的那个当靶子,是找同场景同需求的对标。你拼成本,就找同应用场景下成本控制做得最好的当标杆。你拼极端环境下的稳定性,就找同样工况下稳定性最好的当标杆。乱对标,除了打击自己或者蒙骗外行,没有任何意义。
不过话说回来,现在科研评价体系里,好多人就吃这一套,你说你跟一个不知名的小成果对标,人家会说你为啥不跟顶刊比?说白了,这是整个圈子的通病,不是哪个人的错,但咱们自己做分析,心里得清楚对错。
钙钛矿催化剂性能标杆对比拆分维度图
做标杆对比,就得把成果拆成一块一块比。从原料成本、制备流程、性能参数、测试条件到应用适配性,一个维度都不能落。
现在国内做固态动力电池的团队很多,大家都喜欢拿丰田的全固态电池标杆比能量密度,说我做到了多少多少,接近国际领先。可你拆开看呢?丰田做的是适配新能源车的大容量动力电芯,测试循环是1C快充下的循环寿命,好多国内团队拿的是实验室里的小软包电池,0.1C慢充测的循环,数字好看,实际根本不是一回事。
拆到颗粒度,才看得出真差距,也藏着真创新。说实话,很多时候你总性能差一点,但某个细分维度比标杆好太多,那价值反而更大。比如你把催化剂的制备时间从72小时降到2小时,成本砍了三分之二,哪怕总催化效率降了5%,对于产业化来说,这比效率涨10%值钱一百倍。
除了找差距,标杆对比分析还要找盲区
绝大多数人做标杆对比,目的只有两个:要么证明我差,我要追赶;要么证明我好,我比你牛。
很少有人想过,标杆对比还能找盲区。找什么盲区?找标杆没做的,找标杆走错的路径。
前几年大模型刚火的时候,国内一大堆团队做标杆对比,张嘴闭嘴就是我跟GPT-3比,我的准确率差多少,我的参数差多少,比来比去全是自卑,觉得我什么时候才能追得上。
可没人想过,GPT训练用的是全互联网公开的通用数据,医疗、化工、冶金这些垂直领域的专业非标数据,它根本拿不到,也训练不好。这不就是你的机会吗?现在做垂域大模型做得好的团队,哪一个不是盯着这个盲区打?我不跟你比通用问答的准确率,我就跟你比我这个领域的临床诊断准确率、化工流程参数预测准确率,我比你高两成,我就是老大。
还有一种盲区,是标杆本身的路径依赖盲区。整个行业都跟着原来的标杆走,大家都在同一条路线上卷参数,没人敢走新路线,结果新路线里藏着大机会。
早十年,动力电池的标杆是钴酸锂,能量密度高,大家做磷酸铁锂的,一对比都觉得能量密度差太多,没有前途,结果呢?磷酸铁锂成本低,循环寿命长,安全性高,现在成了全球动力电池的主流路线,原来的钴酸锂标杆,早就只留去做小数码电池了。
说白了,标杆是过去的人走对了路走出来的结果,不是你必须要follow的标准答案。你跟着对标找差距是没错,但你得抬头看看,这条路是不是已经走到头了,路边是不是有没人走的新路口。
我见过好多三十出头年轻科研人,做完标杆对比,直接发现原来的路线全是红海,转身扎进没人碰的盲区,没五六年就做出来了能卡脖子的成果,也见过一堆老团队抱着几十年前的老标杆不放,天天追着人家的屁股跑,追来追去,方向都换了,钱也花完了,什么都没留下。
做科研,本来就是走别人没走过的路。标杆对比只是工具,不是紧箍咒。你拿对了尺子,能量得准自己的长短,也能看得见没开辟的新路,这才是真的会用这个工具。
很多人做标杆对比分析,第一步就错了
错在哪?错在选标杆的逻辑就不对。绝大多数人选标杆,只看名气,不看匹配度。 你做面向县域农业推广的低成本土壤检测传感芯片,非要拿麻省理工学院花了数亿经费研发的高端量子传感芯片对标灵敏度,比完了说我灵敏度差了两个数量级,我成果不行。这不是傻吗? 说实话,我去年遇到那个青基申请人,就是这么干的。他的成果明明很好,把传感器的单位成本从一块多降到了八分,能做成一次性试纸埋地里测半年,正好适合我国散户农业的推广需求,结果就因为检出限比顶刊标杆高了0.2ppm,把自己写得一无是处,差点没拿到优秀结题。
科研成果标杆对比分析选错标杆案例表
标杆对比分析的核心,从来不是找最牛的那个当靶子,是找同场景同需求的对标。你拼成本,就找同应用场景下成本控制做得最好的当标杆。你拼极端环境下的稳定性,就找同样工况下稳定性最好的当标杆。乱对标,除了打击自己或者蒙骗外行,没有任何意义。
不过话说回来,现在科研评价体系里,好多人就吃这一套,你说你跟一个不知名的小成果对标,人家会说你为啥不跟顶刊比?说白了,这是整个圈子的通病,不是哪个人的错,但咱们自己做分析,心里得清楚对错。
科研成果的标杆对比,要拆到颗粒度里看
选对了标杆,接下来很多人又错了,就是只比总性能,不比拆分后的参数。 我上个月跟一个做钙钛矿催化的团队聊,他们拿着刚写好的论文给我看,说我们的催化剂稳定性比Nature上那个经典标杆高了120小时,我们这个成果绝对是重大突破。 我翻了翻数据,问了一句,你们的催化剂活性组分负载量是人家的三倍,这个怎么说? 一下子就安静了。原来他们只算了总稳定时长,没算单位活性组分的稳定性,拆完之后,反而比人家差了近40%。这就是没拆颗粒度的结果。
钙钛矿催化剂性能标杆对比拆分维度图
做标杆对比,就得把成果拆成一块一块比。从原料成本、制备流程、性能参数、测试条件到应用适配性,一个维度都不能落。
现在国内做固态动力电池的团队很多,大家都喜欢拿丰田的全固态电池标杆比能量密度,说我做到了多少多少,接近国际领先。可你拆开看呢?丰田做的是适配新能源车的大容量动力电芯,测试循环是1C快充下的循环寿命,好多国内团队拿的是实验室里的小软包电池,0.1C慢充测的循环,数字好看,实际根本不是一回事。
拆到颗粒度,才看得出真差距,也藏着真创新。说实话,很多时候你总性能差一点,但某个细分维度比标杆好太多,那价值反而更大。比如你把催化剂的制备时间从72小时降到2小时,成本砍了三分之二,哪怕总催化效率降了5%,对于产业化来说,这比效率涨10%值钱一百倍。
除了找差距,标杆对比分析还要找盲区
除了找差距,标杆对比分析还要找盲区
绝大多数人做标杆对比,目的只有两个:要么证明我差,我要追赶;要么证明我好,我比你牛。
很少有人想过,标杆对比还能找盲区。找什么盲区?找标杆没做的,找标杆走错的路径。
前几年大模型刚火的时候,国内一大堆团队做标杆对比,张嘴闭嘴就是我跟GPT-3比,我的准确率差多少,我的参数差多少,比来比去全是自卑,觉得我什么时候才能追得上。
可没人想过,GPT训练用的是全互联网公开的通用数据,医疗、化工、冶金这些垂直领域的专业非标数据,它根本拿不到,也训练不好。这不就是你的机会吗?现在做垂域大模型做得好的团队,哪一个不是盯着这个盲区打?我不跟你比通用问答的准确率,我就跟你比我这个领域的临床诊断准确率、化工流程参数预测准确率,我比你高两成,我就是老大。
还有一种盲区,是标杆本身的路径依赖盲区。整个行业都跟着原来的标杆走,大家都在同一条路线上卷参数,没人敢走新路线,结果新路线里藏着大机会。
早十年,动力电池的标杆是钴酸锂,能量密度高,大家做磷酸铁锂的,一对比都觉得能量密度差太多,没有前途,结果呢?磷酸铁锂成本低,循环寿命长,安全性高,现在成了全球动力电池的主流路线,原来的钴酸锂标杆,早就只留去做小数码电池了。
说白了,标杆是过去的人走对了路走出来的结果,不是你必须要follow的标准答案。你跟着对标找差距是没错,但你得抬头看看,这条路是不是已经走到头了,路边是不是有没人走的新路口。
我见过好多三十出头年轻科研人,做完标杆对比,直接发现原来的路线全是红海,转身扎进没人碰的盲区,没五六年就做出来了能卡脖子的成果,也见过一堆老团队抱着几十年前的老标杆不放,天天追着人家的屁股跑,追来追去,方向都换了,钱也花完了,什么都没留下。
做科研,本来就是走别人没走过的路。标杆对比只是工具,不是紧箍咒。你拿对了尺子,能量得准自己的长短,也能看得见没开辟的新路,这才是真的会用这个工具。