开放数据平台:为什么说它是科研圈的下一代基础设施
上周跟一个做环境遥感的博士吃饭,他拍桌子说,为了拿某流域十年的水质监测数据,磨了三个月,找了三个单位,最后只拿到三年的脱敏数据,还不能公开用在论文里。
很多人都有这经历。做科研做到头,被数据卡脖子,卡得进退不得。对吧?
科研人被数据卡脖子的日子,真的受够了
以前做科研,数据就是话语权。谁有数据谁就能发好文章,小课题组没钱没人脉,连入门的门都摸不到。我之前帮一个年轻老师审基金,他做城市社会学,想研究不同社区的流动人口变化,需要更精细的人口数据,找了半天,要么买不到,要么精度不够,最后差点改了研究方向。
说实话,这种事儿太常见了。国内这些年论文数量涨得飞快,但真正能复现的研究有多少?很大一部分原因就是数据不公开,别人想验证结论都拿不到原始数据,整个领域的创新速度都被拖慢,数据垄断的墙,把太多有想法的年轻人挡在了门外。
科研人员查找开放科研数据网页截图
改变是从最近五六年开始的。越来越多的国家级开放数据平台建起来,越来越多的期刊要求数据公开,这层窗户纸,终于被捅破了。
现在的开放数据平台,早就不是放文件的仓库了
前两年我去参加一个数据科学的年会,听到国家天文开放数据平台的分享,吓了一跳。郭守敬望远镜积累的上亿条天体光谱数据,全部免费对全球开放,任何人只要注册就能下载,不用打招呼不用写申请,更不用托关系找人签字。去年FAST也开放了一批脉冲星观测数据,好多民间天文爱好者都靠着这批数据挖出了新的脉冲星,这放在二十年前提都不敢想。
郭守敬望远镜开放天文数据平台主页截图
不止天文领域。生命科学里,国家基因组科学数据中心,开放了上百万份人类基因组测序数据,做遗传病研究的课题组不用自己花大几百万测序,直接拿现成的数据就能做分析,省下的钱能多养两个博士生。
说实话,这种改变是颠覆性的。以前大课题组垄断数据的日子,正在慢慢过去。一个刚毕业的年轻博后,只要思路够好,就能用开放数据做出顶刊级别的研究。我去年就看到一篇论文,通讯作者是双非院校的青年教师,整个研究只用了开放的全球植被遥感数据,发了Nature子刊,全部研究成本才几万块,换十年前,根本不可能。
不过话说回来,现在的开放数据平台也不是没毛病。很多平台数据上传了就没人维护,过两年链接失效,找都找不到。还有些数据标注混乱,你花了一天时间下完几个T的数据,打开一看根本不是你要的东西,白忙活。还有版权模糊,有些数据说是开放,其实只能看不能用在商用项目,甚至发论文都要提前申请授权,一不小心就踩坑。
开放数据平台的未来,核心不是开放,是服务
开放数据平台的未来,核心不是开放,是服务
现在业内都在喊开放数据,喊得很多,但很少有人提,开放之后的服务才是真正的核心。你把一堆杂乱无章的原始数据扔上去,用户不会搜不会用,等于白放。
做得好的开放数据平台,不仅给数据,还要给工具,给教程,甚至给现成的分析流程。我见过国内做得不错的国家科学数据云,已经上线了在线分析功能,你不用把几个T的数据下载到自己的服务器,直接在平台上就能跑模型,省了不知道多少存储和带宽成本,对普通课题组来说,这简直是救命的福利。
还有绕不开的数据质量问题。现在开放数据越来越多,鱼龙混杂,你拿到一组数据,根本不知道它准不准,不敢随便用在论文里。所以未来开放数据平台得做分层的质量认证,哪些是经过同行审核的,哪些是原始采集的,哪些是二次加工的,给用户标得明明白白,大家用起来才放心。
还有隐私问题。很多涉及个人信息、敏感领域的数据,不能直接开放。现在联邦学习、隐私计算这些技术成熟了,能不能在开放数据平台上实现可用不可见的数据共享?就是用户能用数据做研究训练模型,但拿不到原始的个体信息,既解决了数据开放的需求,又保护了隐私安全,这才是能走长远的方向。
我最近跟一个做开放数据平台运营的朋友聊天,他说现在国内最遗憾的不是没有开放数据,是很多科研人员根本不知道这些平台存在,还是习惯性到处托人求人要数据,很多高校开科研方法课的时候,根本不教怎么用这些免费的开放资源,学生做毕设还在自己瞎找数据,太浪费了。
说白了,开放数据平台不只是一个放数据的仓库,它是整个科研体系的核心基础设施,就像二十年前的互联网,刚出来的时候没人觉得它能改变什么,等到所有人都用上了才发现,整个科研的规则都变了。
你要是正在做科研,现在就去搜搜跟你领域相关的开放数据平台。说不定你卡了大半年的问题,别人早就把整理好的数据放在那儿了。
真的,推开门才知道,外面的天已经宽了好多。