当前位置:首页 > 科研成果库

从大模型卡脖子到科研提速,高效能计算平台到底改对了什么

2026-09-16 15:09:59小研科研成果库7
上个月跟所里做算力调度的老陈喝茶,他拍着桌子骂了半小时三年前的旧算力平台。那时候所里接了个百亿参数大模型的横向项目,全所人盯着十几张老GPU排队,好不容易排到队,硬盘突然崩了,跑了半个月的数据全没了。项目 deadline 就在眼前,一群人熬夜连轴转了一个星期才救回来,头发掉了一大把。

很多科研卡壳,根本不是算法不行,是算力跟不上

现在不管是AI大模型训练,还是创新药靶点筛选,甚至是极端气候模拟、航空发动机气动设计,哪个不是吃算力的老虎? 之前国内很多科研团队和中小科创公司,处境都很尴尬。要么掏不起超算的高额使用费,要么咬咬牙自己攒了一堆GPU,结果算力利用率不到20%——大部分时间卡都在那儿晾着,有电费掏着,没人用,纯属浪费。 国内科研机构高效能计算平台机房实拍国内科研机构高效能计算平台机房实拍 我之前听一个药企的朋友说,他们前几年筛一个肺癌靶向药的潜在靶点,用公司自己攒的小集群,跑一次完整的分子对接模拟要整整三个月。等结果出来,竞品同方向的论文都发出来了,差点把整个项目砍了。后来换了公共的高效能计算平台,不到一周就跑出了结果,直接把整个项目的推进速度提了十几倍。 你说这差多少?三个月啊,整个创新赛道的窗口期都错过了,还谈什么突破。

高效能计算平台的核心,从来不是堆硬件

说实话,很多人对高效能计算平台有误区,觉得不就是多买几张顶级GPU,堆在一起就行?完全不对。 堆硬件谁不会?难的是把一堆分散、不同型号的算力,整合成一块能让普通人顺手用的资源。老陈他们团队去年给某高校改算力平台,光是调度算法和资源切分这块优化,就把整体算力利用率从不到28%拉到了72%。什么概念?同样是100张顶级GPU,原来只能同时跑2个大模型训练任务,现在能跑5个,还不会出现任务排队崩掉的情况。 国产高效能计算平台管控系统界面实拍国产高效能计算平台管控系统界面实拍 不过话说回来,现在硬件卡脖子是事实,但能把手里现有的硬件用到极致,本身就是很了不起的突破。很多国外排名靠前的超算,看起来唬人,实际给普通科研团队用的时候,排队排一两个月都是常事,很多小项目根本排不上队。我们现在做的高效能计算平台,很多都是冲着实际使用场景去的——给青年科研团队留优先调度配额,给初创公司做弹性算力租赁,用多少付多少钱,不用一下子掏几百万买卡,一下子就把入场门槛拉下来了。 之前认识一个做AI生成内容的创业公司CEO,跟我吐槽前几年的糟心事:刚融了一千万天使轮,一半砸进去买了GPU,剩下的钱发工资都紧巴巴,结果买的卡大部分时间闲着,只有训新模型的时候才用,这不就是纯纯的资源浪费?现在他们把所有训练任务都迁到了高效能计算平台,按调用量付费,整体成本直接降了三分之二还多,省出来的钱能多招三个算法工程师,这不香吗?

下一轮科技竞赛,高效能计算平台是核心底座

下一轮科技竞赛,高效能计算平台是核心底座下一轮科技竞赛,高效能计算平台是核心底座 现在ChatGPT能一路狂奔,背后就是OpenAI搭建的那套成熟的高效能计算体系撑着。不管是反复迭代模型,还是测试新的算法方向,都能快速拿到结果,试错成本降了不知道多少。 我们国内现在要拼大模型、拼创新药、拼可控核聚变、拼深空探测,哪一样离得开这个底层算力底座?去年中科院紫金山天文台处理暗物质粒子探测卫星的数据,原来用旧平台处理一次完整的数据分析要大半年,现在换了新的高效能计算平台,不到一个月就能出初步分析结果,多少科研项目就是差这一口气——早出结果就能早抢发论文,早落地转化,一步快步步快。 当然,现在也有不少歪风,一味追求超算TOP500的排名,堆了一堆高端硬件,实际普通科研工作者用不上、用不起,摆着当面子工程,真的没意义。真正好用的高效能计算平台,是给一线干活的人用的:你是博士生要训模型,点两下就能提交任务,不用托关系找管理员排队;你是药企研究员要筛化合物,输完参数该开会上会该改方案改方案,到点收结果就行,不用天天盯着服务器怕断电怕崩任务。这才叫真的有用。 上个月我去参观长三角某个国家级的高效能计算平台,进门就看见大厅的电子屏上,上百个任务在同时跑:有农科院做水稻育种的基因分析,有航天院所做航天器返回的气流模拟,甚至还有旁边美院做AI生成艺术模型的训练任务,连本地一个只有三个人的AI初创公司都排上了队,收费比自己攒机器便宜一半还多。 那时候我就觉得,这才是高效能计算平台该有的样子。不是放在那儿供人参观的花瓶,是真的能让各个领域的创新者都用得起、用得爽的工具。 现在所有人都在炒AI、炒大模型,都盯着上游的芯片、下游的应用,很少有人提中间这个算力底座的事儿。但实际上,没有好用的高效能计算平台,你算法再牛,芯片再好,也没办法低成本快速试错,出成果的速度自然上不去。 之前有个做多模态大模型的青年研究员跟我说,他们团队原来每周只能跑4次消融实验,现在用新的高效能计算平台,一天就能跑4次,整个团队的迭代速度直接翻了四倍。创新这东西,本来就是试出来的,你试错的速度快了,出突破的概率自然就大了。 今年接下来,还能看到更多领域因为高效能计算平台发生变化:原来没人敢碰的大项目,现在小团队也能进场玩;原来要做三五年的研究,现在一年就能出结果。整个科技领域的创新速度,都会被这个底座悄悄提上来。不信咱们走着瞧。