您当前的位置 :浙江在线 > 浙江新闻 > 浙江纵横 正文

科学数据:AI变革的下一个推动力

字体:
—2026—
09/04
06:50:03
2026-09-04 06:50:03 来源:浙江在线-浙江日报 王坚 记者 肖国强 周宇晗参与整理

  浙江在线9月4日讯(王坚 记者 肖国强 周宇晗参与整理)什么将成为人工智能变革的下一个推动力?

  我认为,答案就藏在“科学数据”里。这里说的数据,不是文本,不是代码,甚至不是语音、图像、视频等简单的“多模态”,而是科学观测、实验与测量留下的原始记录。这些是远远没有被人工智能开发利用、却蕴含着丰富信息的珍贵资源。我们常说,“一段光谱胜过千万张图”,地学领域超过70%的关键信息存在于原始观测信号中;DNA、蛋白质结构中蕴含着大量生物学信息,远超人类想象。

  当下的大模型,实际上主要指的是大语言模型,它们把人类处理文本的能力提升到了前所未有的高度。但文本远不能表达科学的全部,光谱、地震波、DNA序列……本质上都不是文本。现在很多AI4S(人工智能驱动的科学研究),其实仍停留在让模型阅读论文这一步,文本依然是处理的核心,而不是科学数据本身。要驱动真正的科学发现,人工智能模型就必须直接理解原始科学数据。

  现阶段,在模型眼中,科学数据千差万别、结构各异,彼此之间几乎没有通用的表达方式。未经加工的科学数据就像稻谷,需要用非常高明的手段“脱壳”(Token化),里面的“米粒”才能被“投喂”给科学模型。这件事情的挑战极大,例如,AlphaFold从1.0升级到3.0,仅仅生物领域蛋白质结构的“脱壳”方案设计和验证就走过了6年历程。而实现科学领域的全面突破,更是任重道远。

  3年前,之江实验室看到了科学数据对人工智能变革科技创新范式的重要性,下决心研发一个具有通用性的科学基础模型。后来我们把它命名为“021”,读作zero to one,意指从0到1,希望让科学数据成为基础模型的“原住民”。

  当模型不止步于处理文本信息,而是学会直接“读懂”科学数据时,那些过去我们习以为常的数据,可能会显现出不同的面貌,这种“异常”会颠覆式地推动科学发现。我印象很深的一个例子是:之江实验室团队用模型预测化学分子的沸点,发现结果与手册不一致。逐一验证后,竟然是沿用了超过70年的手册数据本身可能有问题。这一发现,8月初被《自然》杂志报道。再如,我们与南京大学沈树忠院士合作,基于地学领域的十万个物种化石、近两万个的地质断层数据,研发了地层学模型OneStrata,形成统一时间轴,希望把地质时间精度从百万年量级提升到万年量级。

  科学基础模型最终让我们把科学作为一个整体来认识世界。事实上,科学之间的边界本来就是由人的认识边界造成的,如把科学分成一个个不同的学科。而科学基础模型能把不同领域的科学数据完整地放进一个模型,在统一高维空间去发掘它们之间的潜在关联,这或许会给出任何单一学科都给不出的答案。我们的科研团队以固态电解质材料设计为案例,“021”科学基础模型不但可以从材料学的角度提供解决思路,还能从物理、化学、生物学甚至地球科学、天文学等看似完全不相干的学科角度提供建议,最后再回到模型中验证材料结构、性能等。

  经过这几年的探索,我们已经完成了2360亿参数规模的“021”科学基础模型的训练,这个过程让我也越来越感受到:在文本和代码之后,人工智能的发展正在进入一个以科学数据为主推动人工智能发展的新周期。我认为,未来3到5年,甚至10年,推动人工智能变革的关键将是科学数据。

  这次人工智能引起的范式变革让我们常说的STEM教育科研模式,即Science(科学)、Technology(技术)、Engineering(工程)和Mathematics(数学),变成了“STE+MAP”,这里的MAP指的是Mathematics(数学)、Artificial Intelligence(人工智能)和Public Good(公共产品)。人工智能变得像数学一样基础,把科学、技术和工程贯穿起来。在这个体系中,最大的前提是开放:如果不开放,所有的发展最终都会停留在传统学科的小圈子里;相应地,谁能更快把开放数据变成新的科学发现,谁就掌握了先机。对中国的科研和人工智能工作者来说,这是一道考题,更是一个机会:把开放数据、开放模型和开放设施真正做成科技公共产品,让更多人能够参与进来,让更多科学数据从“沉睡的资源”变成“鲜活的发现”。


版权和免责申明

凡注有"浙江在线"或电头为"浙江在线"的稿件,均为浙江在线独家版权所有,未经许可不得转载或镜像;授权转载必须注明来源为"浙江在线",并保留"浙江在线"的电头。

标签:AI责任编辑:蒋旭辉
融媒产品
浙江宣传
小新说
群众工作室
90早新闻
精品专题
更多资讯