
6月18日,阿里通义实验室联合中国人民大学高瓴人工智能学院,开源了一个叫LOGOS的科学大模型。这模型只有10亿参数(1B),但在多个科学任务上,居然干翻了参数多56倍的巨无霸NatureLM(8×7B)——凭什么?
秘密在于它首创的“科学语法”。以前,AI研究科学就像“一人一个翻译”:研究蛋白质的模型看不懂分子,搞材料的模型听不懂化学反应。LOGOS则把自己的“语言”统一了——它把蛋白质、小分子、材料、化学反应这些乱七八糟的“科学对象”,全翻译成同一套离散的Token序列。就像把英语、法语、德语都转成同一套二维码,模型只要学会扫这个码,就能理解所有科学问题。
更厉害的是,它不需要稀缺的3D坐标数据,也不用专门的几何神经网络,只靠序列预测就能搞懂分子怎么在三维空间里“互动”。这相当于让一个只会读文字的AI,学会了看立体电影——而且比专业人士看得还准。
测试结果扎心了:在口袋条件配体生成、逆合成预测(Top-1准确率74.8%)、口袋位点识别(HOLO4K数据集Top-n准确率58.5%)、MOF材料生成(新型构建单元比例提升76%)等6大任务上,LOGOS-1B全部匹配或超越了传统领域专用模型。比如在逆合成预测上,它猜化学反应的步骤,比很多专门搞这行的老模型还准。
最狠的是,它继承了现有大语言模型(如LLM)的预训练权重,可以直接使用vLLM推理加速、模型量化这些成熟的工程工具。这意味着科学家不用重新造轮子,拿来就能用。
通义实验室说,这打破了AI for Science领域“一个任务一个专家模型”的割裂现状。以前科学家想设计一个新分子,可能需要先训练一个模型预测分子性质,再训练另一个模型合成路径。现在,只要告诉LOGOS“我要一种能治疗XX病的分子结构”,它就能自己倒推出最可能的合成路线。
目前,LOGOS的模型权重、推理代码和技术报告已经全球开源。这意味着,任何实验室都能下载它,用它来设计新材料、预测化学反应、甚至发现新蛋白质——从“大海捞针”变成“按需设计”。
一句话总结:科学家的好日子,可能真的要来了。