
昨天,阿里联合中国人民大学高瓴人工智能学院,搞了个大动作——开源了一个叫LOGOS的科学大模型。这个模型很特别:它用一个统一的“语法”,把蛋白质、小分子、DNA这些原本八竿子打不着的科学对象,全都翻译成了大模型能理解的同一套语言。
最炸裂的是,LOGOS-1B版本只有10亿参数,但在好几个核心任务上,竟然干翻了微软那个参数量高达8×7B(约560亿)的NatureLM模型。换算一下,阿里用的参数只有微软的五十六分之一,效率高得离谱。
这模型到底怎么做到的?
过去,科学家研究蛋白质要看一个模型,研究化学分子又要换另一个模型,不同环节还得来回折腾微调。LOGOS直接打破了这个局面。它先建了一个覆盖生物大分子、化学实体、界面互作等7类模态的超级语料库,总共44.87亿个token。然后,它设计了一个共享词表,把蛋白质、小分子这些原本结构各异的东西,统统编码成统一的离散Token序列。
这就好比,原来英语、日语、法语的人各自说各自的语言,现在LOGOS发明了一本“世界语词典”,大家都能用同一种符号交流。而且,它甚至不需要输入复杂的3D坐标——靠预测序列,就能在脑子里“想象”出分子之间怎么互相勾搭。这有点像人类读小说就能在脑中构建场景,不用看3D模型。
更重要的是,LOGOS的训练数据和实际应用场景是高度一致的。以前,预训练一个模型,到具体任务上还得配一堆适配层;现在LOGOS的输入输出格式天然对齐,拿来就能直接用,省掉了大量微调功夫。
阿里已经把模型权重、推理代码和技术报告全都开源了。这意味着,任何实验室、任何公司,都能直接上手用这个“科学万用模型”。下一步,也许科学家们不用再为不同任务准备不同模型了,一个LOGOS就能承包从药物设计到生物合成的大部分活。这可能是科学计算领域一个不大不小的转折点。