
6月18日,阿里和中国人民大学联合开源了一个叫LOGOS的AI模型。它干了一件大事:给科学家们造了一把“万能钥匙”,让蛋白质、小分子、复杂材料这些原本“语言不通”的研究对象,终于能互相交流了。
以前,不同领域的科研数据就像一个个封闭的小岛。研究蛋白质的用一套3D坐标,研究材料的用另一套几何公式。想让它们对话?得像翻译官一样折腾,换一个研究环节就得重新设计模型,费钱又费时间,搞得很多科研人员头疼不已。
LOGOS的核心创新,就是打破了这种“语言隔离”。它设计了一套共享“单词表”——把蛋白质、抗体、小分子、MOF材料(一种多孔材料,用来储存气体或催化反应)这些样子完全不同的东西,都变成统一的离散字符序列。模型不再需要昂贵的3D空间坐标,而是像读文章一样,通过一串串“文字”预测出它们之间的空间相互作用。简单说,就是把复杂的立体问题,变成了“语文题”。
效果有多炸?LOGOS-1B版本只用微软NatureLM模型1/56的参数量(相当于别人用56个工人干的活,它只用1个),就在多个关键科学任务上取得了更好成绩。而且它天生就能直接生成新结构,不需要科学家再花时间做繁琐的“微调适配”。对科研人员来说,这等于拿到了一个即开即用的“科学工具箱”。
目前,LOGOS已经吃下了覆盖7种数据类型的44.87亿个“词语”(tokens),并把这个“智慧”完整开源在HuggingFace和GitHub上。任何实验室都能免费下载使用。
一个科学界的通用语言正在形成。当AI不再需要为每个研究领域单独学一门“方言”,科研自动化的速度可能会超乎想象。未来,一个分子设计师和一个材料科学家,或许可以对着同一个模型说,“帮我设计个既能抗癌又能储氢的东西”——而模型也能听懂了。
精选评论
评论加载中…