
科学家们过去有个头疼的问题:蛋白质、小分子、新材料这些研究对象,在AI眼里就像不同国家的人说不同的语言,数据根本无法互通。现在,一个叫做LOGOS的模型打破了这堵墙——它让所有科学对象都说同一种“语言”。
6月18日,阿里ATH-Token Foundry联合中国人民大学高瓴人工智能学院正式开源了这款名为LOGOS的多领域科学生成基础模型。以前,为了分析蛋白质的结构、小分子的特性或复杂材料的性能,研究人员得依赖复杂的3D坐标和专门的几何神经网络,换个研究对象就得重新设计模型,费钱又费力。LOGOS的核心创新,就是设计了一套共享词表,把蛋白质、抗体、小分子甚至MOF材料这些原本互不相干的对象,统统编码成统一的离散Token序列。这意味着,模型不再需要昂贵的3D空间信息,而是像读文字一样,通过序列预测的方式直接构建出复杂的3D空间互作规律。
更让人惊讶的是参数效率。LOGOS-1B版本只用了微软NatureLM模型1/56的参数量,就在多项代表性科学任务中实现了超越。换句话说,它用更少的资源干出了更好的活儿。而且,LOGOS彻底解决了预训练与下游任务之间的“目标偏差”问题——以前模型学完通用的东西,还得针对具体任务再微调,麻烦得很。现在LOGOS可以直接激活生成能力,科研人员拿到手就能用,开发门槛大大降低。
为了训练这个模型,团队构建了包含7类模态、共计44.87B tokens的超大规模预训练语料库。目前,项目组已经把模型权重、推理代码和技术报告全部开源,开发者在HuggingFace或GitHub上就能下载使用。这一成果不仅为科研自动化装了强力引擎,也预示着未来多模态科学大模型的新方向——当所有科学对象都能用同一种“语法”对话,AI驱动科研的想象空间才真正打开。
精选评论
评论加载中…