
前OpenAI研究员田永龙加入了腾讯,预计将担任混元多模态模型负责人,主攻视觉语言模型(VLM)研发。消息还没正式官宣,但圈内已经炸开了锅。
田永龙可不是普通人。他本科从清华毕业,在香港中文大学MMLab读完硕士,又跑到麻省理工学院(MIT)拿了博士。在学术界,他的Google Scholar引用量快3万次了。他提出了“有监督对比学习”,就是把对比学习这套方法用到了带标签的场景里,对视觉预训练模型的影响很大。
最近,他在自回归图像生成这块发力,尤其是Fluid系列的研究,证明了连续token在视觉质量上更胜一筹,给大模型生成能力开了新路子。
来腾讯之前,他在Google Research和Google DeepMind干过,后来才去的OpenAI。这下,他和现腾讯首席AI科学家姚顺雨——两人曾在OpenAI共事——又聚到一起了。
腾讯混元多模态团队最近动作频频。今年4月,腾讯新设了大语言模型部和多模态模型部,从微软、阿里、清华挖了一波人过来,就是想改变过去资源散落的局面。田永龙一来,腾讯在视觉感知和多模态这块的研发实力估计又要往上窜一截。
说白了,这是腾讯在AI赛道上加速奔跑的信号。多模态模型——特别是让AI能看懂图片、视频并理解文字——是下一代AI的重头戏。从引进姚顺雨到田永龙,腾讯正在把一块块人才拼图凑齐,野心不小。
精选评论
评论加载中…