
从OpenAI空降腾讯的姚顺雨说过一句话:“做大模型其实并没有什么秘密。”当时外界多半当他是客套。但腾讯混元4(Hy4preview)最近用一份实打实的答卷,把这句话从“谦虚”变成了“事实”。
四个月,腾讯完成了混元大语言与多模态部门的重组,推出了770B参数、支持百万上下文的混元4。这背后不是玄学,而是一套极其务实的拼图游戏:开源机制、人才迁徙,以及一套被验证过的工程共识。
混元4的“底层骨架”直接对齐了国内此前由智谱GLM-5(744B)跑通的工程最优解。700B这个中大规模档位,主干网络隐藏维度6144、78层、64个注意力头——这些数字像是一张可供参考的设计图纸,让腾讯绕开了前人踩过的坑。
注意力模块的融合更为巧妙。它主干借鉴了DeepSeek在V3.2开源的稀疏注意力机制(DSA),用轻量级索引器在超长上下文中筛选Top-K Token,不必遍历全部历史。然后吸收了智谱团队IndexCache验证的跨层索引复用,让相邻Transformer层直接复用已有索引结果,最高砍掉75%的索引器计算量。残差侧则放弃了复杂的mHC,改用微软研究员谢天公开讨论过的恒等超连接(iHC)方案。每一步都站在别人肩膀上。
技术接力的背后,是顶尖人才的深度流动。清华姚班毕业、曾担任智谱GLM-5新架构及DSA负责人的白雨石,已在数月前加入腾讯混元团队,名字出现在混元长上下文稀疏注意力论文的作者栏里。隐性工程经验就这样完成了从一家企业到另一家企业的物理迁徙。
如今,任何能通过论文、代码和实验数据表达出来的技术优势,独占期都在急剧缩短。从顶会论文到开源代码,再到社区热议的讨论帖,前沿架构的传播路径已彻底扁平化。腾讯混元4证明了,大模型真正的护城河,可能从来就不在技术本身,而在谁能更快地吸收、融合、落地——而这道护城河,正在被开源生态与人才流动迅速填平。