
字节跳动正在酝酿一个大动作:训练一个参数量超过5万亿的大模型。真要成了,这将是国内已知规模最大的模型,没有之一。不过项目还在早期阶段,最后不一定能落地。
为什么是5万亿?因为国产大模型的参数规模正在一路狂飙。阿里的Qwen3.8Max已经跑到2.4万亿,月之暗面的Kimi K3也有2.8万亿。再往上迈一步,就是5万亿的门槛。这个量级什么概念?相当于GPT-5.6或者Opus5的水平。参数越大,模型越聪明,OpenAI和Anthropic能保持领先,靠的正是更大的参数规模。消息说,这两家已经在内部准备甚至训练10万亿参数的模型了。
但个头越大,胃口也越大。算一笔账:训练一个5万亿参数的大模型,用10万块H100显卡,得连续跑347天;或者用100万块显卡,跑35天。100万卡是什么概念?已经跨进GW级算力,不是随便哪家公司能拿得出来的。字节虽然有钱,也不可能一把梭哈。更现实的玩法是:先上20万到30万张显卡,训练3到4个月,再加上数据准备、后训练这些环节,至少得花上大半年甚至一年。
论算力储备,谁的底气最足?还是OpenAI。据SemiAnalysis测算,OpenAI手里大约有200万张显卡。Anthropic有62万张。DeepSeek只有6万张左右,而且不少还是H20、H800这类相对落后的型号。字节的财力跑一个5万亿参数模型,倒是不成问题。真训出来了,豆包的能力做到GPT-5.6或Opus5级别,基本没什么悬念,智商
精选评论
评论加载中…