
停更13个月后,前OpenAI安全研究副总裁、现Thinking Machines Lab联合创始人翁荔,在个人博客上丢出一篇万字长文,标题就叫《Scaling Laws, Carefully》。她自己都承认:“这篇东西迟到了三年多。”但读完的人,大多笑不出来了——因为文章的核心结论,直接戳破了行业里几百亿美元烧出来的共识:你的模型可能从一开始就喂错了数据。
故事得从2020年说起。OpenAI的研究员Jared Kaplan发了一篇论文,画了个漂亮的幂律曲线:模型参数越多、数据量越大、算力越强,训练损失就会跟着下降。他给出的结论是——模型规模应该比数据增长更快。GPT-3就是照着这个思路造的:1750亿参数,但训练数据只有3000亿个token,明显是参数多、数据少。
两年后,DeepMind团队做了更大规模的实验,把Kaplan的结论彻底推翻。他们搞了两个模型:一个叫Gopher,2800亿参数;另一个叫Chinchilla,参数只有前者的四分之一,但训练数据是前者的四倍多。结果呢?Chinchilla在所有评测里碾压Gopher。新规律是:参数和数据应该等比增长,最佳比例大约是1:20。也就是说,Kaplan那条让参数飙涨、数据慢跑的路径,其实是错的。
这也解释了为什么后来像Llama、DeepSeek这样的模型,参数没GPT-3那么大,但性能却远胜于它。数据量上去了,效果自然就出来了。
翁荔在文章里仔细分析了Kaplan错在哪。第一,Kaplan实验的最大模型只有15亿参数,这点规模在小范围里拟合得不错,但外推到万亿级别时,偏差就变成了系统性错误。第二,Kaplan在计算参数时排除了embedding层,而这一部分在小模型上影响极大——相当于用一把不准的尺子量了两年。更离谱的是,2024年Epoch AI团队逐行复现Chinchilla的拟合代码时,居然找到了两个bug:一个是因为损失函数取了均值而非求和,导致优化器误判收敛点;另一个是核心幂律指数被四舍五入到两位数,产生了虚假精度。修正之后,数据再次证明:等比增长才是对的。
但问题远不止于此。上述所有讨论,都建立在一个前提上:训练数据无限且从不重复。可现实是,高质量文本数据预计在2026到2028年就会枯竭。研究显示,重复数据的有效价值是指数衰减的——每多训练一轮,边际收益就急剧下降。翁荔还在文章里嵌入了一个交互式模拟器,直观展示出工程细节的敏感性:仅调整一下拟合精度或噪声水平,外推预测就能差出十万八千里。
翁荔最后写道:“Scaling Laws不是物理定律,它是对工程细节高度敏感的观测性指南。”这句话,是她三年思考的总结。对从业者来说,这更像一声警钟:别再用过时的配方烧钱了,数据配比这件事,得从头算起。