← Garden of Thoughts
July 28, 2026 ai deep-learning gradient-descent backpropagation neural-networks

Garden of Thoughts | SherryAnalytics | 2026年7月28日


训练大模型,是不是要试遍几千亿个参数的所有组合?

副标题: 不是穷举,是一个眼里有活的调酒师。

有朋友问,那些大模型烧钱烧时间地训练,是不是要把几千亿个参数的所有组合都试一遍?

先看看这个数字有多离谱

假设每个参数只有两种取值——这已经是最简化的情况——1000 亿参数(也就是训练要烧大钱的那种规模)的组合数是 2^100,000,000,000。而可观测宇宙里的原子总数,撑死了也就 10^80 个。

穷举不是"慢",是压根不在我们这个宇宙的量级里。更夸张的是,根本不需要 1000 亿个参数才能把穷举逼到墙角——仅仅 266 个二值参数,组合数就已经超过 10^80。换句话说,哪怕是个玩具网络,穷举法从第一天就已经死了。

调酒师救场

训练真正在做的事,更像一个调酒师调酒,而不是把所有配比挨个试一遍。他倒一杯,尝一口——"太苦了"——这一口同时告诉他两件事:往哪个方向调,大概调多少。少放一点浓缩、多加一点奶,再尝一口。几轮下来就调到位了。

训练神经网络走的是同一个循环:

这一整套合起来叫梯度下降(gradient descent)。关键在于反向传播用的是微积分:它能一次性算出,这 1000 亿个参数里,每一个该往哪个方向挪、挪多大——不是挨个试出来的,是一次性解出来的。这正是大学微积分课上链式法则(chain rule)的用武之地。

那钱到底烧在哪

如果烧的不是搜索组合的钱,那烧在哪?烧在"重复次数 × 每次计算量":在几万亿个 token 上,把"尝一口、调一调"这个循环重复几百万次,每一次都要动一遍这 1000 亿个数字。

这是一场极其漫长的体力活,不是一场地毯式搜索。

结语: 训练大模型贵,贵在算了很多很多遍,而不是贵在试了很多种可能。


想法、大纲和论点:我的。我请 Claude 帮忙打磨了文字。

延伸阅读