Garden of Thoughts | SherryAnalytics | 2026年7月28日
副标题: 老师很贵,学生很便宜。
有朋友问 AI 模型蒸馏是怎么回事,我试着解释一下。
蒸馏的做法说穿了很朴素:找一个已经很强的大模型当"老师",海量提问,把回答——尤其是推理过程(chain-of-thought)——收集下来,筛掉错的,拿这批数据去微调自己的"学生"模型。学生从没摸过老师的权重(weights),它只是从前门用 HTTPS,一遍遍地问问题、抄答案。
这不是纸上谈兵。今年二月,Anthropic 披露了一起规模不小的案例:约 24,000 个伪造账号,向 Claude 发起超过 1,600 万次对话,横跨数周到数月,矛头直指 DeepSeek、Moonshot、MiniMax 三家。Google 也在同期报告过针对 Gemini 的十万级 prompt 采集,试图"复制"它的推理逻辑。
老师那身本事,是拿钱和时间堆出来的:多年的 RLHF(人类偏好标注)、RLVR(可验证奖励强化学习)、专家标注、沙箱环境、海量 rollout 算力——每一分投入都实打实。但这些投入最终只能以"文字"的形式从 API 里流出来。学生不需要重走这条路,只要把答案收好,微调一下,几年的功夫就搬回了家。
这就是为什么蒸馏总让原创模型的公司如鲠在喉:护城河烧的是真金白银,抄的却只是电费和几台服务器的时间。
结语: 蒸馏本身是个正经的机器学习技术,问题从来不出在"蒸馏"两个字上,而出在没打招呼就去蒸馏别人。
想法、大纲和论点:我的。我请 Claude 帮忙打磨了文字。