Skip to content
难度LEVEL★★★★★
阅读READ约 3 分钟~3 min
更新UPDATED2026-09

第 3 章 一个模型的多种身材 · 蒸馏与 LoRA

easycode · Agent Skill

打开任何一家的模型列表,都是一个家族,一个大块头旗舰,配几个又快又便宜的小号。为什么不干脆只出最强的那个?能力、速度、价格三样不可兼得,大模型每个 token 都更贵更慢。这一章认识两门改变身材的手艺,落点是一件很实际的事,怎么给不同的任务,配不同身材的搭档。

第一门,蒸馏(Distillation),大模型当老师。训练一个小模型时,让它大量学习大模型的输出,老师怎么答,学生照着学,原始互联网退居次要教材。学生的脑容量小,装不下老师的全部,但能学到老师最常用的本事。结果是一个便宜十倍、快好几倍、日常任务够用的小号。模型家族里那些 mini、小杯,常常就是这么来的,各家具体配方不公开,但原理相通。

第二门,LoRA(Low-Rank Adaptation),不重训,打补丁。想让模型学会一种新腔调、一个专门领域,从头重训贵得离谱。LoRA 的思路是冻结原模型的全部参数,只在旁边训练一小片"补丁",运行时把补丁贴上去。补丁只有原模型的千分之几大,一张消费级显卡就能训,还能随贴随换。开源模型社区里满天飞的"某某微调版",多数是 LoRA 补丁。各平台的"微调"服务,原理同族。你大概率不会亲手训一个,但从此看见"微调模型"四个字,知道那是什么了。

顺带认识一对词。开放权重(Open Weights)模型可以整个下载到自己机器上跑,最小的那些,ForgeCard 那台树莓派都跑得动,慢,但真的能跑。闭源模型只能通过 API 调用。自己跑,数据不出门,也没有按量账单,但要自己养机器。第四册第 10 章那道"账单形状"选择题,在 AI 上原样重演。

现在落到实处,选模型是一种账单思维,第四册第 10 章的直系延伸。原则一句话,难题用大杯,量大用小杯。架构设计,疑难 bug,一次要对的事,上旗舰。批量翻译,格式整理,简单问答,小号绰绰有余。第 1 章说过按 token 计费,同样的任务量,模型选对,账单差十倍。

出事时想起我

AI 账单突然变陡,查是不是所有杂活都在用最大杯。小模型在难题上开始胡说,是身材不够,换大杯重问,它没有坏。

关键领悟

模型是一族,各有身材。蒸馏解释了小号从哪来,LoRA 解释了"微调版"是什么。你的功课只有一条,按任务配身材,难题大杯,量大小杯。

试一试

翻出你最近一周让 AI 干的活,分成"必须最强"和"够用就行"两堆,估算一下如果第二堆全换小号,账单形状会怎么变。

由 Charles Tao 与 Claude 协作写成——这本身就是这套书讲的工作方式。Written by Charles Tao with Claude — which is itself the working method this series teaches. · 许可License