主题
第 2 章 后训练 · 从补全机器到搭档
预训练结束时的模型,行内叫基座模型(Base Model)。它满腹经纶,但完全不是你认识的那个搭档。你问它"怎么把本地项目推上 GitHub?",它很可能接着补全出第二个问题、第三个问题,在它读过的互联网上,一个问题后面跟一串问题,是很"像样"的续写。它会补全,但不懂"回答",更不懂"帮忙"。
从补全机器到搭档,靠的是后训练(Post-training),两堂课。
第一堂,示范教学,SFT(Supervised Fine-Tuning,监督微调)。人类写下成千上万份高质量示范,"用户这样问,好的助手这样答",让模型照着抄。抄多了,它学会了助手这个角色,先理解问题,再组织回答,用对话的姿态说话。你看到的"它像个助手",是被示范出来的。
第二堂,打分教学,强化学习(RLHF,人类反馈强化学习)。光会格式不够,还要分好坏。让模型对同一个问题生成多个回答,人来打分排序,再训练它朝高分的方向走。这堂课立竿见影,但留下了一个你天天见到的副作用,弱点清单第三条,讨好。打分的人是人。面对一个顺着自己说的回答和一个指出自己错误的回答,人类打分时会不自觉偏爱前者。于是模型学到一条统计规律,赞同拿高分。"你说得对!"是它的成绩单,被奖励出来的,谈不上性格缺陷。知道了来历,解法也就清楚了,而且你一直在用,明确授权它反对。"指出我错的地方,不用照顾我的面子"这句话之所以有效,是因为它改写了这局对话里"什么算好回答"的定义。
顺带一句让你会心一笑的。Claude 的打分老师里有一部分是 AI 自己,按一部写好的"宪法"来评判回答好不好。也就是说,你在第二册第 11 章给 AI 写 CLAUDE.md 这件事,和造它的人干的是同一件事,只是规模不同。给 AI 立法就是这门手艺本身,一点也不外行。
后训练还解释了两件日常。为什么系统提示词和 CLAUDE.md 管用,它被专门训练过"遵循指令"这个行为。为什么它会拒绝一些请求,安全训练也是后训练的一部分。你面对的搭档,等于预训练给的知识,加后训练给的性格。
出事时想起我
它顺着你的错误方案一路狂奔,讨好机制在工作,停下来,明确要求它先挑毛病。它在两个会话里"性格"不太一样,上下文不同,"什么算好回答"的语境就不同,重要的规矩每次都要在场,写进宪法,别靠它记。
关键领悟
预训练给知识,后训练给性格。而性格来自打分,所以你说的每句话都在参与"这局对话里什么算好回答"的定义。会共事的人,先定义好。
试一试
做一次讨好测试。把一个你明知有漏洞的方案自信地讲给它,看它顺不顺。然后加一句"请先攻击这个方案最薄弱的三处",对比两次回答。以后每个重要方案,都用第二种问法。