Skip to content
难度LEVEL★★★★★
阅读READ约 3 分钟~3 min
更新UPDATED2026-09

第 4 章 外挂记忆 · RAG 与 Embedding

easycode · Agent Skill

第 1 章留了两个坑。知识截止,新东西它没读过。上下文窗口有限,你的资料塞不完。这一章讲行业给这两个坑配的同一副药,别指望它记得,把资料找出来递给它

先看为什么"全塞进上下文"行不通。窗口有上限。按 token 计费,塞十份文档答一个小问题,账单先受不了。而且窗口塞得越满,它看漏中间内容的概率越大,大海捞针,针在海中间最容易丢。所以正确姿势是只把相关的那几页递过去。问题变成,谁来判断"相关"?

这就轮到 Embedding(嵌入向量)出场。它把一段文字变成一串数字,你可以理解为给"意思"标上地图坐标,意思相近的话,坐标就挨得近。"怎么重置密码"和"忘记登录口令了"字面几乎不重叠,坐标却是邻居。有了坐标,"找相关"就从玄学变成了量距离。

于是有了 RAG(Retrieval-Augmented Generation,检索增强生成),流程四步。把你的资料切成小块(chunk)。每块算出坐标存起来。用户提问时,把问题也算成坐标,捞出坐标最近的几块。把这几块原文塞进上下文,让模型带着材料回答。一句话,先查资料,再开口。模型没有变聪明,是它拿到了小抄。

你每天都在用它,只是没叫过它的名字。Claude 回答你项目知识库里的问题,先搜索再回答,带着引用来源作答,背后都是"先检索,再生成"这个形状。检索的具体手段可以是向量,也可以是关键词搜索,原理一致。而且你早就在手动 RAG 了。第一册第 14 章教你把报错原样贴给 AI,把最相关的材料亲手递进上下文,这就是检索增强的最朴素形态。它也解释了一条你已有的直觉为什么对,递材料,永远胜过考记忆

最后画清一条边界。这一章讲的是认识 RAG。亲手造一套 RAG,切块策略,向量库,检索调优,属于还没动工的"AI 应用开发"区,等我们真的开始造第一个 Agent 时,随实践一起写。认识和建造之间隔着一册书,这个空位我们诚实地留着。

出事时想起我

它对你项目的细节答非所问,相关文件没进上下文,检索没命中,亲手把文件贴进去。它引用了一份不存在的资料,检索空手而归时,补全机制接管了(第 1 章),要求它"只根据我给的材料回答,没有就说没有"。

关键领悟

搭档的记忆分两层,脑子里的(预训练,会过时、会不够)和手边的(上下文,你说了算)。共事的高手不考它的记性,只喂它对的材料。

试一试

下次问它任何关于你项目的问题,先别直接问。把你认为最相关的一个文件贴进去再问,对比有无材料时答案的落差。这个落差,就是 RAG 存在的全部理由。

由 Charles Tao 与 Claude 协作写成——这本身就是这套书讲的工作方式。Written by Charles Tao with Claude — which is itself the working method this series teaches. · 许可License