2026 年 RAG 圈最大的变化,是「检索」这件事本身在被 Agent 化:从「一次向量搜索」演变成「模型自己决定查几次、查什么、怎么查」。演进方向没问题,但每一层演进都在加 token、延迟和不确定性——写这篇是想把演进谱系和各自的适用边界讲清楚,让你按需取用,而不是追最新。
演进谱系(按引入成本排序)
第一代:单次检索 RAG(一次向量搜索 → 生成)
- 解决:知识问答的地基。
- 局限:用户问法一变就召回失败;多跳问题(「A 产品的销量在 B 区域的比例」)答不了。
- 成本:最低,可控性最好。
第二代:工程化 RAG(混合检索 + 重排 + 引用)
- 在单次检索上加:BM25 混合、RRF 融合、重排模型、引用来源。
- 解决:精确术语、同义改写、可验证性——90% 的知识库项目做到这代就够用了(做法见第 1 章)。
- 成本:可控,工程投入主要在一次性的链路建设。
第三代:模块化 / 多跳 RAG(查询改写、子查询拆分、迭代检索)
- 把「一次检索」改成「检索 → 判断不足 → 改写再查」的有限循环。
- 解决:多跳、需要组合多文档答案的问题。
- 成本:每次迭代都是新 token 和延迟;需要终止条件,否则会为追求完美无限检索。
第四代:Agentic RAG(模型自主决定检索策略、工具与停止时机)
- 模型像 Agent 一样规划整个回答过程:决定查哪个库、要不要查外部工具、何时停下。
- 解决:开放、需要动态策略的任务。
- 成本:最高——不确定性最大,token 与延迟不可预测,必须有严格护栏(Agent 工程篇的终止与降级全部适用)。
旁支:GraphRAG(先建实体关系图,按图检索)
- 解决:需要「关系推理」的问题(「哪些模块依赖这个库」「谁影响了谁」)。
- 代价:建图成本高、更新难——适合关系密集且相对静态的知识域,不是通用答案。
怎么选:先按「问题形态」定位,别按「最新技术」定位
| 你的问题形态 | 用哪代 | 理由 |
|---|---|---|
| 高频单点问答(政策、FAQ) | 第二代 | 便宜、快、可控,够用 |
| 低频但复杂(多条件组合) | 第三代 | 有限多跳,代价可控 |
| 开放探索(研究、分析) | 第四代 Agentic | 值得为不确定付钱 |
| 关系推理(依赖/血缘) | GraphRAG | 只有这类问题值得建图 |
一个反直觉的判断:多数线上流量是「高频简单」问题,应该走第二代;Agentic 只留给低频复杂路径。把 80% 的流量跑在可控的链路上,把 20% 的难题留给智能——成本和稳定性的最优解几乎总是这样。
演进时的三条原则
- 先加工程,后加智能:检索质量没做扎实(混合检索、重排都没上)就跳到 Agentic,等于在沙地上盖智能楼——先回第 1 章把地基打平。
- 每次演进都带回退开关:新链路灰度、可对比(同一问题集新老链路各答一遍),效果变差能一键回退。
- 用问题集做基线:攒 100 条真实问题(含难度分级),每次架构演进都在这套题上跑分——没有基线,你根本不知道「演进」是进步还是退步(评测口径见可观测篇)。
落地清单
- 按问题形态定位:你的流量哪代方案吃得住
- 第二代工程(混合检索/重排/引用)打底
- Agentic/多跳只给复杂低频路径,带终止条件
- 攒 100 条真实问题集做基线,演进可对比
- 新链路灰度 + 回退开关
相关:RAG 生产落地 | Agent 应用开发 | 分层参考蓝图