一篇讲透 RAG:分块、混合检索、重排序与 Agentic RAG 这是 ai-agent-book 读书笔记的第四篇。上一篇讲的是 Agent 记忆怎么存——存在哪里、存什么、怎么存。这篇进入下一个问题记忆和知识怎么取回来。当记忆量增长到成千上万条问题就从怎么存变成了怎么找。检索增强生成RAG就是解决这个问题的核心技术——将 LLM 的生成能力与外部知识库结合让模型能利用它训练时没见过的知识而不需要重新训练。一个最简单的 RAG 长这样用户问退款流程是什么 → 检索器从知识库找到退款政策的片段 → 片段注入上下文 → LLM 基于上下文生成答案整个流程就三步检索相关片段 → 注入上下文 → 生成答案。接下来沿着这条流水线逐个拆解每个环节。标准 RAG 流水线文档分块长文档要先切成适合独立检索的片段。常见的分块策略有三种固定大小切分——按固定 token 数切相邻块保留一定重叠避免关键句被截断。实现简单但完全无视文档结构递归/结构感知切分——按文档的自然边界章节标题、段落、句子递归切分先尝试大边界超长再降级到小边界。目前生产系统最常用的默认选择语义切分——计算相邻句子的嵌入相似度在语义断崖处下刀使每个块内部主题尽量单一核心权衡太小则单块信息不完整“该公司收入增长了 3%”——哪家公司哪个季度太大则一个块混杂多个主题嵌入被稀释检索精度下降。两种嵌入稠密与稀疏分好块之后要把文本块变成可计算的向量形式。两条路线各有所长。稠密嵌入捕捉语义把文本转成一串数字向量语义相近的内容向量距离也近。衡量两个向量有多近用余弦相似度——计算两个向量夹角的余弦值值越接近 1 表示语义越相似。稠密嵌入经历了从词汇关联到语义理解的演进Word2Vec——为每个词生成一个固定向量能捕捉共现关系“国王” - “男性” “女性” ≈ “女王”但无法处理一词多义。bank在river bank和investment bank中含义截然不同却得到相同向量BERT / BGE-M3——上下文感知模型。生成一个词的向量时会参考整个句子的上下文同一个词在不同语境下有不同向量百万级向量的快速检索靠 ANN近似最近邻索引。两种主流算法ANNOY基于树——构建快、内存低但不支持增量更新适合静态数据集HNSW基于图——支持增量插入查询精度更高适合需要持续吸纳新知识的动态场景稀疏嵌入精确匹配BM25 是经典代表核心逻辑很直观一个词在文档中出现频率越高、在整个文档集合中越稀有这个词越重要。相比更早的 TF-IDFBM25 引入了两个关键改进词频饱和度——一篇文章提到蒸馏20 次和 10 次相关度不会差一倍文档长度归一化——长文档不会因为词频堆砌而不公平地占优两者的盲区互补稠密检索懂语义但可能漏关键词——搜HTTP-403可能返回服务器错误的泛泛讨论稀疏检索精确匹配但读不懂同义词——搜kitty找不到只写了cat的文档这引出了混合检索。混合检索与重排序既然两者互补生产系统就两个引擎都跑结果合并。三阶段流水线并行检索——稠密和稀疏同时发查询各自召回一批候选。结果融合——两路得分尺度完全不同余弦相似度范围 0-1BM25 可能 0 到几十不能直接比。RRF倒数排名融合的做法是抛开原始得分只看排名每个文档的综合得分是它在各路结果中排名的平滑倒数之和。神经重排序——对融合后的候选池做精排。不是为了补救融合丢掉的信息是换用了一种更强的匹配范式。三种范式从快到准依次递进范式编码方式匹配粒度文档可预计算速度精度双编码器各自独立文档级是最快较低ColBERT 迟交互各自独立Token 级是中等中等跨编码器联合编码Token 级否慢最高三者不是替代关系是串联使用双编码器从百万文档粗筛 top-100 → 跨编码器对 100 篇精排到 top-10 → 送进 LLM 生成答案。这就是标准的 RAG 流水线。后面几节讲的是这条流水线在哪些地方不够用以及怎么补。知识的组织结构化索引与文件系统范式标准流水线有一个隐含假设每个文本块独立地包含了回答问题所需的信息。很多时候这个假设不成立。比如知识库有 100 个独立案例90 只黑猫、10 只白猫用户问比例是多少。top-k 只能取 20 条大部分案例根本不会被检索到。如果预先生成摘要共 100 只猫90 只黑猫、10 只白猫并索引一次检索就能得到正确答案。必须在索引阶段对知识做主动提炼和结构化。三种组织哲学RAPTOR——用树组织。自下而上递归抽象。先把文本块按语义聚类分组再用 LLM 为每组生成更高层次的摘要作为父节点不断递归形成从具体细节叶子到高度概括根的知识树。擅长跨文档全局概览和从宏观到微观逐步深入——比如CPU 的 SSE 和 AVX 在架构上有什么区别答案分散在几十个块里但 RAPTOR 在更高层的摘要节点里已经归纳好了。GraphRAG——用图组织。利用 LLM 从文本中提取实体和关系构成知识图谱。擅长两类查询多跳关系推理——我的医生所在医院的地址需要沿用户→医生→医院→地址走四步实体消歧——两个张医生在图里是不同节点各自连接到不同科室和机构局限是三元组会丢失条件逻辑——如果下周还下雨就取消海边计划改去博物馆被分解后核心的条件判断和时间依赖全部丢失。文件系统范式OpenViking——用目录组织。把所有知识映射成虚拟文件系统中的目录和文件三层按需加载L0约 100 token——一句话摘要判断是否相关L1约 2000 token——核心信息概览供 Agent 规划决策L2——完整原文按需加载选择 Markdown 纯文本意味着 Agent 自己可以读写知识文件形成知识自演化循环——Claude Code 的 CLAUDE.md 就是这个思路的简化版。前提是文件之间必须建立链接和索引否则退化成互不关联的孤岛。三种方案适用场景不同。判断标准答案是否完整存在于某一个块里。如果是标准混合检索够了如果答案分散在很多块里需要先归纳再比较结构化索引才值得上。代价是索引构建需要大量 LLM 调用。知识组织好之后还有一个运维问题知识库不是一次建成就万事大吉的静态资产——公司政策会改版、法规会更新、文档会被替换。增量更新方面索引结构的选择有实际后果。ANNOY 不支持增量插入新增文档必须完全重建索引HNSW 天然支持增量更适合需要持续吸纳新知识的场景。失效内容需要主动管理。一篇被新版取代的旧政策如果仍留在库中检索时可能与新版一起被召回让模型给出矛盾甚至过时的答案。生产系统通常给每个分块附加版本号、生效/失效时间等元数据在检索阶段就过滤掉。权限隔离在多用户共享的知识库中尤其重要。不同部门、不同租户能看到的文档范围不同检索必须按调用者权限过滤敏感内容不能进入上下文。从被动管道到主动探索智能体化 RAG不管标准流水线还是结构化索引前面的检索流程都是被动的——搜一次就生成答案。Agentic RAG 把检索变成 Agent 主动调用的工具自主决定搜什么、搜几次、结果够不够不够就换关键词再搜搜到矛盾信息就交叉验证。书里用法律量刑的例子说明差距。“醉酒过失致人重伤且有盗窃前科如何量刑”——传统 RAG 一次搜不全要么漏了醉酒不免责要么漏了累犯加重。Agentic RAG 的做法第一轮检索——分解问题分别搜过失致人重伤量刑标准“醉酒刑事责任”“盗窃前科影响”评估——发现缺少将它们联系起来的关键信息不同罪名下累犯如何认定第二轮检索——构建更精确的查询搜过失伤害罪与累犯或数罪并罚的关联综合生成——找到关键司法解释后给出有法条依据的完整回答简单问题“退款政策是什么”用传统 RAG 更快复杂问题 Agentic RAG 明显更好。RAG 还有一个安全边界值得注意检索到的文档是间接提示注入最典型的载体——攻击者可以把恶意指令藏进会被收录的文档里。防御的关键是指令与数据分离对检索到的内容做来源标记明确告诉模型这是供参考的外部资料不是你要服从的命令。回到原点上下文感知检索与双层记忆架构但不管检索策略多聪明——普通 RAG 还是 Agentic RAG——它们都受限于同一个瓶颈分块本身的质量。一个块在切出来的那一刻就丢失了这是哪家公司这是哪份报告的信息。搜索策略再精细块本身语义模糊检索精度就有天花板。上下文感知检索上下文感知检索回到索引阶段解决这个问题。做法很直观在建索引前用 LLM 为每个块生成一段简短的上下文前缀。比如该公司第二季度收入增长了 3%这个块系统可能生成前缀[本段内容节选自 ACME 公司 2025 年 Q2 财务报告的关键业绩指标章节]前缀和原始块拼接后再索引。这同时增强了两种检索模式稀疏检索——前缀增加了ACME2025 年第二季度这些可精确匹配的关键词稠密检索——前缀注入了关键语义背景embedding 更精确地反映块的真实含义Anthropic 的数据结合 BM25 可将检索失败率降低 49%再加重排序降幅达 67%。代价是索引时每个块多一次 LLM 调用但通过 prompt caching 可控。双层记忆架构把上下文感知检索应用到用户记忆就得到全章的汇合点——双层记忆架构。上一篇讲的 Advanced JSON Cards 把少量关键事实结构化后常驻上下文提供随时可见的概览——用户的护照过期日、关键偏好、人物关系。上下文感知检索则按需从海量原始对话中取回细节——具体的对话内容、事件的来龙去脉。两者各自解决不了的问题只靠常驻上下文——容量受限丢细节只靠检索——缺乏全局视野发现不了跨会话的隐藏关联比如一月订了去东京的机票和二月护照即将过期之间的联系两者叠加Agent 既能看到全局Cards 常驻又能取回细节检索按需。补充两个容易忽视的延伸话题多模态信息提取现实中知识不只存在于文字里。图表、PDF 版式、语音都需要处理。三条路线各有取舍原生多模态处理——通过 Vision Transformer 把图像切成小方块patch当作视觉单词与文本 token 共处统一嵌入空间。保真度最高成本也最高提取为文本——通过 OCR、音频转录等工具先转为纯文本再走标准流水线。便宜但丢失版式和空间关系工具化分析——文本提取打底提供初步摘要同时给 Agent 提供对原始文件深度分析的工具按需调用。兼顾低成本和高保真从结构化数据提取知识前面所有技术的前提是知识已经以文档形式存在。但很多有价值的知识隐藏在结构化数据的统计规律中——比如司法领域决定判决结果的知识更多体现在成千上万份判例中法官如何权衡各种因素的经验里。提取分两阶段知识提取与结构化——用 LLM 将非结构化案例描述转为标准化 JSON 对象因子分析与重要性建模——用数据分析技术发现模式、量化因子权重构建因子重要性层次模型Agent 用这个模型引导用户按重要性顺序补全关键信息再检索最相似的案件原型给出有判例支持的分析。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

最新新闻

0xc000007b 报错不用重装系统:Visual C++ 运行库修复全程实操记录

0xc000007b 报错不用重装系统:Visual C++ 运行库修复全程实操记录

0xc000007b 报错不用重装系统:Visual C 运行库修复全程实操记录 【免费下载链接】vcredist AIO Repack for latest Microsoft Visual C Redistributable Runtimes 项目地址: https://gitcode.com/gh_mirrors/vc/vcredist 如果你的电脑在运行软件时弹出"…

2026/8/20 13:01:23
渲染时风扇“一喘一喘“地狂转,FanControl风扇控制软件两天把它治老实了

渲染时风扇“一喘一喘“地狂转,FanControl风扇控制软件两天把它治老实了

渲染时风扇"一喘一喘"地狂转,FanControl风扇控制软件两天把它治老实了 【免费下载链接】FanControl.Releases This is the release repository for Fan Control, a highly customizable fan controlling software for Windows. 项目地址: https://gitco…

2026/8/20 13:01:23
免费网页视频下载插件上手指南:5 步安装 VideoDownloadHelper 嗅探页面视频

免费网页视频下载插件上手指南:5 步安装 VideoDownloadHelper 嗅探页面视频

免费网页视频下载插件上手指南:5 步安装 VideoDownloadHelper 嗅探页面视频 【免费下载链接】VideoDownloadHelper Chrome Extension to Help Download Video for Some Video Sites. 项目地址: https://gitcode.com/gh_mirrors/vi/VideoDownloadHelper 你有没…

2026/8/20 13:01:23
PowerToys中文汉化版一键换肤:让微软效率工具箱说人话的3步上手路径

PowerToys中文汉化版一键换肤:让微软效率工具箱说人话的3步上手路径

PowerToys中文汉化版一键换肤:让微软效率工具箱说人话的3步上手路径 【免费下载链接】PowerToys-CN PowerToys Simplified Chinese Translation 微软增强工具箱 自制汉化 项目地址: https://gitcode.com/gh_mirrors/po/PowerToys-CN 还在盯着满屏英文菜单发愁…

2026/8/20 13:01:23
Wand专业版免费解锁完整指南:Wand-Enhancer一键补丁与手机远程控制终极教程

Wand专业版免费解锁完整指南:Wand-Enhancer一键补丁与手机远程控制终极教程

Wand专业版免费解锁完整指南:Wand-Enhancer一键补丁与手机远程控制终极教程 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer Wand-Enhan…

2026/8/20 13:01:23
一个脚本搞定 Windows 与 Office 激活:KMS_VL_ALL_AIO 完整上手指南

一个脚本搞定 Windows 与 Office 激活:KMS_VL_ALL_AIO 完整上手指南

一个脚本搞定 Windows 与 Office 激活:KMS_VL_ALL_AIO 完整上手指南 【免费下载链接】KMS_VL_ALL_AIO Smart Activation Script 项目地址: https://gitcode.com/gh_mirrors/km/KMS_VL_ALL_AIO 刚重装完系统,右下角飘着"需要激活 Windows&quo…

2026/8/20 12:56:23