
什么是 Agentic RAG?和传统 RAG 流水线有什么区别?
讲清 Agentic RAG 用 Agent 决策替代固定流水线的本质,路由/反思/多轮检索/工具组合四种模式,以及延迟成本代价与适用边界。
共 20 篇文章

讲清 Agentic RAG 用 Agent 决策替代固定流水线的本质,路由/反思/多轮检索/工具组合四种模式,以及延迟成本代价与适用边界。

记忆污染指幻觉、注入攻击、过期信息、低质提炼四类脏数据进入长期记忆;防法是把住写入关(打分查重标来源)、读取关(置信度区分)和清理关(TTL 与巡检)。

RAG 检索的是静态外部知识,记忆是动态积累的用户与交互信息;二者共用检索管道可复用基础设施,但数据来源、写入方、时效性和更新方式完全不同,应分库存储。

上下文预算按系统指令、工具、检索、记忆、历史、输出六块分配额度;工具和 Skill 渐进式加载只留名称描述,能把 schema 开销从数万 token 压到一两千。

scratchpad 外置是把计划、TODO、中间结果写到文件或结构化状态里而非堆在对话历史,需要时读回,换来省 token、可断点续传、可审计三个收益。

跨会话记忆靠会话末提炼写入长期记忆库、新会话启动按用户召回注入;隔离靠命名空间分层(用户/项目/会话)加元数据过滤,共享与隔离按信息性质分级。

Claude Code 的上下文管理靠 CLAUDE.md 持久记忆、auto-compact 阈值压缩、子 Agent 隔离、工具输出截断落盘四件套,是上下文工程的最佳实践样板。

上下文压缩手段从粗到细有滑动截断、滚动摘要、结构化事实提取、工具结果落盘留引用四层;按阈值触发、保留原文可回溯是工程上不漏关键信息的关键。

记忆召回用向量相似度保证相关性、时间衰减体现时效性、重要性分数兜底关键事实,三者加权打分取 top-k,再用元数据过滤和重排序控制注入质量。

记忆写入有逐轮写、会话末批量提炼、触发式写入三种时机;工程上要配重要性打分、写入前查重、冲突解决和 TTL,宁可少写不错写。

短期记忆是会话内工作记忆,活在上下文窗口里;长期记忆跨会话持久化,走外部存储加检索召回;划分依据是生命周期和访问模式,不是存储介质。

上下文工程是为模型每次推理动态组装恰当信息的工程实践,涵盖记忆、检索、工具、历史四类来源;与 Prompt 工程的区别在于从"写好一句话"升级为"管好一个信息流"。

考察工具调用的容错设计。核心:错误分层(参数错/执行错/系统错)分别处置,错误以可读文本回传模型让其自我纠正,配合超时、有限重试、幂等与降级兜底。

考察 MCP Server 的实战开发能力。核心:用官方 SDK 声明 Tools/Resources,stdio 本地起步、Streamable HTTP 远程发布,用 MCP Inspector 调试,重点在 schema 设计、错误处理与鉴权。

讲 Agent 项目按「业务问题-为什么用Agent-架构取舍-踩坑与数据」四段式展开,重点讲权衡和量化结果,而不是堆技术名词。

Agent 评估要分层:端到端任务成功率、过程指标(步数/工具准确率)、组件级单测,配合影子测试和 LLM-as-Judge,核心是评估集先行。

Agent 的能力边界受限于模型推理上限、上下文窗口、工具覆盖度和环境反馈质量;高确定性、强实时、零容错场景不是它的主场。

编排框架按抽象层级选:LangChain 管组件、LangGraph 管状态机、AutoGen 管多 Agent 对话,生产首看可控性与可观测。

子 Agent 的核心价值是上下文隔离与并行:独立窗口处理子任务,只回传压缩结论;设计关键是任务契约、结果协议和调度成本权衡。

Harness 是包裹 LLM 的运行支撑框架:工具执行、上下文管理、权限、循环控制、可观测都在这一层;模型负责智能,Harness 负责可靠。