
Agent 上生产环境要考虑什么?状态保存恢复、重试、成本怎么控?
考察 Agent 生产化的完整清单:checkpoint 状态恢复与工具幂等、分层重试与超时、全链路可观测、模型路由与上下文管理等成本控制手段。
共 14 篇文章

考察 Agent 生产化的完整清单:checkpoint 状态恢复与工具幂等、分层重试与超时、全链路可观测、模型路由与上下文管理等成本控制手段。

考察对低代码 Agent 平台的务实判断:优势在验证速度和协作门槛,短板在复杂控制流、工程化缺失和平台锁定,选型看流程复杂度与生命周期。

考察 Agent 排障方法论:先拿完整 trace 找第一个偏离点,再按工具、上下文、模型、流程四层隔离变量,最后沉淀 eval 集防回归。

考察对主流 Coding Agent 架构的理解:Claude Code 终端原生加 agentic search,Codex 云沙箱异步派单,设计核心是工具克制、上下文管理和验证闭环。

考察 Agent 失控场景的兜底体系:迭代与预算硬限制、重复调用与无进展检测、分级降级策略,以及线上步数监控。

考察对 MCP 协议定位的理解:它用开放标准解决 M×N 工具集成问题,与 Function Calling 是不同层次、串联协作而非替代关系。

考察对主流 Agent 框架抽象差异的理解:LangChain 是链式组件库,LangGraph 是带持久化状态机的 Agent 运行时,选型要看控制流复杂度和生产需求。

考察长程 Agent 的上下文管理:截断、摘要、工具结果掩码、LLM 压缩器等手段怎么选,以及压缩过度如何通过在线指标、回归评测、错误归因来发现和兜底。

考察 Agent 记忆系统设计:短期记忆是上下文窗口内的工作状态(对话历史、scratchpad),长期记忆是持久化的用户画像、经验与知识,用向量库等外存召回。

考察多 Agent 系统设计:按职责拆角色的分工模式、消息传递/共享黑板/交接的通信机制、明确的终止协议,以及用最大轮数、预算、仲裁者防死循环。

考察对两种 LLM 应用编排范式的理解:Workflow 是代码预定义执行路径、LLM 做局部决策,Agent 是 LLM 自主规划路径;选型看任务确定性、容错要求和成本。

考察工具调用的工程设计能力:JSON Schema 怎么写模型才调得准,失败时重试/降级/熔断怎么分层,写操作类危险工具如何用白名单、审批、沙箱防护。

考察对 Agent 主循环与 ReAct 范式的理解:推理与行动交替执行、观察结果回流,循环要有终止条件和异常兜底。

考察对 Agent 本质的理解:Agent 是「模型自主决策 + 工具调用 + 环境反馈」的闭环系统,与普通问答的核心区别在于它能多步行动、根据反馈自我修正。