Agent 开发

Claude Code、Codex 各自有什么特点?Coding Agent 的设计要点是什么?

91学AI·2026/7/26·16 阅读

考察点

面试官想确认你深入用过或拆解过 coding agent,理解它们关键架构决策背后的取舍,而不是停留在「能自动写代码」的表面认知。好的回答要能讲清楚:为什么是这几个工具、上下文怎么管、验证闭环怎么跑。追问常往「权限和安全怎么做」「大代码库里 agent 迷路怎么办」「怎么评估 coding agent」走。

参考答案

Claude Code 的特点

Claude Code 是 Anthropic 的终端原生 agent,住在你真实的开发环境里,直接读写本地文件、跑本地命令。它最有代表性的设计决策是 agentic search:不为代码库建预索引、不上向量库,而是靠 grep、glob、读文件在 agent 循环里边探边查。代价是多花一些探索的 token,换来的是永远新鲜的代码认知——索引方案在代码天天变的仓库里总是滞后,而且省掉了索引服务的维护成本。

其他关键设计:CLAUDE.md 作为项目级长期记忆,启动时注入上下文,团队把构建命令、代码规范、目录约定写进去,agent 行为立刻贴合项目;工具集刻意精简,Read、Edit、Bash、Grep、Glob 等十几个,没有花活;生态扩展靠 subagents(独立上下文窗口执行子任务,避免污染主上下文)、hooks(在工具调用前后挂 shell 命令,比如保存自动跑 lint)、MCP 接外部工具、自定义 slash command。长任务上下文快满时会自动 compact,把历史压缩成摘要继续跑。

Codex 的特点

Codex 是 OpenAI 的 coding agent,分两条线。云端 Codex 把任务跑在云端沙箱容器里:容器预装你的仓库和依赖,你异步派活,它跑完交付 diff 和测试结果,可以并行跑多个任务,产出形态天然是 PR。本地的 codex CLI 是开源的,后来用 Rust 重写,沙箱直接用操作系统机制(比如 macOS 的 Seatbelt)做文件和网络隔离。项目约定文件叫 AGENTS.md,作用和 CLAUDE.md 相同。权限上分了审批模式,从只读到完全自主,让用户按信任程度放权。

两者气质不同:Claude Code 是「结对编程」,你在终端里看着它一步步干,随时插手;Codex 云端模式是「派单」,你描述任务,它独立完成再回来汇报。

设计要点

拆解这些产品后,我认为 coding agent 的设计要点有五条。

第一,工具集要克制。本质就是读写文件、跑命令、搜索这三件事。bash 一个工具就撬动了整个 Unix 生态——测试、构建、git、包管理全在里面,比堆几十个专用工具有效。真正的难点在 Edit 工具:怎么让模型可靠地修改文件是失败重灾区,主流方案是「唯一匹配的字符串替换」,模型必须给出能精确定位的老代码片段才能替换,匹配不上就报错让它先读文件。

第二,上下文管理是核心瓶颈。200K 的窗口跑长任务很快撑满:大文件要分段读、工具输出要截断、旧的工具结果可以摘要或掩码掉、快满了主动 compact。总原则是「让模型按需取信息,而不是一次塞满」——agentic search 本质上也是这个思想的体现。

第三,验证闭环。agent 必须能跑测试、跑构建,根据报错自我修复,而不是生成完代码就交差。SWE-bench 这类 benchmark 的训练和评测都是靠「测试是否通过」做信号,产品层面同样如此:没有验证闭环的 coding agent 只是个代码生成器。

第四,权限与安全。危险操作分级审批,沙箱隔离文件系统和网络,bash 命令有黑白名单。这是企业敢不敢用的门槛。

第五,可引导性。CLAUDE.md / AGENTS.md 让用户用文本注入项目约定,成本远低于微调,效果立竿见影。

实践体会

实测最有效的工作方式是小步快跑:任务切小、频繁让它跑测试、CLAUDE.md 写清楚项目结构和常用命令。最典型的失败模式是 agent 在大代码库里迷路——上下文中混入大量无关文件后输出质量骤降,这时开一个新会话、直接给精确的文件路径,比在原会话里继续纠偏有效得多。这也解释了为什么 subagent 隔离上下文是好设计。

可能的追问

  • 为什么 Claude Code 不给代码库上 RAG 索引? 官方的选择是 agentic search:结果永远新鲜、无索引维护成本,而且 agent 能顺藤摸瓜理解调用链。但超大 monorepo 里索引检索作为补充手段也有价值,不是非此即彼。
  • Edit 工具怎么做可靠? 用唯一字符串精确匹配做替换,匹配失败就让模型先重新读文件;改完用语法检查或 lint 兜底,坏了立即反馈给它修。
  • 怎么评估 coding agent? 外部看 SWE-bench Verified 这类 benchmark 的 resolve rate,内部要建自己的任务集,同时盯 token 成本——能解决问题但烧十倍成本不算赢。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.