
【美团】如何理解 AI Coding 对程序员的影响?会降低门槛吗
美团后端 Agent 开发一面开放题,考察对 AI coding 行业影响的独立思考。答案从工作重心转移、能力模型变化切入,论证门槛在转移而非消失。
共 20 篇文章

美团后端 Agent 开发一面开放题,考察对 AI coding 行业影响的独立思考。答案从工作重心转移、能力模型变化切入,论证门槛在转移而非消失。

蚂蚁集团 Agent 暑期实习一面开放题,考察对 agent 行业格局的判断力。答案给出"模型能力内化速度 vs harness 厚度"的分析框架,并归纳新兴 agent 的六项关键能力。

大模型应用安全架构按五层展开:接入层过滤、模型层对齐、编排层权限收敛、数据层隔离、运营层监控响应,核心假设是模型不可信。

Agent 可观测性的核心是完整 trace:跨步关联的调用链、按步维度的质量与成本指标、以及支撑归因分析的检索与告警体系。

上线前靠三层评测集加发布门禁,上线后靠灰度、影子测试、线上抽检和持续回归,把大模型应用的不确定性管成工程流程。

内容安全要输入输出双侧把关:敏感词兜底、分类模型主力、大模型审核语义级风险,加上变体对抗、兜底话术和审计留痕。

按威胁面梳理 OWASP LLM Top 10 核心风险,重点讲注入、泄露、供应链、过度代理四项的工程含义与对应缓解措施。

Prompt 注入分直接与间接两类,本质是模型分不清指令和数据;防御靠输入过滤、上下文隔离、工具权限收敛、输出审计的纵深体系。

红队测试用攻击者视角主动构造越狱、注入、越权、泄露样本,覆盖 OWASP 风险面,按攻击成功率度量并接入发布门禁。

badcase 体系的关键是闭环:线上多渠道收集、按错误类型归因打标、修复后入评测集回归,让每一次线上事故都变成评测资产。

LLM-as-Judge 有位置偏差、冗长偏差、自我偏好等问题,通过成对比较、打乱顺序、rubric 细化、人工校准和一致性监控把可信度提上来。

结果评估看终局对错,轨迹评估看每一步决策质量;只评结果会漏掉运气分和隐患,只评轨迹则失去业务锚点,两者结合才能归因。

讲清 Agent 评估的四层指标体系:任务成功率、轨迹质量、效率与成本、安全合规,以及离线评测集与线上影子测试的组合打法。

讲 Agent 项目按「业务问题-为什么用Agent-架构取舍-踩坑与数据」四段式展开,重点讲权衡和量化结果,而不是堆技术名词。

Agent 评估要分层:端到端任务成功率、过程指标(步数/工具准确率)、组件级单测,配合影子测试和 LLM-as-Judge,核心是评估集先行。

Agent 的能力边界受限于模型推理上限、上下文窗口、工具覆盖度和环境反馈质量;高确定性、强实时、零容错场景不是它的主场。

编排框架按抽象层级选:LangChain 管组件、LangGraph 管状态机、AutoGen 管多 Agent 对话,生产首看可控性与可观测。

子 Agent 的核心价值是上下文隔离与并行:独立窗口处理子任务,只回传压缩结论;设计关键是任务契约、结果协议和调度成本权衡。

Harness 是包裹 LLM 的运行支撑框架:工具执行、上下文管理、权限、循环控制、可观测都在这一层;模型负责智能,Harness 负责可靠。

Agent 可靠性要从语义、逻辑、异常三层保障工具调用;降级链路包括重试、换工具、小模型兜底、人工接管,输出侧用 schema 校验守门。