公司真题库

【快手】谈谈你对工作流、Prompt、Skill 的理解以及三者的关系

91学AI·2026/8/14·4 阅读

考察点

这道题出自快手智能客服方向的实习面,问的是三个概念但考的是一件事:你搭没搭过真实的 Agent 系统。背定义的人会把三者并列罗列,做过的人会讲清楚它们的层次关系——工作流是骨架、Skill 是可复用的能力单元、Prompt 是注入每个节点的判断逻辑,并且能举出「这一步为什么用工作流而不是让模型自己发挥」的具体理由。客服场景又是这三个概念最好的试金石:高并发、强业务约束、错了有真实客诉。追问会往「什么逻辑该放进 Skill」「Prompt 写在工作流里还是模型里」「三者怎么版本管理和测试」走。

参考答案

三个概念,一句话各归其位

先给定义,但用我自己的话。Prompt 是给模型的一次性指令——你告诉它扮演什么角色、按什么规则、输出什么格式,它解决的是「这一次调用让模型怎么思考和表达」的问题。Skill 是封装好的能力单元——把「查订单」「算退款金额」「判断是否该转人工」这类能力,连同事先调优好的 prompt、参数、调用示例打包成一个有名字、有接口、可被反复调用的模块。工作流是编排层——它定义了整个任务从哪里开始、经过哪些节点、每个节点是调模型还是跑代码、分支条件是什么、失败了往哪退。

所以三者的关系是嵌套而不是并列:工作流画出系统的骨架,骨架上的某些节点挂载 Skill,Skill 内部的核心往往是一段或几段精心设计的 Prompt。换一个角度说:Prompt 决定「模型怎么想」,Skill 决定「系统能做什么」,工作流决定「事情按什么顺序做、出了岔子怎么办」。

用客服场景把三者串起来

拿一个「用户申请退款」的客服会话举例。工作流层面,整个处理路径是显式编排的:意图识别 → 订单查询 → 退款规则判断 → 金额小的自动处理、金额大的转人工 → 生成回复。这张图是产品、运营、工程三方对着业务规则一起画出来的,它的价值在于确定性和可审计——出了客诉能回放每一步发生了什么。

Skill 层面,「查询订单状态」是一个 Skill,封装了订单系统的 API 调用和结果解析;「判断退款资格」是另一个 Skill,内部可能是一段 prompt 加一组业务规则——比如七天内未发货可退、生鲜品类不支持无理由退。这些 Skill 一次封装、处处复用,售后场景用,售前咨询也能用。

Prompt 层面,在意图识别节点里,prompt 告诉模型「你只能从预设的意图集合里选,拿不准就输出 unknown」;在回复生成节点里,prompt 注入客服的语气规范和禁语清单。Prompt 是三样东西里最灵活也最容易腐化的——业务规则一变就要改,所以它需要像代码一样做版本管理和回归测试。

为什么要分三层?因为变化的速度不同

这个分层最实在的好处是三层的变化频率不一样,分开才能各自迭代。业务规则变得最快(大促期间退款政策一周一调),所以它应该落在工作流的节点配置和 Skill 的参数里,改配置不改代码;模型的表达方式次之(语气、话术风格季度级优化),沉淀在 prompt 模板里;而系统骨架(会话状态机、转人工链路)最稳定,一年动不了几次。如果三层糊在一起——比如把全部逻辑写进一个巨型 prompt 让模型自由发挥——那每次业务微调都是一场赌博,改一个字可能整个链路的行为都漂了,而且你没法测试。

我在项目里学到的教训是:能下沉的尽量下沉。一个判断如果能从 prompt 下沉为规则代码,就下沉——确定性永远比模型的自由发挥可靠;一段逻辑如果被三个场景复用,就封装成 Skill——散在各处的复制粘贴 prompt 是维护噩梦的开始。

三者各自的测试方式

最后补一个容易忽略的点:测试方法三层各不同。Prompt 靠评测集——攒几百条带标准答案的 case,每次改 prompt 全量回归;Skill 靠单元测试加契约测试——输入输出有明确接口,mock 掉下游验证逻辑;工作流靠端到端演练加影子流量——新业务规则先 shadow 跑,对比线上结果再切流。三层各自的回归机制保证了「改一处不崩全局」,这在客服这种天天改规则的业务里是活命的能力。

可能的追问

  • 什么情况该把一个逻辑做成 Skill,什么情况留在 prompt 里? 答:两个信号。复用信号:第二个场景也要用它,就封装;确定性信号:这个判断错了代价高且有明确标准,就从 prompt 下沉成 Skill 里的确定性逻辑,模型只做输入理解不做最终裁决。
  • Prompt 太长太复杂,模型不听话怎么办? 答:先想拆不想加——一个 prompt 里塞超过三四类职责,基本就该拆成多个节点或 Skill 了。Prompt 的复杂度和失控概率是指数关系,瘦身比打补丁有效。
  • 工作流和让 Agent 自主规划(ReAct 式)怎么选? 答:客服这类强约束、高频次、低容错的场景用显式工作流;探索性、长尾、一次性的任务(帮用户整理一份跨系统的信息)才适合自主规划。也可以混用:工作流的某个节点内部允许模型小范围自主决策,但出入口必须收进骨架里。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.