精选·提示工程

Chain-of-Thought 思维链是什么?什么场景该用、怎么用?

91学AI·2026/7/13·9 阅读

考察点

CoT 是 Prompt 面试里出现频率最高的一题(CSDN 高频题里以「教育辅导场景如何用 CoT 提升解题能力」的形式出现)。面试官不只想要「让我们一步步思考」这句咒语,而是想确认你理解它为什么有效、什么时候有效、代价是什么。追问常往「CoT 会增加幻觉吗」「和推理模型(如 o1 类)什么关系」走。

参考答案

为什么有效

Chain-of-Thought 让模型在给出最终答案前,先显式生成中间推理步骤。它有效的原因有两个层面:一是计算层面,自回归模型每生成一个 token 都以前面所有 token 为条件,把中间步骤写出来等于让模型「边算边存草稿」,避免了单步从问题直接跳到答案时的一次性压缩误差;二是训练分布层面,训练语料里数学推导、代码调试这类文本本来就是逐步展开的,显式步骤把生成拉回了模型更擅长的分布。

实证结论很一致:数学(GSM8K 这类)、符号推理、多跳常识推理上,CoT 相对直接作答有显著提升;而在简单分类、翻译、知识问答上几乎没有收益,甚至有害——后面细说。

三种用法

Zero-shot CoT:不加示例,只加一句触发语,经典的「Let's think step by step」,中文场景「请一步步分析再作答」同样有效。成本最低,适合快速验证任务是否吃 CoT 这一套。

Few-shot CoT:示例里带上完整的推理过程,不只是输入输出对。效果比 zero-shot 好,还能顺便控制推理的格式和详细程度。教育场景典型:示例里展示「审题→列已知条件→选公式→代入计算→检验」的完整解题路径,模型就会模仿这个路径而不是直接报答案。注意示例里的推理过程要真的正确,模型对错误推理模式照样照单全收。

Self-Consistency(自洽性):同一问题采样多条推理路径(调 temperature 采样 5-20 次),对最终答案做多数投票。GSM8K 上能再抬几个百分点,代价是推理成本乘上采样数,适合离线批处理或高价值单点决策,不适合在线高并发。

适用边界:什么时候别用

  • 简单任务不用。情感分类、关键词提取,直接答又快又准,加 CoT 徒增延迟和 token 费。
  • 对延迟敏感的在线场景慎用。CoT 把输出拉长几倍,首 token 后的等待时间同比拉长。工程上的折中:让模型内部推理但只输出结论,或者用小模型蒸馏推理能力。
  • 别迷信步骤的正确性。CoT 提升的是答案准确率,不保证每一步推理都对。模型可能用错误过程推出正确答案,或者步骤看起来漂亮但实际是事后编的合理化解释。需要可验证推理的场景(医疗、金融风控),关键步骤要接外部校验——计算器、代码执行、规则引擎,而不是信模型的文字。

和推理模型的关系

o1、DeepSeek-R1 这类推理模型把 CoT 能力通过强化学习训进了参数,不需要 Prompt 触发。如果底座已经是推理模型,再写「一步步思考」是多余的,有时还干扰它自己的推理节奏。Prompt 层的 CoT 技巧主要对通用指令模型有意义。选型时这也是个判断点:推理密集业务,与其在 Prompt 里堆 CoT 技巧,不如直接换推理模型或者蒸馏一个小模型。

可能的追问

  • CoT 会增加幻觉吗? 推理链越长,中间步骤累积错误的概率越大(一步错步步错)。缓解办法是 self-consistency 投票、关键步骤接工具验证。
  • 教育场景为什么特别适合 CoT? 因为教学目标本身就要展示过程,CoT 输出既是答案又是讲解素材;而且题目有标准答案,方便做离线评测和投票验证。
  • CoT 的输出怎么和结构化格式共存? 让模型先输出推理段落,最后用固定标记(如 最终答案:{"..."})收口,程序按标记截取解析;或者分两次调用,先推理后格式化。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.