- 1
面试时怎么讲好一个 Agent 项目?
讲 Agent 项目按「业务问题-为什么用Agent-架构取舍-踩坑与数据」四段式展开,重点讲权衡和量化结果,而不是堆技术名词。
- 2
Agent 系统怎么做评估?指标和流程怎么设计?
Agent 评估要分层:端到端任务成功率、过程指标(步数/工具准确率)、组件级单测,配合影子测试和 LLM-as-Judge,核心是评估集先行。
- 3
Agent 的能力边界在哪?什么事情它做不好?
Agent 的能力边界受限于模型推理上限、上下文窗口、工具覆盖度和环境反馈质量;高确定性、强实时、零容错场景不是它的主场。
- 4
Agent 编排框架怎么选型?LangGraph、AutoGen 这些怎么比?
编排框架按抽象层级选:LangChain 管组件、LangGraph 管状态机、AutoGen 管多 Agent 对话,生产首看可控性与可观测。
- 5
子 Agent(Subagent)应该怎么设计?什么时候拆?
子 Agent 的核心价值是上下文隔离与并行:独立窗口处理子任务,只回传压缩结论;设计关键是任务契约、结果协议和调度成本权衡。
- 6
Harness 是什么?为什么 Agent 需要 Harness Engineering?
Harness 是包裹 LLM 的运行支撑框架:工具执行、上下文管理、权限、循环控制、可观测都在这一层;模型负责智能,Harness 负责可靠。
- 7
Agent 的工具调用失败了怎么办?降级策略怎么设计?
Agent 可靠性要从语义、逻辑、异常三层保障工具调用;降级链路包括重试、换工具、小模型兜底、人工接管,输出侧用 schema 校验守门。
- 8
Agent 陷入死循环怎么办?循环控制怎么做?
ReAct 死循环靠硬上限(步数/超时/token预算)、重复检测和prompt引导三层防御;终止控制是 Agent 从 demo 到生产的关键工程。
- 9
Agent 的核心组成是什么?画一个分层架构怎么画?
Agent 核心四件:LLM 决策大脑、工具层、记忆层、规划与循环控制;分层架构按交互层-编排层-能力层-基础设施层划分,关注点各不相同。
- 10
什么时候需要多 Agent 协作?常见的协作模式有哪些?
多 Agent 在上下文隔离、天然并行、专精分工时才有价值;协作模式有中心化编排、流水线、对等讨论三类,要防无限循环和通信爆炸。
- 11
Agent 有哪些工作模式?ReAct 之外的几种各有什么优缺点?
ReAct、Plan-and-Execute、Reflection、Multi-Agent 四种模式在规划、纠错与成本上各有取舍,按任务特征组合选型。
- 12
Agent 和 Workflow 有什么区别?怎么判断该用哪个?
Workflow 是人预编的固定路径,Agent 是模型运行时动态决策;选型看步骤是否可预知、出错代价、可审计性要求,生产上多是两者混合。
- 13
Plan-and-Execute 模式是什么?执行中发现计划不合理怎么办?
Plan-and-Execute 先由规划器生成完整计划再逐步执行,配合 Replan 机制应对计划失效;比 ReAct 省 token,适合长程可分解任务。
- 14
ReAct 模式的原理是什么?工程上怎么落地?
ReAct 让模型交替输出推理(Thought)与行动(Action),把观察结果回填上下文形成闭环;落地关键是轨迹格式、工具协议和循环刹车。
- 15
Agent 和 LLM 有什么区别?项目里该用直接调用还是 Agent?
LLM 是无状态的文本函数,Agent 是以 LLM 为决策核心、带工具、记忆和循环的执行系统;选型看任务是否需要多步行动与外部交互。
- 16
你怎么看当前 Agent 工具生态(MCP、Skills、CLI)的现状与问题?
考察对工具生态的宏观判断。核心:MCP 已成事实标准但 Server 质量参差、安全治理滞后;Skills 与 CLI 热潮本质是「给 Agent 用的接口」复兴;生态处在早期,选型要克制。
- 17
Function Calling、MCP、Skill、A2A 的层级关系是什么?生产系统怎么选型共存?
考察四者的整体选型框架。核心:FC 是模型语法层、MCP 是工具接入层、Skill 是知识流程层、A2A 是 Agent 协作层,四层各管一段;按工具数量、复用范围、协作边界逐层决定要不要引入。
- 18
工具调用失败了怎么办?Agent 工具链的错误处理与容错怎么设计?
考察工具调用的容错设计。核心:错误分层(参数错/执行错/系统错)分别处置,错误以可读文本回传模型让其自我纠正,配合超时、有限重试、幂等与降级兜底。
- 19
工具描述(description)怎么写,模型才能调得准?
考察工具描述的写作方法论。核心:description 是模型选择工具的唯一依据,要写清干什么、何时用、何时不用、参数约束与示例,短而信息密,并靠线上命中率数据持续迭代。
- 20
如果让你开发一个 MCP Server,完整流程和关键工程点是什么?
考察 MCP Server 的实战开发能力。核心:用官方 SDK 声明 Tools/Resources,stdio 本地起步、Streamable HTTP 远程发布,用 MCP Inspector 调试,重点在 schema 设计、错误处理与鉴权。
- 21
Agent 调用工具的安全与权限怎么保障?怎么防止误删数据、防注入?
考察工具调用的安全体系。核心:工具分级 + 最小权限 + 写操作人工确认 + 参数服务端校验 + 注入防御(指令数据分离、输出过滤)+ 全链路审计,纵深防御而非单点拦截。
- 22
Skill 和 Tool(MCP)是什么关系?一个 Skill 能跨多个 MCP Server 调工具吗?
考察 Skill 与 Tool 的分工。核心:Tool 提供「能做什么」的能力,Skill 提供「该怎么做」的知识与流程,Skill 可以编排多个 MCP Server 上的工具完成任务,两者是互补而非替代。
- 23
什么是 Agent Skill?它的定位、结构与加载机制是什么?
考察 Agent Skill 的概念与机制。核心:Skill 是打包的领域知识与操作规程(SKILL.md + 资源文件),靠 name/description 渐进式加载,按需展开,把上下文成本从「全量常驻」降到「用时才付」。
- 24
MCP 和 A2A 都是协议,区别在哪?为什么 MCP 解决不了 A2A 要解决的问题?
考察两个协议的分工边界。核心:MCP 是 Agent 对工具的垂直调用协议(请求-响应、确定性),A2A 是 Agent 对 Agent 的水平协作协议(任务制、异步多轮),抽象对象不同所以互不替代。
- 25
A2A 协议是什么?它要解决什么问题?
考察对 A2A 定位的理解。核心:A2A 解决 Agent 与 Agent 之间的互操作问题,通过 Agent Card 做能力发现、Task 做任务生命周期管理,面向长耗时、多轮协作的远程 Agent。
- 26
MCP 有哪些传输方式?底层消息格式是什么?为什么不用 WebSocket?
考察 MCP 传输层细节。核心:消息格式是 JSON-RPC 2.0,本地用 stdio、远程用 Streamable HTTP(取代旧 HTTP+SSE),选 HTTP 系而非 WebSocket 是为兼容 Serverless 与现有基础设施。
- 27
MCP 和 Function Calling 有什么本质区别?实际场景怎么选型?
考察 FC 与 MCP 的分层关系。核心:FC 是模型侧的输出能力,MCP 是应用侧的工具接入协议,二者是不同层的互补关系;选型看工具数量、复用范围和团队边界。
- 28
MCP 是什么?Host、Client、Server 三角色的架构怎么理解?
考察 MCP 核心架构。核心:Host 是跑模型的应用,Client 是协议连接管理器,Server 暴露 Tools/Resources/Prompts 三类原语,拆角色是为了一对多连接和职责隔离。
- 29
设计 Function Calling 的 tool schema 有哪些要点?怎么设计模型才调得准?
考察工具 schema 的工程化设计。核心:name 动词化、参数用 JSON Schema 强类型加枚举收敛、必填最小化、工具按原子性拆分,schema 本身就是写给模型看的 Prompt。
- 30
Function Calling 是什么?底层原理与完整调用流程是什么?
考察对 Function Calling 机制的理解。核心:模型只输出结构化的 tool_calls,真正执行在应用层;调用是「模型提议—代码执行—结果回填」的多轮闭环。
- 31
AGENTS.md / CLAUDE.md 这类文件怎么写才有效?有哪些实践经验?
AGENTS.md/CLAUDE.md 是每次会话自动注入的项目级持久记忆,写法要短、具体、可执行、分层组织、随代码演进维护,反模式是写成长篇文档无人更新反成误导源。
- 32
什么是记忆污染?Agent 的记忆系统怎么防污染?
记忆污染指幻觉、注入攻击、过期信息、低质提炼四类脏数据进入长期记忆;防法是把住写入关(打分查重标来源)、读取关(置信度区分)和清理关(TTL 与巡检)。
- 33
RAG 是 Agent 记忆的一部分吗?记忆系统和 RAG 是什么关系?
RAG 检索的是静态外部知识,记忆是动态积累的用户与交互信息;二者共用检索管道可复用基础设施,但数据来源、写入方、时效性和更新方式完全不同,应分库存储。
- 34
上下文窗口的 token 预算怎么分配?渐进式加载能省多少?
上下文预算按系统指令、工具、检索、记忆、历史、输出六块分配额度;工具和 Skill 渐进式加载只留名称描述,能把 schema 开销从数万 token 压到一两千。
- 35
什么是 scratchpad 外置?为什么 Agent 的中间产物不该堆在对话历史里?
scratchpad 外置是把计划、TODO、中间结果写到文件或结构化状态里而非堆在对话历史,需要时读回,换来省 token、可断点续传、可审计三个收益。
- 36
Agent 怎么实现跨会话记忆?多会话之间又该怎么隔离?
跨会话记忆靠会话末提炼写入长期记忆库、新会话启动按用户召回注入;隔离靠命名空间分层(用户/项目/会话)加元数据过滤,共享与隔离按信息性质分级。
- 37
Claude Code 是怎么做上下文管理的?有哪些可借鉴的设计?
Claude Code 的上下文管理靠 CLAUDE.md 持久记忆、auto-compact 阈值压缩、子 Agent 隔离、工具输出截断落盘四件套,是上下文工程的最佳实践样板。
- 38
会话太长挤爆上下文窗口怎么办?上下文压缩有哪些手段?
上下文压缩手段从粗到细有滑动截断、滚动摘要、结构化事实提取、工具结果落盘留引用四层;按阈值触发、保留原文可回溯是工程上不漏关键信息的关键。
- 39
记忆召回怎么做?向量相似度、时间衰减和重要性怎么组合?
记忆召回用向量相似度保证相关性、时间衰减体现时效性、重要性分数兜底关键事实,三者加权打分取 top-k,再用元数据过滤和重排序控制注入质量。
- 40
Agent 长期记忆的写入时机和写入策略怎么设计?
记忆写入有逐轮写、会话末批量提炼、触发式写入三种时机;工程上要配重要性打分、写入前查重、冲突解决和 TTL,宁可少写不错写。
- 41
Agent 的短期记忆和长期记忆怎么划分?分别怎么实现?
短期记忆是会话内工作记忆,活在上下文窗口里;长期记忆跨会话持久化,走外部存储加检索召回;划分依据是生命周期和访问模式,不是存储介质。
- 42
什么是上下文工程?它和 Prompt 工程有什么区别?
上下文工程是为模型每次推理动态组装恰当信息的工程实践,涵盖记忆、检索、工具、历史四类来源;与 Prompt 工程的区别在于从"写好一句话"升级为"管好一个信息流"。
- 43
面试时被连环拷打 RAG 项目细节,怎么应对?
面渣逆袭式 RAG 项目拷打应对指南。讲清「角色-难点-数据-权衡」四件套的准备方法,以及被问倒时的话术边界。
- 44
场景题:如何设计一个高召回率的商品问答 RAG 系统?
电商商品问答 RAG 设计题。从垂类检索瓶颈出发,给出多路召回+属性结构化+意图分流的完整架构与召回率优化路径。
- 45
RAG 场景怎么控制大模型幻觉?检索到错误内容怎么办?
把幻觉拆成「没检索到硬答、检索错、检索对但没照着答」三类,对应阈值兜底、引用约束、后验核对三层防线。
- 46
什么是 Agentic RAG?和传统 RAG 流水线有什么区别?
讲清 Agentic RAG 用 Agent 决策替代固定流水线的本质,路由/反思/多轮检索/工具组合四种模式,以及延迟成本代价与适用边界。
- 47
什么是 GraphRAG?为什么 RAG 要用到图数据库?
讲清向量检索在关系推理、全局总结上的盲区,GraphRAG 的实体抽取-建图-社区摘要流程,以及引入图的成本与适用边界。
- 48
RAG 和微调怎么选?电商客服场景该用哪个?
从知识实时性、成本、幻觉控制、能力边界四个维度对比 RAG 与微调,给出「知识用 RAG、能力用微调」的选型框架。
- 49
Query 改写怎么做?为什么要改写用户的问题?
讲清多轮指代补全、同义扩展、HyDE、多 query 分解四种改写技术的适用场景与风险,以及用小模型低延迟实现的工程实践。
- 50
多路召回的结果怎么融合?各路权重怎么定?
讲清分数融合与排名融合的差异,RRF 的原理与工程优势,以及权重调优从免调到按路加权的演进路径。
- 51
怎么量化 RAG 的回答效果?检索和生成分别怎么评测?
拆检索侧(Recall@K、命中率)与生成侧(忠实度、相关性)两层指标,讲评测集构造、RAGAS 框架与人工抽检的组合打法。
- 52
Rerank 是什么?为什么召回之后还要重排序?
讲清双塔召回与交叉编码器 Rerank 的原理差异,主流 Rerank 模型选型,以及接入位置、条数、延迟的工程经验。
- 53
什么是混合召回/多路召回?为什么纯向量检索不够用?
讲清向量召回与 BM25 关键词召回的互补性,多路召回(向量/关键词/实体/FAQ)的架构设计和 RRF 融合方法。
- 54
向量数据库怎么选?Qdrant、Milvus、ES、pgvector 各适合什么场景?
对比 Qdrant/Milvus/pgvector/ES 等向量库的性能、过滤能力、运维成本,给出按数据量级选型的决策框架和 HNSW 参数经验。
- 55
Embedding 是什么?你们用的哪个模型?怎么选型?
讲清 Embedding 原理与训练目标,给出 bge/m3e/OpenAI 等主流选型对比,以及领域微调、维度、多语言等实战考量。
- 56
文档切分策略有哪些?怎么避免语义被切断?
RAG 高频题。对比固定长度/递归/语义/结构四种切分,讲清 chunk 大小与 overlap 的经验值,以及表格、跨页等语义断裂的工程解法。
- 57
介绍一下 RAG?核心流程是什么?最难的地方在哪里?
RAG 基础必考题。讲清离线建索引+在线检索生成两段流程,指出难点不在「跑通」而在检索质量、切分与评估的工程细节。
- 58
AI 编程类的面试有什么新趋势?该怎么准备?
AI 编程面试从考八股转向考实战:现场人机协作写代码、讲工作流、审 AI 产出找雷;准备方向是用熟一两个工具、沉淀方法论、备好事例和数据。
- 59
面试官问「大家都用 AI 写代码,你的优势是什么」该怎么答?
这题考的是 AI 拉平产出后的差异化认知:优势不在用得熟练,而在问题定义、质量判断、系统兜底三类 AI 替代不了的能力;要用具体事例佐证,别讲概念。
- 60
AI 编程工具对程序员这个职业有什么影响?哪些能力在贬值,哪些在升值?
AI 让「写代码」环节大幅贬值,程序员的重心转向问题定义、质量判断和系统设计;角色从作者变成审校与指挥,守住核心代码能力和系统理解是护城河。
- 61
什么是 Harness Engineering?一个完整的 Harness 包含哪些组件?
Harness Engineering 是围绕模型的脚手架工程:工具层、上下文层、控制层、可观测与评测;模型能力趋同后,Harness 质量才是 Agent 产品差距的主因。
- 62
什么是规范驱动开发(SDD)?为什么 AI 时代它突然火了?
规范驱动开发把 spec 提升为一等公民:先写可验收的规范,再生成计划、任务、代码;AI 时代 prompt 易逝而 spec 持久,SDD 解决的是意图漂移和返工问题。
- 63
Claude Code 和 Codex 有什么区别?实际项目里怎么选?
Claude Code 是跑在本地终端的交互式 agent,适合探索性、需频繁对齐的任务;Codex 主打云端沙箱任务派发,适合边界清晰、可并行委托的任务;选型看任务形态。
- 64
AI 写代码的时代,code review 应该怎么做?和原来有什么不同?
AI 时代 review 的重心从「逐行找错」转向「审意图、审边界、审设计」;流程上要小 PR、作者先讲清改动、测试与静态检查前置,人守住 AI 缺陷高发的三个区域。
- 65
怎么保障 AI 生成代码的质量?你们的流程是什么?
AI 代码质量保障靠四道闸:约束前置写进项目记忆、测试与静态检查机器兜底、小步提交逐段验收、合并者承担全责;核心是把信任从人转移到流程。
- 66
你怎么看 vibe coding?它有什么风险,什么场景能用?
Vibe coding 指不看代码、凭运行结果顺不顺来驱动 AI 编程的方式;原型场景提效明显,但生产场景会引入安全漏洞、隐性 bug 和不可维护代码,必须配验证底线。
- 67
你用 AI 写代码的工作流是怎样的?讲讲 spec、plan、todos、verify 这套打法
高效 AI 编程工作流分四步:先写清 spec 对齐意图,再让 AI 出 plan 人工确认,拆成 todos 小步执行,每步 verify 后再推进;核心是人在关键节点设卡。
- 68
如果让你设计一个 CLI coding agent,你会考虑哪些要点?
CLI coding agent 设计核心:工具要少而通用、输出要结构化、权限要分级、过程要可观测;终端天然提供文件系统和 shell 两大原语,是 agent 最好的栖息地。
- 69
Claude Code 的架构是怎样的?它的 agent loop 是怎么工作的?
Claude Code 本质是跑在终端里的 agent loop:模型决策、工具执行、结果回灌、循环推进;靠通用工具集、CLAUDE.md 记忆和上下文压缩支撑长任务。
- 70
Prompt 工程和微调怎么选?什么情况下该上微调?
考察 Prompt 与微调的选型判断。核心答案:先 Prompt 后微调——知识缺失用 RAG、格式风格调不动用 SFT,微调改的是行为模式不是知识。
- 71
怎么评估一个 Prompt 的效果好坏?有哪些指标和方法?
考察 Prompt 效果评估方法论。核心答案:先建带标准答案的评测集,客观任务看准确率类指标,开放任务用 LLM-as-Judge+人工抽检,线上看业务指标闭环。
- 72
Prompt 怎么版本管理和迭代?改 Prompt 也是改代码吗?
考察 Prompt 工程化治理能力。核心答案:Prompt 即代码——进 git、有版本号、改动绑评测、灰度上线、可回滚,迭代闭环靠线上 badcase 驱动。
- 73
一个系统需要多种人格时怎么办?多角色 Prompt 怎么设计?
考察多角色 Prompt 的架构取舍。核心答案:单 Prompt 内分角色适合轻量场景,重场景用路由+多 System Prompt 或多 Agent,关键是角色边界和切换一致性。
- 74
什么是 Prompt 注入攻击?生产环境怎么防御?
考察 LLM 应用安全意识。核心答案:注入源于指令与数据同通道,防御要分层——输入隔离、指令加固、输出过滤、权限最小化,Prompt 层只是其中一环。
- 75
如何保证大模型输出严格的 JSON 格式?结构化输出有哪些手段?
考察结构化输出的工程实现。核心答案:Prompt 约束+示例只是第一档,JSON mode、Function Calling、约束解码逐级增强,解析端必须做校验和重试兜底。
- 76
Chain-of-Thought 思维链是什么?什么场景该用、怎么用?
考察 CoT 的原理理解和落地判断力。核心答案:让模型显式展开中间推理步骤以提升复杂推理准确率,给出 zero-shot/few-shot 用法、适用边界和成本权衡。
- 77
Few-shot 示例应该怎么选?示例数量、质量和顺序有什么讲究?
考察 few-shot 提示的实战经验。核心答案:示例贵在典型和多样不在多,覆盖边界 case,注意顺序与分布偏差,动态检索选例是进阶玩法。
- 78
System Prompt 应该怎么设计?有哪些原则和常见坑?
考察 System Prompt 的设计原则。核心答案:稳定指令放 System、规则要可执行可验证、分层组织、长度克制,并讲清与 User Prompt 的分工。
- 79
一个高质量 Prompt 应该包含哪些组成部分?结构化模板怎么设计?
考察 Prompt 的结构化设计能力。核心答案:角色、任务、上下文、约束、输出格式五要素缺一不可,配合分隔符与占位符工程化落地。
- 80
设计一个大模型应用的安全架构,要考虑哪些层面
大模型应用安全架构按五层展开:接入层过滤、模型层对齐、编排层权限收敛、数据层隔离、运营层监控响应,核心假设是模型不可信。
- 81
Agent 系统的可观测性怎么做?trace、步数和成本怎么盯
Agent 可观测性的核心是完整 trace:跨步关联的调用链、按步维度的质量与成本指标、以及支撑归因分析的检索与告警体系。
- 82
大模型应用上线前评测和上线后回归体系怎么搭
上线前靠三层评测集加发布门禁,上线后靠灰度、影子测试、线上抽检和持续回归,把大模型应用的不确定性管成工程流程。
- 83
大模型应用的内容安全怎么做?敏感词方案为什么不够
内容安全要输入输出双侧把关:敏感词兜底、分类模型主力、大模型审核语义级风险,加上变体对抗、兜底话术和审计留痕。
- 84
OWASP LLM Top 10 有哪些风险?面试怎么讲出落地感
按威胁面梳理 OWASP LLM Top 10 核心风险,重点讲注入、泄露、供应链、过度代理四项的工程含义与对应缓解措施。
- 85
Prompt 注入攻击的原理、攻击面与分层防御体系
Prompt 注入分直接与间接两类,本质是模型分不清指令和数据;防御靠输入过滤、上下文隔离、工具权限收敛、输出审计的纵深体系。
- 86
大模型应用的红队测试怎么做?和普通安全测试有什么不同
红队测试用攻击者视角主动构造越狱、注入、越权、泄露样本,覆盖 OWASP 风险面,按攻击成功率度量并接入发布门禁。
- 87
大模型应用的 badcase 怎么收集、归因和回归,形成闭环
badcase 体系的关键是闭环:线上多渠道收集、按错误类型归因打标、修复后入评测集回归,让每一次线上事故都变成评测资产。
- 88
用 LLM-as-Judge 做自动评测,怎么控制它的偏差
LLM-as-Judge 有位置偏差、冗长偏差、自我偏好等问题,通过成对比较、打乱顺序、rubric 细化、人工校准和一致性监控把可信度提上来。
- 89
Agent 的轨迹评估和结果评估有什么区别?为什么两个都要做
结果评估看终局对错,轨迹评估看每一步决策质量;只评结果会漏掉运气分和隐患,只评轨迹则失去业务锚点,两者结合才能归因。
- 90
Agent 效果怎么量化评估?除了任务成功率还要看什么
讲清 Agent 评估的四层指标体系:任务成功率、轨迹质量、效率与成本、安全合规,以及离线评测集与线上影子测试的组合打法。
- 91
业务落地怎么选模型:从任务分层到成本压测的选型方法论
给出 AI Native 工程师的模型选型框架:按任务复杂度分层选档位、用自建评测集实测、综合延迟成本合规三约束定方案。
- 92
Tokenizer 与 BPE:token 是什么,为什么它直接影响成本和效果
讲清 BPE 分词的合并逻辑和 token 与字词的对应关系,覆盖词表大小权衡、中文切分、成本估算等应用工程师必须懂的实际影响。
- 93
SFT 和 RLHF 各解决什么问题:后训练流水线怎么分工
讲清预训练、SFT、RLHF/DPO 三阶段的目标分工,解释偏好对齐为什么不能简单用 SFT 替代,以及中小团队该做到哪一步。
- 94
LoRA 微调原理:低秩旁路为什么够用,工程上怎么落地
讲清 LoRA 冻结主干、旁路低秩分解的核心思想与秩 r 的选择经验,覆盖推理合并、QLoRA、适用边界等落地细节。
- 95
大模型幻觉的成因与工程缓解:为什么治不了本,但能关进笼子
从训练目标层面解释幻觉为何无法根除,再给出 RAG 约束、拒答校准、校验回路等 AI Native 工程上真正管用的缓解组合拳。
- 96
temperature、top-p、top-k 到底怎么调:生成采样调参实战
讲清三个采样参数各自的作用机制与叠加顺序,给出确定性任务、Agent 工具调用、创意生成三类场景的调参组合和常见误区。
- 97
位置编码的演进:从正弦编码到 RoPE,以及长上下文扩展
讲清为什么注意力需要位置信息、RoPE 用旋转把相对位置注入 QK 内积的原理,以及上下文窗口扩展的工程手段与边界。
- 98
Self-Attention 完整计算过程:为什么 Softmax 前要除以根号 d_k
走一遍 QKV 到注意力输出的完整链路,从数值稳定性角度讲清缩放因子的由来,再落到复杂度、KV Cache 等工程推论。
- 99
为什么主流大模型都走 Decoder-only 路线
从训练目标、数据可得性和工程统一性三个角度解释 GPT 式 Decoder-only 为何胜出,以及这个架构选择对应用开发的实际影响。
- 100
把 Transformer 架构讲清楚:每个模块在工程上意味着什么
拆解 Transformer 的注意力、FFN、残差与 LayerNorm 各模块职责,讲清它取代 RNN 的原因,以及做 AI 应用必须懂的几个工程推论。