91学AI · AI Native 工程师

面试题精选 100

从知识框架核心题到公司真题库必刷题,按模块分组编号。时间紧就刷这一页——刷完这 100 题,覆盖面试 90% 的考点。

精选·Agent架构

15该分类全部 →
  1. 1

    面试时怎么讲好一个 Agent 项目?

    讲 Agent 项目按「业务问题-为什么用Agent-架构取舍-踩坑与数据」四段式展开,重点讲权衡和量化结果,而不是堆技术名词。

  2. 2

    Agent 系统怎么做评估?指标和流程怎么设计?

    Agent 评估要分层:端到端任务成功率、过程指标(步数/工具准确率)、组件级单测,配合影子测试和 LLM-as-Judge,核心是评估集先行。

  3. 3

    Agent 的能力边界在哪?什么事情它做不好?

    Agent 的能力边界受限于模型推理上限、上下文窗口、工具覆盖度和环境反馈质量;高确定性、强实时、零容错场景不是它的主场。

  4. 4

    Agent 编排框架怎么选型?LangGraph、AutoGen 这些怎么比?

    编排框架按抽象层级选:LangChain 管组件、LangGraph 管状态机、AutoGen 管多 Agent 对话,生产首看可控性与可观测。

  5. 5

    子 Agent(Subagent)应该怎么设计?什么时候拆?

    子 Agent 的核心价值是上下文隔离与并行:独立窗口处理子任务,只回传压缩结论;设计关键是任务契约、结果协议和调度成本权衡。

  6. 6

    Harness 是什么?为什么 Agent 需要 Harness Engineering?

    Harness 是包裹 LLM 的运行支撑框架:工具执行、上下文管理、权限、循环控制、可观测都在这一层;模型负责智能,Harness 负责可靠。

  7. 7

    Agent 的工具调用失败了怎么办?降级策略怎么设计?

    Agent 可靠性要从语义、逻辑、异常三层保障工具调用;降级链路包括重试、换工具、小模型兜底、人工接管,输出侧用 schema 校验守门。

  8. 8

    Agent 陷入死循环怎么办?循环控制怎么做?

    ReAct 死循环靠硬上限(步数/超时/token预算)、重复检测和prompt引导三层防御;终止控制是 Agent 从 demo 到生产的关键工程。

  9. 9

    Agent 的核心组成是什么?画一个分层架构怎么画?

    Agent 核心四件:LLM 决策大脑、工具层、记忆层、规划与循环控制;分层架构按交互层-编排层-能力层-基础设施层划分,关注点各不相同。

  10. 10

    什么时候需要多 Agent 协作?常见的协作模式有哪些?

    多 Agent 在上下文隔离、天然并行、专精分工时才有价值;协作模式有中心化编排、流水线、对等讨论三类,要防无限循环和通信爆炸。

  11. 11

    Agent 有哪些工作模式?ReAct 之外的几种各有什么优缺点?

    ReAct、Plan-and-Execute、Reflection、Multi-Agent 四种模式在规划、纠错与成本上各有取舍,按任务特征组合选型。

  12. 12

    Agent 和 Workflow 有什么区别?怎么判断该用哪个?

    Workflow 是人预编的固定路径,Agent 是模型运行时动态决策;选型看步骤是否可预知、出错代价、可审计性要求,生产上多是两者混合。

  13. 13

    Plan-and-Execute 模式是什么?执行中发现计划不合理怎么办?

    Plan-and-Execute 先由规划器生成完整计划再逐步执行,配合 Replan 机制应对计划失效;比 ReAct 省 token,适合长程可分解任务。

  14. 14

    ReAct 模式的原理是什么?工程上怎么落地?

    ReAct 让模型交替输出推理(Thought)与行动(Action),把观察结果回填上下文形成闭环;落地关键是轨迹格式、工具协议和循环刹车。

  15. 15

    Agent 和 LLM 有什么区别?项目里该用直接调用还是 Agent?

    LLM 是无状态的文本函数,Agent 是以 LLM 为决策核心、带工具、记忆和循环的执行系统;选型看任务是否需要多步行动与外部交互。

精选·工具调用与协议

15该分类全部 →
  1. 16

    你怎么看当前 Agent 工具生态(MCP、Skills、CLI)的现状与问题?

    考察对工具生态的宏观判断。核心:MCP 已成事实标准但 Server 质量参差、安全治理滞后;Skills 与 CLI 热潮本质是「给 Agent 用的接口」复兴;生态处在早期,选型要克制。

  2. 17

    Function Calling、MCP、Skill、A2A 的层级关系是什么?生产系统怎么选型共存?

    考察四者的整体选型框架。核心:FC 是模型语法层、MCP 是工具接入层、Skill 是知识流程层、A2A 是 Agent 协作层,四层各管一段;按工具数量、复用范围、协作边界逐层决定要不要引入。

  3. 18

    工具调用失败了怎么办?Agent 工具链的错误处理与容错怎么设计?

    考察工具调用的容错设计。核心:错误分层(参数错/执行错/系统错)分别处置,错误以可读文本回传模型让其自我纠正,配合超时、有限重试、幂等与降级兜底。

  4. 19

    工具描述(description)怎么写,模型才能调得准?

    考察工具描述的写作方法论。核心:description 是模型选择工具的唯一依据,要写清干什么、何时用、何时不用、参数约束与示例,短而信息密,并靠线上命中率数据持续迭代。

  5. 20

    如果让你开发一个 MCP Server,完整流程和关键工程点是什么?

    考察 MCP Server 的实战开发能力。核心:用官方 SDK 声明 Tools/Resources,stdio 本地起步、Streamable HTTP 远程发布,用 MCP Inspector 调试,重点在 schema 设计、错误处理与鉴权。

  6. 21

    Agent 调用工具的安全与权限怎么保障?怎么防止误删数据、防注入?

    考察工具调用的安全体系。核心:工具分级 + 最小权限 + 写操作人工确认 + 参数服务端校验 + 注入防御(指令数据分离、输出过滤)+ 全链路审计,纵深防御而非单点拦截。

  7. 22

    Skill 和 Tool(MCP)是什么关系?一个 Skill 能跨多个 MCP Server 调工具吗?

    考察 Skill 与 Tool 的分工。核心:Tool 提供「能做什么」的能力,Skill 提供「该怎么做」的知识与流程,Skill 可以编排多个 MCP Server 上的工具完成任务,两者是互补而非替代。

  8. 23

    什么是 Agent Skill?它的定位、结构与加载机制是什么?

    考察 Agent Skill 的概念与机制。核心:Skill 是打包的领域知识与操作规程(SKILL.md + 资源文件),靠 name/description 渐进式加载,按需展开,把上下文成本从「全量常驻」降到「用时才付」。

  9. 24

    MCP 和 A2A 都是协议,区别在哪?为什么 MCP 解决不了 A2A 要解决的问题?

    考察两个协议的分工边界。核心:MCP 是 Agent 对工具的垂直调用协议(请求-响应、确定性),A2A 是 Agent 对 Agent 的水平协作协议(任务制、异步多轮),抽象对象不同所以互不替代。

  10. 25

    A2A 协议是什么?它要解决什么问题?

    考察对 A2A 定位的理解。核心:A2A 解决 Agent 与 Agent 之间的互操作问题,通过 Agent Card 做能力发现、Task 做任务生命周期管理,面向长耗时、多轮协作的远程 Agent。

  11. 26

    MCP 有哪些传输方式?底层消息格式是什么?为什么不用 WebSocket?

    考察 MCP 传输层细节。核心:消息格式是 JSON-RPC 2.0,本地用 stdio、远程用 Streamable HTTP(取代旧 HTTP+SSE),选 HTTP 系而非 WebSocket 是为兼容 Serverless 与现有基础设施。

  12. 27

    MCP 和 Function Calling 有什么本质区别?实际场景怎么选型?

    考察 FC 与 MCP 的分层关系。核心:FC 是模型侧的输出能力,MCP 是应用侧的工具接入协议,二者是不同层的互补关系;选型看工具数量、复用范围和团队边界。

  13. 28

    MCP 是什么?Host、Client、Server 三角色的架构怎么理解?

    考察 MCP 核心架构。核心:Host 是跑模型的应用,Client 是协议连接管理器,Server 暴露 Tools/Resources/Prompts 三类原语,拆角色是为了一对多连接和职责隔离。

  14. 29

    设计 Function Calling 的 tool schema 有哪些要点?怎么设计模型才调得准?

    考察工具 schema 的工程化设计。核心:name 动词化、参数用 JSON Schema 强类型加枚举收敛、必填最小化、工具按原子性拆分,schema 本身就是写给模型看的 Prompt。

  15. 30

    Function Calling 是什么?底层原理与完整调用流程是什么?

    考察对 Function Calling 机制的理解。核心:模型只输出结构化的 tool_calls,真正执行在应用层;调用是「模型提议—代码执行—结果回填」的多轮闭环。

精选·上下文与记忆

12该分类全部 →
  1. 31

    AGENTS.md / CLAUDE.md 这类文件怎么写才有效?有哪些实践经验?

    AGENTS.md/CLAUDE.md 是每次会话自动注入的项目级持久记忆,写法要短、具体、可执行、分层组织、随代码演进维护,反模式是写成长篇文档无人更新反成误导源。

  2. 32

    什么是记忆污染?Agent 的记忆系统怎么防污染?

    记忆污染指幻觉、注入攻击、过期信息、低质提炼四类脏数据进入长期记忆;防法是把住写入关(打分查重标来源)、读取关(置信度区分)和清理关(TTL 与巡检)。

  3. 33

    RAG 是 Agent 记忆的一部分吗?记忆系统和 RAG 是什么关系?

    RAG 检索的是静态外部知识,记忆是动态积累的用户与交互信息;二者共用检索管道可复用基础设施,但数据来源、写入方、时效性和更新方式完全不同,应分库存储。

  4. 34

    上下文窗口的 token 预算怎么分配?渐进式加载能省多少?

    上下文预算按系统指令、工具、检索、记忆、历史、输出六块分配额度;工具和 Skill 渐进式加载只留名称描述,能把 schema 开销从数万 token 压到一两千。

  5. 35

    什么是 scratchpad 外置?为什么 Agent 的中间产物不该堆在对话历史里?

    scratchpad 外置是把计划、TODO、中间结果写到文件或结构化状态里而非堆在对话历史,需要时读回,换来省 token、可断点续传、可审计三个收益。

  6. 36

    Agent 怎么实现跨会话记忆?多会话之间又该怎么隔离?

    跨会话记忆靠会话末提炼写入长期记忆库、新会话启动按用户召回注入;隔离靠命名空间分层(用户/项目/会话)加元数据过滤,共享与隔离按信息性质分级。

  7. 37

    Claude Code 是怎么做上下文管理的?有哪些可借鉴的设计?

    Claude Code 的上下文管理靠 CLAUDE.md 持久记忆、auto-compact 阈值压缩、子 Agent 隔离、工具输出截断落盘四件套,是上下文工程的最佳实践样板。

  8. 38

    会话太长挤爆上下文窗口怎么办?上下文压缩有哪些手段?

    上下文压缩手段从粗到细有滑动截断、滚动摘要、结构化事实提取、工具结果落盘留引用四层;按阈值触发、保留原文可回溯是工程上不漏关键信息的关键。

  9. 39

    记忆召回怎么做?向量相似度、时间衰减和重要性怎么组合?

    记忆召回用向量相似度保证相关性、时间衰减体现时效性、重要性分数兜底关键事实,三者加权打分取 top-k,再用元数据过滤和重排序控制注入质量。

  10. 40

    Agent 长期记忆的写入时机和写入策略怎么设计?

    记忆写入有逐轮写、会话末批量提炼、触发式写入三种时机;工程上要配重要性打分、写入前查重、冲突解决和 TTL,宁可少写不错写。

  11. 41

    Agent 的短期记忆和长期记忆怎么划分?分别怎么实现?

    短期记忆是会话内工作记忆,活在上下文窗口里;长期记忆跨会话持久化,走外部存储加检索召回;划分依据是生命周期和访问模式,不是存储介质。

  12. 42

    什么是上下文工程?它和 Prompt 工程有什么区别?

    上下文工程是为模型每次推理动态组装恰当信息的工程实践,涵盖记忆、检索、工具、历史四类来源;与 Prompt 工程的区别在于从"写好一句话"升级为"管好一个信息流"。

精选·RAG工程

15该分类全部 →
  1. 43

    面试时被连环拷打 RAG 项目细节,怎么应对?

    面渣逆袭式 RAG 项目拷打应对指南。讲清「角色-难点-数据-权衡」四件套的准备方法,以及被问倒时的话术边界。

  2. 44

    场景题:如何设计一个高召回率的商品问答 RAG 系统?

    电商商品问答 RAG 设计题。从垂类检索瓶颈出发,给出多路召回+属性结构化+意图分流的完整架构与召回率优化路径。

  3. 45

    RAG 场景怎么控制大模型幻觉?检索到错误内容怎么办?

    把幻觉拆成「没检索到硬答、检索错、检索对但没照着答」三类,对应阈值兜底、引用约束、后验核对三层防线。

  4. 46

    什么是 Agentic RAG?和传统 RAG 流水线有什么区别?

    讲清 Agentic RAG 用 Agent 决策替代固定流水线的本质,路由/反思/多轮检索/工具组合四种模式,以及延迟成本代价与适用边界。

  5. 47

    什么是 GraphRAG?为什么 RAG 要用到图数据库?

    讲清向量检索在关系推理、全局总结上的盲区,GraphRAG 的实体抽取-建图-社区摘要流程,以及引入图的成本与适用边界。

  6. 48

    RAG 和微调怎么选?电商客服场景该用哪个?

    从知识实时性、成本、幻觉控制、能力边界四个维度对比 RAG 与微调,给出「知识用 RAG、能力用微调」的选型框架。

  7. 49

    Query 改写怎么做?为什么要改写用户的问题?

    讲清多轮指代补全、同义扩展、HyDE、多 query 分解四种改写技术的适用场景与风险,以及用小模型低延迟实现的工程实践。

  8. 50

    多路召回的结果怎么融合?各路权重怎么定?

    讲清分数融合与排名融合的差异,RRF 的原理与工程优势,以及权重调优从免调到按路加权的演进路径。

  9. 51

    怎么量化 RAG 的回答效果?检索和生成分别怎么评测?

    拆检索侧(Recall@K、命中率)与生成侧(忠实度、相关性)两层指标,讲评测集构造、RAGAS 框架与人工抽检的组合打法。

  10. 52

    Rerank 是什么?为什么召回之后还要重排序?

    讲清双塔召回与交叉编码器 Rerank 的原理差异,主流 Rerank 模型选型,以及接入位置、条数、延迟的工程经验。

  11. 53

    什么是混合召回/多路召回?为什么纯向量检索不够用?

    讲清向量召回与 BM25 关键词召回的互补性,多路召回(向量/关键词/实体/FAQ)的架构设计和 RRF 融合方法。

  12. 54

    向量数据库怎么选?Qdrant、Milvus、ES、pgvector 各适合什么场景?

    对比 Qdrant/Milvus/pgvector/ES 等向量库的性能、过滤能力、运维成本,给出按数据量级选型的决策框架和 HNSW 参数经验。

  13. 55

    Embedding 是什么?你们用的哪个模型?怎么选型?

    讲清 Embedding 原理与训练目标,给出 bge/m3e/OpenAI 等主流选型对比,以及领域微调、维度、多语言等实战考量。

  14. 56

    文档切分策略有哪些?怎么避免语义被切断?

    RAG 高频题。对比固定长度/递归/语义/结构四种切分,讲清 chunk 大小与 overlap 的经验值,以及表格、跨页等语义断裂的工程解法。

  15. 57

    介绍一下 RAG?核心流程是什么?最难的地方在哪里?

    RAG 基础必考题。讲清离线建索引+在线检索生成两段流程,指出难点不在「跑通」而在检索质量、切分与评估的工程细节。

精选·Coding Agent与AI编程

12该分类全部 →
  1. 58

    AI 编程类的面试有什么新趋势?该怎么准备?

    AI 编程面试从考八股转向考实战:现场人机协作写代码、讲工作流、审 AI 产出找雷;准备方向是用熟一两个工具、沉淀方法论、备好事例和数据。

  2. 59

    面试官问「大家都用 AI 写代码,你的优势是什么」该怎么答?

    这题考的是 AI 拉平产出后的差异化认知:优势不在用得熟练,而在问题定义、质量判断、系统兜底三类 AI 替代不了的能力;要用具体事例佐证,别讲概念。

  3. 60

    AI 编程工具对程序员这个职业有什么影响?哪些能力在贬值,哪些在升值?

    AI 让「写代码」环节大幅贬值,程序员的重心转向问题定义、质量判断和系统设计;角色从作者变成审校与指挥,守住核心代码能力和系统理解是护城河。

  4. 61

    什么是 Harness Engineering?一个完整的 Harness 包含哪些组件?

    Harness Engineering 是围绕模型的脚手架工程:工具层、上下文层、控制层、可观测与评测;模型能力趋同后,Harness 质量才是 Agent 产品差距的主因。

  5. 62

    什么是规范驱动开发(SDD)?为什么 AI 时代它突然火了?

    规范驱动开发把 spec 提升为一等公民:先写可验收的规范,再生成计划、任务、代码;AI 时代 prompt 易逝而 spec 持久,SDD 解决的是意图漂移和返工问题。

  6. 63

    Claude Code 和 Codex 有什么区别?实际项目里怎么选?

    Claude Code 是跑在本地终端的交互式 agent,适合探索性、需频繁对齐的任务;Codex 主打云端沙箱任务派发,适合边界清晰、可并行委托的任务;选型看任务形态。

  7. 64

    AI 写代码的时代,code review 应该怎么做?和原来有什么不同?

    AI 时代 review 的重心从「逐行找错」转向「审意图、审边界、审设计」;流程上要小 PR、作者先讲清改动、测试与静态检查前置,人守住 AI 缺陷高发的三个区域。

  8. 65

    怎么保障 AI 生成代码的质量?你们的流程是什么?

    AI 代码质量保障靠四道闸:约束前置写进项目记忆、测试与静态检查机器兜底、小步提交逐段验收、合并者承担全责;核心是把信任从人转移到流程。

  9. 66

    你怎么看 vibe coding?它有什么风险,什么场景能用?

    Vibe coding 指不看代码、凭运行结果顺不顺来驱动 AI 编程的方式;原型场景提效明显,但生产场景会引入安全漏洞、隐性 bug 和不可维护代码,必须配验证底线。

  10. 67

    你用 AI 写代码的工作流是怎样的?讲讲 spec、plan、todos、verify 这套打法

    高效 AI 编程工作流分四步:先写清 spec 对齐意图,再让 AI 出 plan 人工确认,拆成 todos 小步执行,每步 verify 后再推进;核心是人在关键节点设卡。

  11. 68

    如果让你设计一个 CLI coding agent,你会考虑哪些要点?

    CLI coding agent 设计核心:工具要少而通用、输出要结构化、权限要分级、过程要可观测;终端天然提供文件系统和 shell 两大原语,是 agent 最好的栖息地。

  12. 69

    Claude Code 的架构是怎样的?它的 agent loop 是怎么工作的?

    Claude Code 本质是跑在终端里的 agent loop:模型决策、工具执行、结果回灌、循环推进;靠通用工具集、CLAUDE.md 记忆和上下文压缩支撑长任务。

精选·提示工程

10该分类全部 →
  1. 70

    Prompt 工程和微调怎么选?什么情况下该上微调?

    考察 Prompt 与微调的选型判断。核心答案:先 Prompt 后微调——知识缺失用 RAG、格式风格调不动用 SFT,微调改的是行为模式不是知识。

  2. 71

    怎么评估一个 Prompt 的效果好坏?有哪些指标和方法?

    考察 Prompt 效果评估方法论。核心答案:先建带标准答案的评测集,客观任务看准确率类指标,开放任务用 LLM-as-Judge+人工抽检,线上看业务指标闭环。

  3. 72

    Prompt 怎么版本管理和迭代?改 Prompt 也是改代码吗?

    考察 Prompt 工程化治理能力。核心答案:Prompt 即代码——进 git、有版本号、改动绑评测、灰度上线、可回滚,迭代闭环靠线上 badcase 驱动。

  4. 73

    一个系统需要多种人格时怎么办?多角色 Prompt 怎么设计?

    考察多角色 Prompt 的架构取舍。核心答案:单 Prompt 内分角色适合轻量场景,重场景用路由+多 System Prompt 或多 Agent,关键是角色边界和切换一致性。

  5. 74

    什么是 Prompt 注入攻击?生产环境怎么防御?

    考察 LLM 应用安全意识。核心答案:注入源于指令与数据同通道,防御要分层——输入隔离、指令加固、输出过滤、权限最小化,Prompt 层只是其中一环。

  6. 75

    如何保证大模型输出严格的 JSON 格式?结构化输出有哪些手段?

    考察结构化输出的工程实现。核心答案:Prompt 约束+示例只是第一档,JSON mode、Function Calling、约束解码逐级增强,解析端必须做校验和重试兜底。

  7. 76

    Chain-of-Thought 思维链是什么?什么场景该用、怎么用?

    考察 CoT 的原理理解和落地判断力。核心答案:让模型显式展开中间推理步骤以提升复杂推理准确率,给出 zero-shot/few-shot 用法、适用边界和成本权衡。

  8. 77

    Few-shot 示例应该怎么选?示例数量、质量和顺序有什么讲究?

    考察 few-shot 提示的实战经验。核心答案:示例贵在典型和多样不在多,覆盖边界 case,注意顺序与分布偏差,动态检索选例是进阶玩法。

  9. 78

    System Prompt 应该怎么设计?有哪些原则和常见坑?

    考察 System Prompt 的设计原则。核心答案:稳定指令放 System、规则要可执行可验证、分层组织、长度克制,并讲清与 User Prompt 的分工。

  10. 79

    一个高质量 Prompt 应该包含哪些组成部分?结构化模板怎么设计?

    考察 Prompt 的结构化设计能力。核心答案:角色、任务、上下文、约束、输出格式五要素缺一不可,配合分隔符与占位符工程化落地。

精选·评测安全与生产

11该分类全部 →
  1. 80

    设计一个大模型应用的安全架构,要考虑哪些层面

    大模型应用安全架构按五层展开:接入层过滤、模型层对齐、编排层权限收敛、数据层隔离、运营层监控响应,核心假设是模型不可信。

  2. 81

    Agent 系统的可观测性怎么做?trace、步数和成本怎么盯

    Agent 可观测性的核心是完整 trace:跨步关联的调用链、按步维度的质量与成本指标、以及支撑归因分析的检索与告警体系。

  3. 82

    大模型应用上线前评测和上线后回归体系怎么搭

    上线前靠三层评测集加发布门禁,上线后靠灰度、影子测试、线上抽检和持续回归,把大模型应用的不确定性管成工程流程。

  4. 83

    大模型应用的内容安全怎么做?敏感词方案为什么不够

    内容安全要输入输出双侧把关:敏感词兜底、分类模型主力、大模型审核语义级风险,加上变体对抗、兜底话术和审计留痕。

  5. 84

    OWASP LLM Top 10 有哪些风险?面试怎么讲出落地感

    按威胁面梳理 OWASP LLM Top 10 核心风险,重点讲注入、泄露、供应链、过度代理四项的工程含义与对应缓解措施。

  6. 85

    Prompt 注入攻击的原理、攻击面与分层防御体系

    Prompt 注入分直接与间接两类,本质是模型分不清指令和数据;防御靠输入过滤、上下文隔离、工具权限收敛、输出审计的纵深体系。

  7. 86

    大模型应用的红队测试怎么做?和普通安全测试有什么不同

    红队测试用攻击者视角主动构造越狱、注入、越权、泄露样本,覆盖 OWASP 风险面,按攻击成功率度量并接入发布门禁。

  8. 87

    大模型应用的 badcase 怎么收集、归因和回归,形成闭环

    badcase 体系的关键是闭环:线上多渠道收集、按错误类型归因打标、修复后入评测集回归,让每一次线上事故都变成评测资产。

  9. 88

    用 LLM-as-Judge 做自动评测,怎么控制它的偏差

    LLM-as-Judge 有位置偏差、冗长偏差、自我偏好等问题,通过成对比较、打乱顺序、rubric 细化、人工校准和一致性监控把可信度提上来。

  10. 89

    Agent 的轨迹评估和结果评估有什么区别?为什么两个都要做

    结果评估看终局对错,轨迹评估看每一步决策质量;只评结果会漏掉运气分和隐患,只评轨迹则失去业务锚点,两者结合才能归因。

  11. 90

    Agent 效果怎么量化评估?除了任务成功率还要看什么

    讲清 Agent 评估的四层指标体系:任务成功率、轨迹质量、效率与成本、安全合规,以及离线评测集与线上影子测试的组合打法。

精选·模型与微调基础

10该分类全部 →
  1. 91

    业务落地怎么选模型:从任务分层到成本压测的选型方法论

    给出 AI Native 工程师的模型选型框架:按任务复杂度分层选档位、用自建评测集实测、综合延迟成本合规三约束定方案。

  2. 92

    Tokenizer 与 BPE:token 是什么,为什么它直接影响成本和效果

    讲清 BPE 分词的合并逻辑和 token 与字词的对应关系,覆盖词表大小权衡、中文切分、成本估算等应用工程师必须懂的实际影响。

  3. 93

    SFT 和 RLHF 各解决什么问题:后训练流水线怎么分工

    讲清预训练、SFT、RLHF/DPO 三阶段的目标分工,解释偏好对齐为什么不能简单用 SFT 替代,以及中小团队该做到哪一步。

  4. 94

    LoRA 微调原理:低秩旁路为什么够用,工程上怎么落地

    讲清 LoRA 冻结主干、旁路低秩分解的核心思想与秩 r 的选择经验,覆盖推理合并、QLoRA、适用边界等落地细节。

  5. 95

    大模型幻觉的成因与工程缓解:为什么治不了本,但能关进笼子

    从训练目标层面解释幻觉为何无法根除,再给出 RAG 约束、拒答校准、校验回路等 AI Native 工程上真正管用的缓解组合拳。

  6. 96

    temperature、top-p、top-k 到底怎么调:生成采样调参实战

    讲清三个采样参数各自的作用机制与叠加顺序,给出确定性任务、Agent 工具调用、创意生成三类场景的调参组合和常见误区。

  7. 97

    位置编码的演进:从正弦编码到 RoPE,以及长上下文扩展

    讲清为什么注意力需要位置信息、RoPE 用旋转把相对位置注入 QK 内积的原理,以及上下文窗口扩展的工程手段与边界。

  8. 98

    Self-Attention 完整计算过程:为什么 Softmax 前要除以根号 d_k

    走一遍 QKV 到注意力输出的完整链路,从数值稳定性角度讲清缩放因子的由来,再落到复杂度、KV Cache 等工程推论。

  9. 99

    为什么主流大模型都走 Decoder-only 路线

    从训练目标、数据可得性和工程统一性三个角度解释 GPT 式 Decoder-only 为何胜出,以及这个架构选择对应用开发的实际影响。

  10. 100

    把 Transformer 架构讲清楚:每个模块在工程上意味着什么

    拆解 Transformer 的注意力、FFN、残差与 LayerNorm 各模块职责,讲清它取代 RNN 的原因,以及做 AI 应用必须懂的几个工程推论。

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.