91学AI · 大模型应用工程师

面试题精选 100

从知识框架核心题到公司真题库必刷题,按模块分组编号。时间紧就刷这一页——刷完这 100 题,覆盖面试 90% 的考点。

大模型基础

12该分类全部 →
  1. 1

    一个 7B 模型推理要多少显存?训练呢?怎么估算?

    考察显存估算的基本功:推理按参数量×精度字节数加 KV cache,训练按 Adam 的 16-18 倍系数拆解,附 7B/70B 的口算公式与量化收益。

  2. 2

    业务落地怎么做模型选型?Qwen、DeepSeek 各自什么特点?

    考察模型选型的决策框架:从任务、成本、部署方式、合规四个维度收敛候选,以及 Qwen(全尺寸开源生态)与 DeepSeek(MoE 性价比)的实际差异。

  3. 3

    MoE 和 Dense 模型比,收益主要体现在哪?代价又是什么?

    考察混合专家模型的稀疏激活原理,重点是「推理 FLOPs 与参数量解耦」带来的训练/推理效率收益,以及显存占用、路由稳定性、微调难度等代价。

  4. 4

    MHA、GQA、MQA、MLA 的区别和各自的优化目标是什么?

    考察四种注意力变体的 KV head 共享机制,核心是 KV cache 体积与模型效果的权衡,MLA 的低秩压缩思路是 DeepSeek 系列的关键设计。

  5. 5

    上下文窗口不够用时有哪些应对方案?

    考察长上下文问题的工程解法谱系,包括文本截断、滑窗、RAG、MapReduce、Agent 化阅读和长上下文微调,重点是按场景选型的判断力。

  6. 6

    大模型幻觉是怎么产生的?有哪些缓解手段?

    考察幻觉的成因分析(自回归训练目标、数据噪声、知识边界)和分层缓解方案,重点是 RAG、解码控制、提示工程与训练侧手段的组合使用。

  7. 7

    temperature、top-p、top-k 有什么区别?业务里怎么调?

    考察解码采样参数的原理与组合使用方式,重点是三个参数分别如何作用于概率分布,以及不同业务场景(问答/创作/代码)的调参经验。

  8. 8

    文本是怎么变成 token 的?BPE 的原理是什么,中文 token 化有什么坑?

    考察 tokenizer 的工作原理,重点是 BPE 的贪心合并算法、词表大小与压缩率的权衡,以及中文场景下的切分粒度和数字/代码退化等实际问题。

  9. 9

    位置编码有哪些?RoPE 为什么能实现相对位置编码?怎么做长度外推?

    考察位置编码的演进(正弦/可学习/相对/RoPE),RoPE 用旋转矩阵把绝对位置转成相对位置的数学原理,以及 NTK、YaRN 等长度外推方法。

  10. 10

    LayerNorm 是对哪个维度做归一化?和 BatchNorm 有什么区别?Pre-Norm 和 Post-Norm 呢?

    考察归一化的维度语义、LN 与 BN 的本质差异(为什么 NLP 用 LN),以及 Pre-Norm/Post-Norm 对深层模型训练稳定性的影响。

  11. 11

    自注意力机制的原理是什么?为什么缩放点积注意力要除以根号 d_k?

    考察对 Q/K/V 计算流程的理解深度,重点是缩放的数学动机(方差随维度增长导致 softmax 饱和)以及工程实现中的多头设计和复杂度问题。

  12. 12

    讲一下 Transformer 的整体结构,为什么现在主流大模型都是 Decoder-only?

    考察对 Transformer 三大结构(Encoder-only/Decoder-only/Encoder-Decoder)的理解,重点是因果注意力、生成任务适配性和工程效率如何推动 Decoder-only 成为主流。

提示工程

10该分类全部 →
  1. 13

    System Prompt 设计有哪些原则和常见坑?

    考察 system prompt 的设计原则:角色、指令、边界、格式的写法规范,以及指令冲突、过度依赖自觉、放密钥等常见坑。

  2. 14

    Prompt 效果怎么评估和迭代?有没有工程化的方法?

    考察 prompt 迭代的工程化方法:评测集建设、自动化指标与 LLM-as-judge、版本管理与回归测试、badcase 驱动的迭代闭环。

  3. 15

    多轮对话的上下文怎么管理?太长了怎么办?

    考察多轮对话上下文管理的工程方案:滑动窗口、摘要压缩、事实抽取、分层记忆各自的适用场景与代价,以及截断策略的设计。

  4. 16

    Prompt 工程和微调怎么选?什么场景必须微调?

    考察 prompt 工程、RAG、微调三者的选型逻辑:各自解决什么问题、成本量级差异,以及必须微调的几类典型场景。

  5. 17

    怎么让模型稳定输出 JSON 等结构化结果?

    考察结构化输出的完整方案谱系:prompt 约束、JSON mode、function calling、受限解码的原理与可靠性差异,以及校验重试的兜底设计。

  6. 18

    Prompt 注入攻击是怎么回事?怎么防?

    考察对 Prompt 注入原理、直接与间接注入区别的理解,以及纵深防御的工程实践:隔离、校验、权限最小化、人类兜底。

  7. 19

    模型不听指令怎么办?怎么定位是 prompt 问题还是模型能力问题?

    考察指令遵循问题的系统排查方法:用消融实验和对照实验区分 prompt 缺陷与模型能力上限,以及对应的修复手段。

  8. 20

    few-shot 示例怎么选?示例数量和顺序对结果有影响吗?

    考察 few-shot 示例的选择策略:相似度检索、标签均衡、数量边际递减、顺序敏感性,以及动态示例的工程实现。

  9. 21

    思维链 CoT 是什么?先 answer 后 CoT 和先 CoT 后 answer 有区别吗?

    考察对思维链原理的理解:为什么显式推理能提升复杂任务表现,以及推理和答案的输出顺序对结果可信度的本质影响。

  10. 22

    输入给模型的 Prompt 由哪些部分组成?哪些必须注入,哪些不是必须?

    考察对 Prompt 结构的系统理解:角色设定、指令、上下文、输入、输出要求等模块各自的作用,以及 token 预算下如何取舍。

RAG 检索增强

14该分类全部 →
  1. 23

    长上下文模型越来越强,还需要 RAG 吗?

    考察对 RAG 与长上下文模型边界的判断:成本、延迟、大海捞针与中间丢失问题、知识更新时效,以及两者结合的工程范式。

  2. 24

    不同文档内容冲突了怎么办?知识库怎么做版本控制?

    考察 RAG 知识库内容治理:文档冲突的检测与消解策略、时间/权威性优先级设计、版本控制方案,以及生成侧的冲突呈现。

  3. 25

    Query 改写有哪些手段?HyDE、子问题分解什么时候用?

    考察查询理解与改写技术体系:同义改写、指代消解、HyDE、子问题分解、Step-back 等手法的原理、适用场景与代价。

  4. 26

    GraphRAG 是什么?处理多跳推理和普通 RAG 有什么根本区别?

    考察 GraphRAG 的原理与适用边界:知识图谱构建流程、社区摘要机制,以及它在多跳推理、全局性问题上相对向量 RAG 的本质差异。

  5. 27

    Agentic RAG 和传统 RAG 有什么区别?检索失败后 Agent 怎么调整策略?

    考察对 Agentic RAG 范式的理解:与传统单轮流水线 RAG 的本质差异、路由/反思/重试机制,以及检索失败后的策略调整设计。

  6. 28

    PDF 里的表格、图片、扫描件怎么处理?异构文档怎么入库?

    考察异构文档解析的工程能力:文字版与扫描版 PDF 的分流、表格结构抽取、OCR 与版面分析方案,以及多模态内容入库策略。

  7. 29

    知识库文档更新了怎么办?总不能每次全量重建吧?

    考察 RAG 知识库的增量更新设计:文档变更检测、chunk 级 diff、向量库删除与重建策略,以及如何保证更新期间检索一致性。

  8. 30

    你怎么知道你的 RAG 有效?评测集怎么构造?baseline 是什么?

    考察 RAG 效果度量体系:检索层指标(Recall@K、MRR)与生成层指标(忠实度、答案相关性)分开评,评测集从真实日志构造,baseline 逐级消融。

  9. 31

    为什么要加 Rerank?Recall@K 和 Precision@K 怎么取舍?Top-K 怎么动态调整?

    考察粗排+精排两阶段架构:双塔召回快但弱、cross-encoder 准但慢;Recall 与 Precision 的分工及 Top-K 动态调整。

  10. 32

    为什么要做混合召回?BM25 已经很好了,向量检索还有必要吗?

    考察对稀疏与稠密检索互补性的理解:BM25 擅长精确词匹配但不懂语义,向量懂语义但对专名编号不灵,混合召回与 RRF/加权融合是标准解法。

  11. 33

    向量数据库怎么选型?从 ES 切换到向量检索,哪些能力提升、哪些下降?

    考察向量库选型权衡:按数据量级选 pgvector/Milvus/ES,以及 ES 倒排切向量检索后语义召回与精确匹配能力的此消彼长。

  12. 34

    Embedding 模型怎么选?输出向量维度多少?你调研过哪些模型?

    考察 embedding 选型方法论:MTEB/C-MTEB 榜单怎么用、bge-m3 等主流模型的维度与特性、维度对存储和延迟的影响。

  13. 35

    文档切分策略怎么选?切分粒度、重叠长度怎么定?

    考察 chunking 的实战经验:固定长度、结构切分、语义切分的取舍,chunk size 与 overlap 的确定方法,以及父子切分等进阶手段。

  14. 36

    讲讲 RAG 的整体流程,每个环节有哪些坑?

    考察对 RAG 全链路的系统理解:离线索引与在线检索生成两大阶段,重点是说清切分、召回、上下文组装、生成各环节的典型坑与对策。

Agent 开发

14该分类全部 →
  1. 37

    Agent 上生产环境要考虑什么?状态保存恢复、重试、成本怎么控?

    考察 Agent 生产化的完整清单:checkpoint 状态恢复与工具幂等、分层重试与超时、全链路可观测、模型路由与上下文管理等成本控制手段。

  2. 38

    怎么看扣子(Coze)这类低代码 Agent 平台?和代码框架怎么选?

    考察对低代码 Agent 平台的务实判断:优势在验证速度和协作门槛,短板在复杂控制流、工程化缺失和平台锁定,选型看流程复杂度与生命周期。

  3. 39

    Agent 表现不符合预期,怎么定位是 prompt、模型能力还是流程设计问题?

    考察 Agent 排障方法论:先拿完整 trace 找第一个偏离点,再按工具、上下文、模型、流程四层隔离变量,最后沉淀 eval 集防回归。

  4. 40

    Claude Code、Codex 各自有什么特点?Coding Agent 的设计要点是什么?

    考察对主流 Coding Agent 架构的理解:Claude Code 终端原生加 agentic search,Codex 云沙箱异步派单,设计核心是工具克制、上下文管理和验证闭环。

  5. 41

    工具调用进入死循环怎么办?迭代限制、循环检测、降级策略怎么做?

    考察 Agent 失控场景的兜底体系:迭代与预算硬限制、重复调用与无进展检测、分级降级策略,以及线上步数监控。

  6. 42

    MCP 协议是什么?解决什么问题?和 Function Calling 什么关系?

    考察对 MCP 协议定位的理解:它用开放标准解决 M×N 工具集成问题,与 Function Calling 是不同层次、串联协作而非替代关系。

  7. 43

    LangGraph 和 LangChain 什么区别?为什么选 LangGraph 而不是 AutoGen、CrewAI 或手写状态机?

    考察对主流 Agent 框架抽象差异的理解:LangChain 是链式组件库,LangGraph 是带持久化状态机的 Agent 运行时,选型要看控制流复杂度和生产需求。

  8. 44

    Agent 的上下文压缩怎么做?压缩过度导致效果下降怎么发现和处理?

    考察长程 Agent 的上下文管理:截断、摘要、工具结果掩码、LLM 压缩器等手段怎么选,以及压缩过度如何通过在线指标、回归评测、错误归因来发现和兜底。

  9. 45

    Agent 的记忆系统怎么设计?短期记忆和长期记忆怎么区分?

    考察 Agent 记忆系统设计:短期记忆是上下文窗口内的工作状态(对话历史、scratchpad),长期记忆是持久化的用户画像、经验与知识,用向量库等外存召回。

  10. 46

    多 Agent 怎么分工、通信和终止?如何避免死循环和互相扯皮?

    考察多 Agent 系统设计:按职责拆角色的分工模式、消息传递/共享黑板/交接的通信机制、明确的终止协议,以及用最大轮数、预算、仲裁者防死循环。

  11. 47

    Workflow 和 Agent 有什么区别?业务里怎么选?

    考察对两种 LLM 应用编排范式的理解:Workflow 是代码预定义执行路径、LLM 做局部决策,Agent 是 LLM 自主规划路径;选型看任务确定性、容错要求和成本。

  12. 48

    Tool Calling 你怎么设计?schema 定义、失败兜底、危险工具防护怎么做?

    考察工具调用的工程设计能力:JSON Schema 怎么写模型才调得准,失败时重试/降级/熔断怎么分层,写操作类危险工具如何用白名单、审批、沙箱防护。

  13. 49

    Agent 循环流程是怎样的?讲讲 ReAct 的架构和工作原理。

    考察对 Agent 主循环与 ReAct 范式的理解:推理与行动交替执行、观察结果回流,循环要有终止条件和异常兜底。

  14. 50

    你怎么理解 Agent?和普通大模型问答最大的区别是什么?

    考察对 Agent 本质的理解:Agent 是「模型自主决策 + 工具调用 + 环境反馈」的闭环系统,与普通问答的核心区别在于它能多步行动、根据反馈自我修正。

微调与对齐

12该分类全部 →
  1. 51

    微调效果怎么评估?怎么防止过拟合?

    考察微调效果的评估体系与过拟合防控:训练/验证 loss 之外还要有任务指标、通用基准与人工评审,早停、正则、数据侧手段的组合使用。

  2. 52

    知识蒸馏是什么?怎么用强模型给小模型造数据?

    考察知识蒸馏的三种形态(logits、特征、数据蒸馏)与落地路径:温度软化的 KL 损失设计,以及用强模型生成指令/推理链数据训练小模型的工程流程。

  3. 53

    什么时候值得做全参微调?没做过的话怎么判断值不值得做?

    考察微调投入决策能力:按 prompt→RAG→LoRA→全参的成本阶梯逐级判断,从任务性质、数据量、算力预算、效果差距四个维度评估全参的必要性。

  4. 54

    如果让你对比 LoRA 和全参微调,实验怎么设计?控制哪些变量、看哪些指标?

    考察训练实验设计能力:如何在数据、步数、学习率各自对齐的前提下公平对比 LoRA 与全参,以及从任务效果、遗忘、成本三类指标下结论。

  5. 55

    大模型的灾难性遗忘问题怎么解决?

    考察对灾难性遗忘机理与工程对策的理解:数据混合回放、正则化约束、参数高效微调、小学习率与早停等手段的适用场景与权衡。

  6. 56

    PPO、DPO、GRPO 分别是什么?DPO 相比 PPO 做了哪些改进?

    考察三种主流偏好优化算法的机制与取舍:PPO 的在线 RL 范式、DPO 的闭式偏好直接优化、GRPO 的组内相对优势,以及 DPO 省掉 RM 和采样的本质。

  7. 57

    讲讲 RLHF 的基本流程,奖励模型(RM)的训练数据怎么构建?

    考察 RLHF 三阶段流程(SFT、RM 训练、PPO 优化)的完整理解,重点是 RM 偏好数据的采样、排序标注方式与 pairwise 损失的设计。

  8. 58

    SFT 和 RLHF 的作用有什么区别?为什么 SFT 之后还要 RLHF?

    考察对对齐两阶段分工的理解:SFT 学行为范式与格式,RLHF 注入人类偏好与价值排序;核心论点是 SFT 只能模仿正例,无法表达「哪个更好」。

  9. 59

    SFT 训练数据怎么构造?数据质量要求高体现在哪些方面?数据量怎么确定?

    考察 SFT 数据工程的实操理解:指令数据的来源与构造流程、质量要求的具体维度(准确性、多样性、一致性)、以及量级选择的依据。

  10. 60

    LoRA 实践:rank 怎么选?为什么优先微调 Attention 的 Q/K/V/O 而不是 FFN?lr 设置有什么技巧?

    考察 LoRA 落地调参经验:rank 与 alpha 的取舍、target modules 选注意力层的原因、学习率要比全参大一个数量级的原理及常见踩坑。

  11. 61

    讲一下 LoRA 的原理和细节:低秩矩阵为什么有效、A/B 怎么初始化、更新哪些参数?

    考察对 LoRA 数学原理与实现细节的掌握:低秩假设的来源、ΔW=BA 的参数化方式、A 高斯 B 置零的初始化设计,以及合并推理等工程要点。

  12. 62

    你了解哪些微调方式?LoRA、P-Tuning、Adapter 的异同点是什么?

    考察对参数高效微调(PEFT)方法体系的掌握,重点说清 LoRA、Adapter、P-Tuning 在改动位置、参数量、推理开销上的本质差异和选型依据。

推理与部署

12该分类全部 →
  1. 63

    流式输出怎么实现?SSE 中断、断连怎么处理?

    考察流式输出的工程实现:SSE 协议细节、推理侧增量生成、断连检测与取消、以及客户端重连恢复策略。

  2. 64

    大模型应用怎么控制成本?缓存、模型路由、大小模型搭配怎么做?

    考察 LLM 应用的成本结构认知和工程化降本能力:语义缓存、模型路由、级联调用三大手段的原理、收益与风险。

  3. 65

    长文本生成时显存占用怎么优化?

    考察长上下文场景的显存治理手段:KV Cache 是显存大头,从架构、量化、调度、外推四条线分别给出方案。

  4. 66

    大模型 API 服务响应延迟高,怎么优化?

    考察延迟问题的系统性排查能力:先拆 TTFT 与 TPOT 定位瓶颈段,再从排队、prefill、decode、网络四层给出针对性手段。

  5. 67

    FlashAttention 的思想和做法是什么?

    考察对注意力计算瓶颈的理解:FlashAttention 用分块计算和 online softmax 避免 O(N²) 显存读写,IO 感知是核心思想。

  6. 68

    投机采样(Speculative Decoding)原理是什么?Medusa、MTP 了解吗?

    考察对 decode 阶段加速路线的理解:用小模型起草、大模型并行验证实现无损加速,以及 Medusa、EAGLE、MTP 等变体的取舍。

  7. 69

    PD 分离(Prefill/Decode 分离)是干什么的?解决什么问题?

    考察对 Prefill/Decode 两阶段资源特性差异的理解:PD 分离让两阶段独立扩缩容和调度,消除互相干扰,是长上下文高并发的关键架构。

  8. 70

    Continuous Batching 是什么?比静态批处理好在哪里?

    考察迭代级调度的理解:continuous batching 按 token 粒度进出 batch,消除静态批处理中"短请求陪跑长请求"的空转浪费。

  9. 71

    大模型服务的吞吐和延迟怎么权衡?TTFT、TPOT 是什么?

    考察推理服务的核心指标体系和 trade-off 判断力:batch size 如何同时影响吞吐与延迟,TTFT/TPOT 分别对应什么用户体验。

  10. 72

    vLLM 为什么快?PagedAttention 解决了什么问题?

    考察对 vLLM 核心机制的理解:PagedAttention 借虚拟内存思想消除 KV Cache 碎片浪费,配合 continuous batching 把吞吐提升数倍。

  11. 73

    量化的原理是什么?GPTQ、AWQ 有什么区别?int8、int4 怎么选?

    考察对模型量化原理和主流 PTQ 算法的理解:对称/非对称量化、GPTQ 与 AWQ 的技术路线差异,以及按场景选 bit 数的判断力。

  12. 74

    KV Cache 是什么?怎么加速推理?显存占用怎么算?

    考察对自回归推理瓶颈的理解:KV Cache 用空间换时间避免重复计算,要求能手推显存占用公式并说出优化手段。

评测与安全

10该分类全部 →
  1. 75

    红队测试怎么做?

    考察红队工程化能力:先按业务梳理攻击面并风险分级,攻击样本结合人工对抗与自动化生成,发现的漏洞走分级修复闭环,攻击样本沉淀为常驻回归集。

  2. 76

    AI 功能的指标体系怎么搭?怎么避免被单一「解决率」误导?

    考察 AI 产品度量能力:指标体系按北极星、效果、体验、护栏四层搭建,解决率口径容易被刷和误读,要用满意度、复访率、人工介入率交叉验证并分层切片。

  3. 77

    怎么保证每次 prompt 或模型迭代效果不倒退?

    考察迭代质量保障能力:prompt 当代码做版本管理、核心指标进 CI 门禁且阈值要大于自然波动、线上走灰度和 shadow 验证、护栏指标异常自动回滚。

  4. 78

    大模型应用有哪些安全风险?越狱、敏感内容怎么防?

    考察安全攻防全景:风险分输入攻击(越狱、注入)、输出风险(有害内容、数据泄露)、系统风险(越权调用),防御靠输入输出过滤、护栏模型和权限最小化的分层体系。

  5. 79

    幻觉怎么检测和监控?线上怎么兜底?

    考察幻觉治理的工程闭环:检测靠检索对照、NLI 一致性校验和多次采样,监控靠抽样加用户反馈信号,兜底靠引用溯源、低置信拒答和人工接管。

  6. 80

    主流 benchmark 有哪些?为什么不能只看 benchmark 选模型?

    考察对公开榜单的批判性认识:MMLU、HumanEval 等榜单存在数据污染、饱和、分布不匹配问题,正确姿势是榜单初筛加业务自建评测集复测。

  7. 81

    检索召回率怎么理解?忠实度是什么?这些指标的分子分母怎么定义?

    考察 RAG 评测指标的定义功底:检索侧召回率、命中率、MRR 的分子分母口径要能说清,生成侧忠实度衡量答案陈述被上下文支撑的比例,RAGAS 是常用落地框架。

  8. 82

    用另一个大模型做评测(LLM-as-Judge),它的正确率和自我一致性怎么保证?

    考察对 LLM-as-Judge 可靠性的理解:先用人工标注金标准测一致率,再针对位置偏差、冗长偏差、自我偏好做工程矫正,多次采样校验稳定性。

  9. 83

    评测集怎么构造?多少条够?怎么防过拟合?评测集需要更新吗?

    考察评测集工程能力:样本要贴近真实线上分布、量级由统计功效决定而不是拍脑袋、用 holdout 拆分和滚动轮换防过拟合,评测集是需要持续维护的活资产。

  10. 84

    大模型应用的评测体系怎么搭?上线前评测 + 上线后回归怎么设计?

    考察评测体系的分层设计能力:组件级、链路级、系统级三层评测,上线前用 golden set 做 CI 门禁,上线后靠监控、抽样标注和 badcase 回流形成闭环。

公司真题库

16该分类全部 →
  1. 85

    【字节】扣子是 Agent 平台还是工作流平台?低代码平台的优势和局限是什么?

    字节跳动 AI 岗一面真题:考对 Coze 平台定位的理解。核心是它兼具 Agent 编排与工作流引擎双重属性,以及低代码范式的能力边界。

  2. 86

    【小米】RAG 知识库上线后文档更新了怎么办?总不能每次全量重建吧?

    小米 AI 大模型二面真题:考 RAG 知识库的增量更新方案。核心是文档版本管理、按 doc_id 定向更新向量、变更检测与一致性保障。

  3. 87

    【快手】做模型评测,初期怎么增加评测维度?评测数据集怎么建立?

    快手大模型评测一面真题:考评测体系从 0 到 1 的搭建。核心是评测维度的扩展路径、数据集的构建来源与质量控制。

  4. 88

    【蚂蚁】Claude Code 用 grep 检索代码而不用 RAG,两者区别是什么?为什么不用 RAG?

    蚂蚁智能体岗一面真题:考 grep 与 RAG 检索的本质差异。核心是精确符号匹配 vs 语义向量召回,以及代码场景为何前者更合适。

  5. 89

    【蚂蚁】为什么 Claude Code 使用时间越长响应越慢?

    蚂蚁 Agent 实习一面真题:考对长上下文成本的理解。核心是会话变长导致 prefill 增大、KV cache 膨胀,以及上下文压缩机制。

  6. 90

    【腾讯】Agent 的记忆系统怎么设计?项目级规则、用户偏好、会话上下文怎么区分?

    腾讯大模型岗真题:考 Agent 记忆系统的分层设计。核心是分清项目级规则、用户偏好、会话上下文的归属、生命周期和注入策略。

  7. 91

    【腾讯】Oncall Agent 工具返回的日志太多、上下文窗口装不下怎么办?

    腾讯后台开发一面真题:考察 Agent 上下文工程——工具输出做服务端摘要/截断、日志预过滤与分级返回、map-reduce 式分段分析,以及关键证据保留的取舍策略。

  8. 92

    【腾讯】Workflow 与 Agent 的区别是什么?MCP、A2A 多智能体协作了解吗?

    腾讯大模型岗真题:辨析 Workflow(预定义路径、LLM 填充)与 Agent(自主规划、动态决策)的本质区别及选型标准,并讲清 MCP 与 A2A 两个协议各自解决的问题。

  9. 93

    【阿里巴巴】画一下 Agent 系统的路由、管理、执行三层架构

    阿里 Agent 开发岗真题:考察 Agent 系统的分层架构设计——路由层做意图分发,管理层管规划、记忆与状态,执行层负责工具调用与校验,并说明各层职责边界。

  10. 94

    【阿里巴巴】用户的问题不在文档里怎么办?模型如何判断需要让用户补充提问?

    阿里 Agent 开发校招一面真题:考察 RAG 拒答与澄清机制——检索置信度判定、生成层忠实度校验、模糊问题的主动澄清,以及拒答策略的评测与权衡。

  11. 95

    【阿里巴巴】文档里的图片等异构数据怎么处理?只返回文字,图片信息不会丢失吗?

    阿里 Agent 开发校招一面真题:考察多模态文档 RAG——图片的 OCR/VLM 描述/向量化三条处理路线,chunk 与图片的关联索引,以及如何用引用和图片回填避免信息丢失。

  12. 96

    【字节跳动】项目中模型不听指令怎么办?解决后有没有评测数据证明有效?

    字节 AI Agent 岗二面真题:考察指令遵循问题的排查方法论——先定位失败类型(格式/约束/忽略),再用 prompt 工程、结构化输出、后校验分层治理,并用离线评测集量化改进效果。

  13. 97

    【字节跳动】你怎么知道你的 RAG 有效?Recall@5 是 0.81,怎么判断这个数字是好是坏?

    字节 AI 岗一面真题:考察 RAG 评测体系——检索层(Recall@K、MRR)与生成层(忠实度、答案相关性)分开评,以及单点指标必须结合基线、业务标准和数据分布才能下结论。

  14. 98

    【字节跳动】Agentic RAG 和传统 RAG 有什么区别?成本和稳定性怎么控制?

    字节 AI Agent 岗二面真题:对比传统单次检索 RAG 与 Agentic RAG(多轮检索、查询改写、自我校验)的本质差异,并给出多轮调用带来的成本与稳定性控制手段。

  15. 99

    【字节跳动】你怎么设计 Tool Calling?工具调用失败、参数错误、危险工具怎么处理?

    字节 AI Agent 岗二面真题:考察 Tool Calling 的完整设计——工具描述与 schema、参数校验与自愈重试、失败分类处理,以及危险工具的权限隔离和人工确认机制。

  16. 100

    【字节跳动】Agent 项目里哪些节点用确定性 Workflow、哪些交给 LLM 决策?失败分支和重试怎么设计?

    字节 AI Agent 岗二面真题:考察 Workflow 与 LLM 决策节点的划分原则(确定性、可枚举走 Workflow,开放性判断交 LLM),以及失败分支、重试、降级、人工兜底的工程设计。

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.