- 1
一个 7B 模型推理要多少显存?训练呢?怎么估算?
考察显存估算的基本功:推理按参数量×精度字节数加 KV cache,训练按 Adam 的 16-18 倍系数拆解,附 7B/70B 的口算公式与量化收益。
- 2
业务落地怎么做模型选型?Qwen、DeepSeek 各自什么特点?
考察模型选型的决策框架:从任务、成本、部署方式、合规四个维度收敛候选,以及 Qwen(全尺寸开源生态)与 DeepSeek(MoE 性价比)的实际差异。
- 3
MoE 和 Dense 模型比,收益主要体现在哪?代价又是什么?
考察混合专家模型的稀疏激活原理,重点是「推理 FLOPs 与参数量解耦」带来的训练/推理效率收益,以及显存占用、路由稳定性、微调难度等代价。
- 4
MHA、GQA、MQA、MLA 的区别和各自的优化目标是什么?
考察四种注意力变体的 KV head 共享机制,核心是 KV cache 体积与模型效果的权衡,MLA 的低秩压缩思路是 DeepSeek 系列的关键设计。
- 5
上下文窗口不够用时有哪些应对方案?
考察长上下文问题的工程解法谱系,包括文本截断、滑窗、RAG、MapReduce、Agent 化阅读和长上下文微调,重点是按场景选型的判断力。
- 6
大模型幻觉是怎么产生的?有哪些缓解手段?
考察幻觉的成因分析(自回归训练目标、数据噪声、知识边界)和分层缓解方案,重点是 RAG、解码控制、提示工程与训练侧手段的组合使用。
- 7
temperature、top-p、top-k 有什么区别?业务里怎么调?
考察解码采样参数的原理与组合使用方式,重点是三个参数分别如何作用于概率分布,以及不同业务场景(问答/创作/代码)的调参经验。
- 8
文本是怎么变成 token 的?BPE 的原理是什么,中文 token 化有什么坑?
考察 tokenizer 的工作原理,重点是 BPE 的贪心合并算法、词表大小与压缩率的权衡,以及中文场景下的切分粒度和数字/代码退化等实际问题。
- 9
位置编码有哪些?RoPE 为什么能实现相对位置编码?怎么做长度外推?
考察位置编码的演进(正弦/可学习/相对/RoPE),RoPE 用旋转矩阵把绝对位置转成相对位置的数学原理,以及 NTK、YaRN 等长度外推方法。
- 10
LayerNorm 是对哪个维度做归一化?和 BatchNorm 有什么区别?Pre-Norm 和 Post-Norm 呢?
考察归一化的维度语义、LN 与 BN 的本质差异(为什么 NLP 用 LN),以及 Pre-Norm/Post-Norm 对深层模型训练稳定性的影响。
- 11
自注意力机制的原理是什么?为什么缩放点积注意力要除以根号 d_k?
考察对 Q/K/V 计算流程的理解深度,重点是缩放的数学动机(方差随维度增长导致 softmax 饱和)以及工程实现中的多头设计和复杂度问题。
- 12
讲一下 Transformer 的整体结构,为什么现在主流大模型都是 Decoder-only?
考察对 Transformer 三大结构(Encoder-only/Decoder-only/Encoder-Decoder)的理解,重点是因果注意力、生成任务适配性和工程效率如何推动 Decoder-only 成为主流。
- 13
System Prompt 设计有哪些原则和常见坑?
考察 system prompt 的设计原则:角色、指令、边界、格式的写法规范,以及指令冲突、过度依赖自觉、放密钥等常见坑。
- 14
Prompt 效果怎么评估和迭代?有没有工程化的方法?
考察 prompt 迭代的工程化方法:评测集建设、自动化指标与 LLM-as-judge、版本管理与回归测试、badcase 驱动的迭代闭环。
- 15
多轮对话的上下文怎么管理?太长了怎么办?
考察多轮对话上下文管理的工程方案:滑动窗口、摘要压缩、事实抽取、分层记忆各自的适用场景与代价,以及截断策略的设计。
- 16
Prompt 工程和微调怎么选?什么场景必须微调?
考察 prompt 工程、RAG、微调三者的选型逻辑:各自解决什么问题、成本量级差异,以及必须微调的几类典型场景。
- 17
怎么让模型稳定输出 JSON 等结构化结果?
考察结构化输出的完整方案谱系:prompt 约束、JSON mode、function calling、受限解码的原理与可靠性差异,以及校验重试的兜底设计。
- 18
Prompt 注入攻击是怎么回事?怎么防?
考察对 Prompt 注入原理、直接与间接注入区别的理解,以及纵深防御的工程实践:隔离、校验、权限最小化、人类兜底。
- 19
模型不听指令怎么办?怎么定位是 prompt 问题还是模型能力问题?
考察指令遵循问题的系统排查方法:用消融实验和对照实验区分 prompt 缺陷与模型能力上限,以及对应的修复手段。
- 20
few-shot 示例怎么选?示例数量和顺序对结果有影响吗?
考察 few-shot 示例的选择策略:相似度检索、标签均衡、数量边际递减、顺序敏感性,以及动态示例的工程实现。
- 21
思维链 CoT 是什么?先 answer 后 CoT 和先 CoT 后 answer 有区别吗?
考察对思维链原理的理解:为什么显式推理能提升复杂任务表现,以及推理和答案的输出顺序对结果可信度的本质影响。
- 22
输入给模型的 Prompt 由哪些部分组成?哪些必须注入,哪些不是必须?
考察对 Prompt 结构的系统理解:角色设定、指令、上下文、输入、输出要求等模块各自的作用,以及 token 预算下如何取舍。
- 23
长上下文模型越来越强,还需要 RAG 吗?
考察对 RAG 与长上下文模型边界的判断:成本、延迟、大海捞针与中间丢失问题、知识更新时效,以及两者结合的工程范式。
- 24
不同文档内容冲突了怎么办?知识库怎么做版本控制?
考察 RAG 知识库内容治理:文档冲突的检测与消解策略、时间/权威性优先级设计、版本控制方案,以及生成侧的冲突呈现。
- 25
Query 改写有哪些手段?HyDE、子问题分解什么时候用?
考察查询理解与改写技术体系:同义改写、指代消解、HyDE、子问题分解、Step-back 等手法的原理、适用场景与代价。
- 26
GraphRAG 是什么?处理多跳推理和普通 RAG 有什么根本区别?
考察 GraphRAG 的原理与适用边界:知识图谱构建流程、社区摘要机制,以及它在多跳推理、全局性问题上相对向量 RAG 的本质差异。
- 27
Agentic RAG 和传统 RAG 有什么区别?检索失败后 Agent 怎么调整策略?
考察对 Agentic RAG 范式的理解:与传统单轮流水线 RAG 的本质差异、路由/反思/重试机制,以及检索失败后的策略调整设计。
- 28
PDF 里的表格、图片、扫描件怎么处理?异构文档怎么入库?
考察异构文档解析的工程能力:文字版与扫描版 PDF 的分流、表格结构抽取、OCR 与版面分析方案,以及多模态内容入库策略。
- 29
知识库文档更新了怎么办?总不能每次全量重建吧?
考察 RAG 知识库的增量更新设计:文档变更检测、chunk 级 diff、向量库删除与重建策略,以及如何保证更新期间检索一致性。
- 30
你怎么知道你的 RAG 有效?评测集怎么构造?baseline 是什么?
考察 RAG 效果度量体系:检索层指标(Recall@K、MRR)与生成层指标(忠实度、答案相关性)分开评,评测集从真实日志构造,baseline 逐级消融。
- 31
为什么要加 Rerank?Recall@K 和 Precision@K 怎么取舍?Top-K 怎么动态调整?
考察粗排+精排两阶段架构:双塔召回快但弱、cross-encoder 准但慢;Recall 与 Precision 的分工及 Top-K 动态调整。
- 32
为什么要做混合召回?BM25 已经很好了,向量检索还有必要吗?
考察对稀疏与稠密检索互补性的理解:BM25 擅长精确词匹配但不懂语义,向量懂语义但对专名编号不灵,混合召回与 RRF/加权融合是标准解法。
- 33
向量数据库怎么选型?从 ES 切换到向量检索,哪些能力提升、哪些下降?
考察向量库选型权衡:按数据量级选 pgvector/Milvus/ES,以及 ES 倒排切向量检索后语义召回与精确匹配能力的此消彼长。
- 34
Embedding 模型怎么选?输出向量维度多少?你调研过哪些模型?
考察 embedding 选型方法论:MTEB/C-MTEB 榜单怎么用、bge-m3 等主流模型的维度与特性、维度对存储和延迟的影响。
- 35
文档切分策略怎么选?切分粒度、重叠长度怎么定?
考察 chunking 的实战经验:固定长度、结构切分、语义切分的取舍,chunk size 与 overlap 的确定方法,以及父子切分等进阶手段。
- 36
讲讲 RAG 的整体流程,每个环节有哪些坑?
考察对 RAG 全链路的系统理解:离线索引与在线检索生成两大阶段,重点是说清切分、召回、上下文组装、生成各环节的典型坑与对策。
- 37
Agent 上生产环境要考虑什么?状态保存恢复、重试、成本怎么控?
考察 Agent 生产化的完整清单:checkpoint 状态恢复与工具幂等、分层重试与超时、全链路可观测、模型路由与上下文管理等成本控制手段。
- 38
怎么看扣子(Coze)这类低代码 Agent 平台?和代码框架怎么选?
考察对低代码 Agent 平台的务实判断:优势在验证速度和协作门槛,短板在复杂控制流、工程化缺失和平台锁定,选型看流程复杂度与生命周期。
- 39
Agent 表现不符合预期,怎么定位是 prompt、模型能力还是流程设计问题?
考察 Agent 排障方法论:先拿完整 trace 找第一个偏离点,再按工具、上下文、模型、流程四层隔离变量,最后沉淀 eval 集防回归。
- 40
Claude Code、Codex 各自有什么特点?Coding Agent 的设计要点是什么?
考察对主流 Coding Agent 架构的理解:Claude Code 终端原生加 agentic search,Codex 云沙箱异步派单,设计核心是工具克制、上下文管理和验证闭环。
- 41
工具调用进入死循环怎么办?迭代限制、循环检测、降级策略怎么做?
考察 Agent 失控场景的兜底体系:迭代与预算硬限制、重复调用与无进展检测、分级降级策略,以及线上步数监控。
- 42
MCP 协议是什么?解决什么问题?和 Function Calling 什么关系?
考察对 MCP 协议定位的理解:它用开放标准解决 M×N 工具集成问题,与 Function Calling 是不同层次、串联协作而非替代关系。
- 43
LangGraph 和 LangChain 什么区别?为什么选 LangGraph 而不是 AutoGen、CrewAI 或手写状态机?
考察对主流 Agent 框架抽象差异的理解:LangChain 是链式组件库,LangGraph 是带持久化状态机的 Agent 运行时,选型要看控制流复杂度和生产需求。
- 44
Agent 的上下文压缩怎么做?压缩过度导致效果下降怎么发现和处理?
考察长程 Agent 的上下文管理:截断、摘要、工具结果掩码、LLM 压缩器等手段怎么选,以及压缩过度如何通过在线指标、回归评测、错误归因来发现和兜底。
- 45
Agent 的记忆系统怎么设计?短期记忆和长期记忆怎么区分?
考察 Agent 记忆系统设计:短期记忆是上下文窗口内的工作状态(对话历史、scratchpad),长期记忆是持久化的用户画像、经验与知识,用向量库等外存召回。
- 46
多 Agent 怎么分工、通信和终止?如何避免死循环和互相扯皮?
考察多 Agent 系统设计:按职责拆角色的分工模式、消息传递/共享黑板/交接的通信机制、明确的终止协议,以及用最大轮数、预算、仲裁者防死循环。
- 47
Workflow 和 Agent 有什么区别?业务里怎么选?
考察对两种 LLM 应用编排范式的理解:Workflow 是代码预定义执行路径、LLM 做局部决策,Agent 是 LLM 自主规划路径;选型看任务确定性、容错要求和成本。
- 48
Tool Calling 你怎么设计?schema 定义、失败兜底、危险工具防护怎么做?
考察工具调用的工程设计能力:JSON Schema 怎么写模型才调得准,失败时重试/降级/熔断怎么分层,写操作类危险工具如何用白名单、审批、沙箱防护。
- 49
Agent 循环流程是怎样的?讲讲 ReAct 的架构和工作原理。
考察对 Agent 主循环与 ReAct 范式的理解:推理与行动交替执行、观察结果回流,循环要有终止条件和异常兜底。
- 50
你怎么理解 Agent?和普通大模型问答最大的区别是什么?
考察对 Agent 本质的理解:Agent 是「模型自主决策 + 工具调用 + 环境反馈」的闭环系统,与普通问答的核心区别在于它能多步行动、根据反馈自我修正。
- 51
微调效果怎么评估?怎么防止过拟合?
考察微调效果的评估体系与过拟合防控:训练/验证 loss 之外还要有任务指标、通用基准与人工评审,早停、正则、数据侧手段的组合使用。
- 52
知识蒸馏是什么?怎么用强模型给小模型造数据?
考察知识蒸馏的三种形态(logits、特征、数据蒸馏)与落地路径:温度软化的 KL 损失设计,以及用强模型生成指令/推理链数据训练小模型的工程流程。
- 53
什么时候值得做全参微调?没做过的话怎么判断值不值得做?
考察微调投入决策能力:按 prompt→RAG→LoRA→全参的成本阶梯逐级判断,从任务性质、数据量、算力预算、效果差距四个维度评估全参的必要性。
- 54
如果让你对比 LoRA 和全参微调,实验怎么设计?控制哪些变量、看哪些指标?
考察训练实验设计能力:如何在数据、步数、学习率各自对齐的前提下公平对比 LoRA 与全参,以及从任务效果、遗忘、成本三类指标下结论。
- 55
大模型的灾难性遗忘问题怎么解决?
考察对灾难性遗忘机理与工程对策的理解:数据混合回放、正则化约束、参数高效微调、小学习率与早停等手段的适用场景与权衡。
- 56
PPO、DPO、GRPO 分别是什么?DPO 相比 PPO 做了哪些改进?
考察三种主流偏好优化算法的机制与取舍:PPO 的在线 RL 范式、DPO 的闭式偏好直接优化、GRPO 的组内相对优势,以及 DPO 省掉 RM 和采样的本质。
- 57
讲讲 RLHF 的基本流程,奖励模型(RM)的训练数据怎么构建?
考察 RLHF 三阶段流程(SFT、RM 训练、PPO 优化)的完整理解,重点是 RM 偏好数据的采样、排序标注方式与 pairwise 损失的设计。
- 58
SFT 和 RLHF 的作用有什么区别?为什么 SFT 之后还要 RLHF?
考察对对齐两阶段分工的理解:SFT 学行为范式与格式,RLHF 注入人类偏好与价值排序;核心论点是 SFT 只能模仿正例,无法表达「哪个更好」。
- 59
SFT 训练数据怎么构造?数据质量要求高体现在哪些方面?数据量怎么确定?
考察 SFT 数据工程的实操理解:指令数据的来源与构造流程、质量要求的具体维度(准确性、多样性、一致性)、以及量级选择的依据。
- 60
LoRA 实践:rank 怎么选?为什么优先微调 Attention 的 Q/K/V/O 而不是 FFN?lr 设置有什么技巧?
考察 LoRA 落地调参经验:rank 与 alpha 的取舍、target modules 选注意力层的原因、学习率要比全参大一个数量级的原理及常见踩坑。
- 61
讲一下 LoRA 的原理和细节:低秩矩阵为什么有效、A/B 怎么初始化、更新哪些参数?
考察对 LoRA 数学原理与实现细节的掌握:低秩假设的来源、ΔW=BA 的参数化方式、A 高斯 B 置零的初始化设计,以及合并推理等工程要点。
- 62
你了解哪些微调方式?LoRA、P-Tuning、Adapter 的异同点是什么?
考察对参数高效微调(PEFT)方法体系的掌握,重点说清 LoRA、Adapter、P-Tuning 在改动位置、参数量、推理开销上的本质差异和选型依据。
- 63
流式输出怎么实现?SSE 中断、断连怎么处理?
考察流式输出的工程实现:SSE 协议细节、推理侧增量生成、断连检测与取消、以及客户端重连恢复策略。
- 64
大模型应用怎么控制成本?缓存、模型路由、大小模型搭配怎么做?
考察 LLM 应用的成本结构认知和工程化降本能力:语义缓存、模型路由、级联调用三大手段的原理、收益与风险。
- 65
长文本生成时显存占用怎么优化?
考察长上下文场景的显存治理手段:KV Cache 是显存大头,从架构、量化、调度、外推四条线分别给出方案。
- 66
大模型 API 服务响应延迟高,怎么优化?
考察延迟问题的系统性排查能力:先拆 TTFT 与 TPOT 定位瓶颈段,再从排队、prefill、decode、网络四层给出针对性手段。
- 67
FlashAttention 的思想和做法是什么?
考察对注意力计算瓶颈的理解:FlashAttention 用分块计算和 online softmax 避免 O(N²) 显存读写,IO 感知是核心思想。
- 68
投机采样(Speculative Decoding)原理是什么?Medusa、MTP 了解吗?
考察对 decode 阶段加速路线的理解:用小模型起草、大模型并行验证实现无损加速,以及 Medusa、EAGLE、MTP 等变体的取舍。
- 69
PD 分离(Prefill/Decode 分离)是干什么的?解决什么问题?
考察对 Prefill/Decode 两阶段资源特性差异的理解:PD 分离让两阶段独立扩缩容和调度,消除互相干扰,是长上下文高并发的关键架构。
- 70
Continuous Batching 是什么?比静态批处理好在哪里?
考察迭代级调度的理解:continuous batching 按 token 粒度进出 batch,消除静态批处理中"短请求陪跑长请求"的空转浪费。
- 71
大模型服务的吞吐和延迟怎么权衡?TTFT、TPOT 是什么?
考察推理服务的核心指标体系和 trade-off 判断力:batch size 如何同时影响吞吐与延迟,TTFT/TPOT 分别对应什么用户体验。
- 72
vLLM 为什么快?PagedAttention 解决了什么问题?
考察对 vLLM 核心机制的理解:PagedAttention 借虚拟内存思想消除 KV Cache 碎片浪费,配合 continuous batching 把吞吐提升数倍。
- 73
量化的原理是什么?GPTQ、AWQ 有什么区别?int8、int4 怎么选?
考察对模型量化原理和主流 PTQ 算法的理解:对称/非对称量化、GPTQ 与 AWQ 的技术路线差异,以及按场景选 bit 数的判断力。
- 74
KV Cache 是什么?怎么加速推理?显存占用怎么算?
考察对自回归推理瓶颈的理解:KV Cache 用空间换时间避免重复计算,要求能手推显存占用公式并说出优化手段。
- 75
红队测试怎么做?
考察红队工程化能力:先按业务梳理攻击面并风险分级,攻击样本结合人工对抗与自动化生成,发现的漏洞走分级修复闭环,攻击样本沉淀为常驻回归集。
- 76
AI 功能的指标体系怎么搭?怎么避免被单一「解决率」误导?
考察 AI 产品度量能力:指标体系按北极星、效果、体验、护栏四层搭建,解决率口径容易被刷和误读,要用满意度、复访率、人工介入率交叉验证并分层切片。
- 77
怎么保证每次 prompt 或模型迭代效果不倒退?
考察迭代质量保障能力:prompt 当代码做版本管理、核心指标进 CI 门禁且阈值要大于自然波动、线上走灰度和 shadow 验证、护栏指标异常自动回滚。
- 78
大模型应用有哪些安全风险?越狱、敏感内容怎么防?
考察安全攻防全景:风险分输入攻击(越狱、注入)、输出风险(有害内容、数据泄露)、系统风险(越权调用),防御靠输入输出过滤、护栏模型和权限最小化的分层体系。
- 79
幻觉怎么检测和监控?线上怎么兜底?
考察幻觉治理的工程闭环:检测靠检索对照、NLI 一致性校验和多次采样,监控靠抽样加用户反馈信号,兜底靠引用溯源、低置信拒答和人工接管。
- 80
主流 benchmark 有哪些?为什么不能只看 benchmark 选模型?
考察对公开榜单的批判性认识:MMLU、HumanEval 等榜单存在数据污染、饱和、分布不匹配问题,正确姿势是榜单初筛加业务自建评测集复测。
- 81
检索召回率怎么理解?忠实度是什么?这些指标的分子分母怎么定义?
考察 RAG 评测指标的定义功底:检索侧召回率、命中率、MRR 的分子分母口径要能说清,生成侧忠实度衡量答案陈述被上下文支撑的比例,RAGAS 是常用落地框架。
- 82
用另一个大模型做评测(LLM-as-Judge),它的正确率和自我一致性怎么保证?
考察对 LLM-as-Judge 可靠性的理解:先用人工标注金标准测一致率,再针对位置偏差、冗长偏差、自我偏好做工程矫正,多次采样校验稳定性。
- 83
评测集怎么构造?多少条够?怎么防过拟合?评测集需要更新吗?
考察评测集工程能力:样本要贴近真实线上分布、量级由统计功效决定而不是拍脑袋、用 holdout 拆分和滚动轮换防过拟合,评测集是需要持续维护的活资产。
- 84
大模型应用的评测体系怎么搭?上线前评测 + 上线后回归怎么设计?
考察评测体系的分层设计能力:组件级、链路级、系统级三层评测,上线前用 golden set 做 CI 门禁,上线后靠监控、抽样标注和 badcase 回流形成闭环。
- 85
【字节】扣子是 Agent 平台还是工作流平台?低代码平台的优势和局限是什么?
字节跳动 AI 岗一面真题:考对 Coze 平台定位的理解。核心是它兼具 Agent 编排与工作流引擎双重属性,以及低代码范式的能力边界。
- 86
【小米】RAG 知识库上线后文档更新了怎么办?总不能每次全量重建吧?
小米 AI 大模型二面真题:考 RAG 知识库的增量更新方案。核心是文档版本管理、按 doc_id 定向更新向量、变更检测与一致性保障。
- 87
【快手】做模型评测,初期怎么增加评测维度?评测数据集怎么建立?
快手大模型评测一面真题:考评测体系从 0 到 1 的搭建。核心是评测维度的扩展路径、数据集的构建来源与质量控制。
- 88
【蚂蚁】Claude Code 用 grep 检索代码而不用 RAG,两者区别是什么?为什么不用 RAG?
蚂蚁智能体岗一面真题:考 grep 与 RAG 检索的本质差异。核心是精确符号匹配 vs 语义向量召回,以及代码场景为何前者更合适。
- 89
【蚂蚁】为什么 Claude Code 使用时间越长响应越慢?
蚂蚁 Agent 实习一面真题:考对长上下文成本的理解。核心是会话变长导致 prefill 增大、KV cache 膨胀,以及上下文压缩机制。
- 90
【腾讯】Agent 的记忆系统怎么设计?项目级规则、用户偏好、会话上下文怎么区分?
腾讯大模型岗真题:考 Agent 记忆系统的分层设计。核心是分清项目级规则、用户偏好、会话上下文的归属、生命周期和注入策略。
- 91
【腾讯】Oncall Agent 工具返回的日志太多、上下文窗口装不下怎么办?
腾讯后台开发一面真题:考察 Agent 上下文工程——工具输出做服务端摘要/截断、日志预过滤与分级返回、map-reduce 式分段分析,以及关键证据保留的取舍策略。
- 92
【腾讯】Workflow 与 Agent 的区别是什么?MCP、A2A 多智能体协作了解吗?
腾讯大模型岗真题:辨析 Workflow(预定义路径、LLM 填充)与 Agent(自主规划、动态决策)的本质区别及选型标准,并讲清 MCP 与 A2A 两个协议各自解决的问题。
- 93
【阿里巴巴】画一下 Agent 系统的路由、管理、执行三层架构
阿里 Agent 开发岗真题:考察 Agent 系统的分层架构设计——路由层做意图分发,管理层管规划、记忆与状态,执行层负责工具调用与校验,并说明各层职责边界。
- 94
【阿里巴巴】用户的问题不在文档里怎么办?模型如何判断需要让用户补充提问?
阿里 Agent 开发校招一面真题:考察 RAG 拒答与澄清机制——检索置信度判定、生成层忠实度校验、模糊问题的主动澄清,以及拒答策略的评测与权衡。
- 95
【阿里巴巴】文档里的图片等异构数据怎么处理?只返回文字,图片信息不会丢失吗?
阿里 Agent 开发校招一面真题:考察多模态文档 RAG——图片的 OCR/VLM 描述/向量化三条处理路线,chunk 与图片的关联索引,以及如何用引用和图片回填避免信息丢失。
- 96
【字节跳动】项目中模型不听指令怎么办?解决后有没有评测数据证明有效?
字节 AI Agent 岗二面真题:考察指令遵循问题的排查方法论——先定位失败类型(格式/约束/忽略),再用 prompt 工程、结构化输出、后校验分层治理,并用离线评测集量化改进效果。
- 97
【字节跳动】你怎么知道你的 RAG 有效?Recall@5 是 0.81,怎么判断这个数字是好是坏?
字节 AI 岗一面真题:考察 RAG 评测体系——检索层(Recall@K、MRR)与生成层(忠实度、答案相关性)分开评,以及单点指标必须结合基线、业务标准和数据分布才能下结论。
- 98
【字节跳动】Agentic RAG 和传统 RAG 有什么区别?成本和稳定性怎么控制?
字节 AI Agent 岗二面真题:对比传统单次检索 RAG 与 Agentic RAG(多轮检索、查询改写、自我校验)的本质差异,并给出多轮调用带来的成本与稳定性控制手段。
- 99
【字节跳动】你怎么设计 Tool Calling?工具调用失败、参数错误、危险工具怎么处理?
字节 AI Agent 岗二面真题:考察 Tool Calling 的完整设计——工具描述与 schema、参数校验与自愈重试、失败分类处理,以及危险工具的权限隔离和人工确认机制。
- 100
【字节跳动】Agent 项目里哪些节点用确定性 Workflow、哪些交给 LLM 决策?失败分支和重试怎么设计?
字节 AI Agent 岗二面真题:考察 Workflow 与 LLM 决策节点的划分原则(确定性、可枚举走 Workflow,开放性判断交 LLM),以及失败分支、重试、降级、人工兜底的工程设计。