
共 12 篇文章


考察 LLM 应用的成本结构认知和工程化降本能力:语义缓存、模型路由、级联调用三大手段的原理、收益与风险。


考察延迟问题的系统性排查能力:先拆 TTFT 与 TPOT 定位瓶颈段,再从排队、prefill、decode、网络四层给出针对性手段。

考察对注意力计算瓶颈的理解:FlashAttention 用分块计算和 online softmax 避免 O(N²) 显存读写,IO 感知是核心思想。

考察对 decode 阶段加速路线的理解:用小模型起草、大模型并行验证实现无损加速,以及 Medusa、EAGLE、MTP 等变体的取舍。

考察对 Prefill/Decode 两阶段资源特性差异的理解:PD 分离让两阶段独立扩缩容和调度,消除互相干扰,是长上下文高并发的关键架构。

考察迭代级调度的理解:continuous batching 按 token 粒度进出 batch,消除静态批处理中"短请求陪跑长请求"的空转浪费。

考察推理服务的核心指标体系和 trade-off 判断力:batch size 如何同时影响吞吐与延迟,TTFT/TPOT 分别对应什么用户体验。

考察对 vLLM 核心机制的理解:PagedAttention 借虚拟内存思想消除 KV Cache 碎片浪费,配合 continuous batching 把吞吐提升数倍。

考察对模型量化原理和主流 PTQ 算法的理解:对称/非对称量化、GPTQ 与 AWQ 的技术路线差异,以及按场景选 bit 数的判断力。

考察对自回归推理瓶颈的理解:KV Cache 用空间换时间避免重复计算,要求能手推显存占用公式并说出优化手段。