
一个 7B 模型推理要多少显存?训练呢?怎么估算?
考察显存估算的基本功:推理按参数量×精度字节数加 KV cache,训练按 Adam 的 16-18 倍系数拆解,附 7B/70B 的口算公式与量化收益。
共 12 篇文章

考察显存估算的基本功:推理按参数量×精度字节数加 KV cache,训练按 Adam 的 16-18 倍系数拆解,附 7B/70B 的口算公式与量化收益。

考察模型选型的决策框架:从任务、成本、部署方式、合规四个维度收敛候选,以及 Qwen(全尺寸开源生态)与 DeepSeek(MoE 性价比)的实际差异。

考察混合专家模型的稀疏激活原理,重点是「推理 FLOPs 与参数量解耦」带来的训练/推理效率收益,以及显存占用、路由稳定性、微调难度等代价。

考察四种注意力变体的 KV head 共享机制,核心是 KV cache 体积与模型效果的权衡,MLA 的低秩压缩思路是 DeepSeek 系列的关键设计。

考察长上下文问题的工程解法谱系,包括文本截断、滑窗、RAG、MapReduce、Agent 化阅读和长上下文微调,重点是按场景选型的判断力。

考察幻觉的成因分析(自回归训练目标、数据噪声、知识边界)和分层缓解方案,重点是 RAG、解码控制、提示工程与训练侧手段的组合使用。

考察解码采样参数的原理与组合使用方式,重点是三个参数分别如何作用于概率分布,以及不同业务场景(问答/创作/代码)的调参经验。

考察 tokenizer 的工作原理,重点是 BPE 的贪心合并算法、词表大小与压缩率的权衡,以及中文场景下的切分粒度和数字/代码退化等实际问题。

考察位置编码的演进(正弦/可学习/相对/RoPE),RoPE 用旋转矩阵把绝对位置转成相对位置的数学原理,以及 NTK、YaRN 等长度外推方法。

考察归一化的维度语义、LN 与 BN 的本质差异(为什么 NLP 用 LN),以及 Pre-Norm/Post-Norm 对深层模型训练稳定性的影响。

考察对 Q/K/V 计算流程的理解深度,重点是缩放的数学动机(方差随维度增长导致 softmax 饱和)以及工程实现中的多头设计和复杂度问题。

考察对 Transformer 三大结构(Encoder-only/Decoder-only/Encoder-Decoder)的理解,重点是因果注意力、生成任务适配性和工程效率如何推动 Decoder-only 成为主流。