
精选·模型与微调基础2026-07-13
Self-Attention 完整计算过程:为什么 Softmax 前要除以根号 d_k
走一遍 QKV 到注意力输出的完整链路,从数值稳定性角度讲清缩放因子的由来,再落到复杂度、KV Cache 等工程推论。
91学AI·5 阅读
共 2 篇文章

走一遍 QKV 到注意力输出的完整链路,从数值稳定性角度讲清缩放因子的由来,再落到复杂度、KV Cache 等工程推论。

拆解 Transformer 的注意力、FFN、残差与 LayerNorm 各模块职责,讲清它取代 RNN 的原因,以及做 AI 应用必须懂的几个工程推论。