大模型基础2026-07-26MHA、GQA、MQA、MLA 的区别和各自的优化目标是什么?考察四种注意力变体的 KV head 共享机制,核心是 KV cache 体积与模型效果的权衡,MLA 的低秩压缩思路是 DeepSeek 系列的关键设计。91学AI·11 阅读