
公司真题库2026-07-27
【阿里巴巴】Attention 和 FFN 哪个更吃算力?不同序列长度下结论一样吗?
阿里实习一面真题:考察对 Transformer 计算分布的量化理解——参数量 FFN 占约三分之二,但 attention 有 O(n²d) 项,序列超过约 4 倍隐藏维度后 attention 反超成为算力大头。
91学AI·13 阅读
共 5 篇文章

阿里实习一面真题:考察对 Transformer 计算分布的量化理解——参数量 FFN 占约三分之二,但 attention 有 O(n²d) 项,序列超过约 4 倍隐藏维度后 attention 反超成为算力大头。

字节跳动 LLM 算法实习二面真题:考察 scaled dot-product attention 的缩放动机——点积方差随维度线性增长、softmax 饱和导致梯度消失,以及缩放系数的推导和工程变体。

小米 AI 大模型一面真题:考对所用 embedding 模型的了解深度。以 BGE-M3 为例讲清模型结构、1024 维输出及训练方式。

考察对 Q/K/V 计算流程的理解深度,重点是缩放的数学动机(方差随维度增长导致 softmax 饱和)以及工程实现中的多头设计和复杂度问题。

考察对 Transformer 三大结构(Encoder-only/Decoder-only/Encoder-Decoder)的理解,重点是因果注意力、生成任务适配性和工程效率如何推动 Decoder-only 成为主流。