
公司真题库2026-07-27
【阿里巴巴】Attention 和 FFN 哪个更吃算力?不同序列长度下结论一样吗?
阿里实习一面真题:考察对 Transformer 计算分布的量化理解——参数量 FFN 占约三分之二,但 attention 有 O(n²d) 项,序列超过约 4 倍隐藏维度后 attention 反超成为算力大头。
91学AI·13 阅读
共 2 篇文章

阿里实习一面真题:考察对 Transformer 计算分布的量化理解——参数量 FFN 占约三分之二,但 attention 有 O(n²d) 项,序列超过约 4 倍隐藏维度后 attention 反超成为算力大头。

字节跳动 LLM 算法实习二面真题:考察 scaled dot-product attention 的缩放动机——点积方差随维度线性增长、softmax 饱和导致梯度消失,以及缩放系数的推导和工程变体。