
公司真题库2026-07-20
【字节跳动】MapReduce Shuffle 与 Spark Shuffle 原理对比
字节跳动数仓一面真题。两者都是 map 输出分区落盘、reduce 端拉取归并,但 Spark 用 hash 跳过强制排序,并经历 hash/sort/Tungsten 多代演进。
91学AI·4 阅读
共 3 篇文章

字节跳动数仓一面真题。两者都是 map 输出分区落盘、reduce 端拉取归并,但 Spark 用 hash 跳过强制排序,并经历 hash/sort/Tungsten 多代演进。

HBase 当中的数据最终都是存储在 HDFS 上面的,HBase 天生的支持 MR 的操作,我们可以通过 MR 直接处理 HBase 当中的数据,并且 MR 可以将处理后的结果直接存储到 HBase 当中去。
