
【阿里云】Hadoop 与 Spark 的相同点和不同点
阿里云大数据开发三面真题。两者都是分布式计算体系,Hadoop 提供存储+调度+批处理全家桶,Spark 以内存迭代计算和统一栈见长,实际生产中互补共存。
共 8 篇文章

阿里云大数据开发三面真题。两者都是分布式计算体系,Hadoop 提供存储+调度+批处理全家桶,Spark 以内存迭代计算和统一栈见长,实际生产中互补共存。

字节跳动大数据一面真题。Broadcast Hash、Shuffle Hash、Sort Merge 三种 join 的执行原理、触发条件与调优参数,结合数据量级讲清怎么选。

字节跳动数仓一面真题。两者都是 map 输出分区落盘、reduce 端拉取归并,但 Spark 用 hash 跳过强制排序,并经历 hash/sort/Tungsten 多代演进。

字节跳动数仓一面真题。数据倾斜在 Map、Shuffle、Join、聚合各阶段的表现不同,解法从加盐打散、两阶段聚合到 map join、分桶表逐个对应。

map join 把小表广播到 map 端免 shuffle;skew join 通过倾斜 key 单独拆分、加盐打散或两阶段聚合解决热点,掌握适用条件和参数。

在许多迭代式算法(比如机器学习、图算法等)和交互式数据挖掘中,不同计算阶段之间会重用中间结果,即一个阶段的输出结果会作为下一个阶段的输入。但是,之前的 MapReduce 框架采用非循环式的数据流模型,把中间结果写入到 HDFS 中,带来了大量的数据复制、磁盘 IO 和序列化开销。且这些框架只能支持一些特定的计算模式(map/reduce),并没有提供一种通用的数据抽象。

