
精选·Hive与SQL2026-07-13
Hive 小文件问题是怎么产生的?如何治理?
小文件拖垮 NameNode 并放大计算开销;成因在 reduce 数、动态分区、实时写入三个源头,治理手段分写入时合并和存量合并两条线。
91学AI·6 阅读
共 3 篇文章

小文件拖垮 NameNode 并放大计算开销;成因在 reduce 数、动态分区、实时写入三个源头,治理手段分写入时合并和存量合并两条线。

考察对 Spark shuffle 机制演进的理解:HashShuffle 的小文件问题、SortShuffleManager 的排序与归并、unsafe/sort 分支的选择条件,以及 Tungsten 的二进制排序和堆外内存优化。

讲清数据倾斜在 keyBy/窗口聚合/Join 场景的表现,以及加盐打散、两阶段聚合、热点 key 单独处理等实战方案的选择逻辑。