
【字节跳动】HDFS 写数据流程与 NameNode 高可用
字节跳动大数据一面真题。HDFS 写流程的 pipeline 复制机制、机架感知副本放置,以及 NameNode 单点问题的 HA 方案与 Federation 扩展。
共 12 篇文章

字节跳动大数据一面真题。HDFS 写流程的 pipeline 复制机制、机架感知副本放置,以及 NameNode 单点问题的 HA 方案与 Federation 扩展。

字节跳动大数据一面真题。Broadcast Hash、Shuffle Hash、Sort Merge 三种 join 的执行原理、触发条件与调优参数,结合数据量级讲清怎么选。

字节跳动大数据一面真题。Kafka 高吞吐靠顺序写、零拷贝、批量压缩、页缓存和分区并行五板斧,生产者与消费者侧的批处理参数同样关键。

字节跳动大数据一面真题。Checkpoint 是 Chandy-Lamport 分布式快照的流式实现,barrier 注入、对齐、状态快照、确认四步完成全局一致点。

字节跳动大数据一面真题。Watermark 是事件时间的进度标尺,窗口触发、allowedLateness、侧输出流三层兜住迟到数据,附生产调参经验。

字节跳动大数据一面真题。Flink 是事件驱动的真流处理,Spark Streaming 是微批模型,两者在延迟、状态、时间语义、Exactly-Once 上系统性不同。

字节跳动大数据一面真题。Kafka 靠幂等生产者和事务做到单分区及跨分区 Exactly-Once,Flink 靠两阶段提交 checkpoint 协议实现端到端语义。

字节跳动数仓一面真题。窗口函数分排序、分布、取值、聚合四类,附 row_number/rank、ntile 分桶、percent_rank 分位数的现场手写 SQL 与易错点。

字节跳动数仓二面真题。模型优化从复用度治理、宽表与拆分、分区与存储格式、生命周期管理到指标口径收敛,覆盖设计与成本两个维度。

字节跳动数仓一面真题。从 ODS 到 ADS 的分层职责、维度建模落地方式,再到数仓团队按业务域和层的分工协作模式,按真实大厂实践作答。

字节跳动数仓一面真题。两者都是 map 输出分区落盘、reduce 端拉取归并,但 Spark 用 hash 跳过强制排序,并经历 hash/sort/Tungsten 多代演进。

字节跳动数仓一面真题。数据倾斜在 Map、Shuffle、Join、聚合各阶段的表现不同,解法从加盐打散、两阶段聚合到 map join、分桶表逐个对应。