
【京东】Flink 算子体系与窗口函数
京东大数据开发一面真题。Flink 算子分转换、分区、聚合、关联几类,窗口覆盖滚动/滑动/会话/全局四种,附 Window API 与事件时间触发要点。
共 20 篇文章

京东大数据开发一面真题。Flink 算子分转换、分区、聚合、关联几类,窗口覆盖滚动/滑动/会话/全局四种,附 Window API 与事件时间触发要点。

京东大数据开发一面真题。以电商实时数仓为例讲清 Kafka 分层、Flink 加工、ClickHouse/Doris 服务的架构全貌,以及每个选型背后的理由。

字节跳动大数据一面真题。Checkpoint 是 Chandy-Lamport 分布式快照的流式实现,barrier 注入、对齐、状态快照、确认四步完成全局一致点。

字节跳动大数据一面真题。Watermark 是事件时间的进度标尺,窗口触发、allowedLateness、侧输出流三层兜住迟到数据,附生产调参经验。

字节跳动大数据一面真题。Flink 是事件驱动的真流处理,Spark Streaming 是微批模型,两者在延迟、状态、时间语义、Exactly-Once 上系统性不同。

字节跳动大数据一面真题。Kafka 靠幂等生产者和事务做到单分区及跨分区 Exactly-Once,Flink 靠两阶段提交 checkpoint 协议实现端到端语义。

实时大屏设计核心是分层降载:Kafka 接流、Flink 做窗口预聚合、OLAP 存多粒度结果、缓存挡并发,让大屏查询只扫小数据量,秒级刷新生生不息。

实时数仓沿用 ODS-DWD-DWS-ADS 思路但层数要压浅,Kafka 存原始与明细,Flink 做清洗和汇总,CK/Doris 承接查询,点查走 Redis/HBase。

拆解"端到端"的三段语义,讲清 Kafka 事务 + 位移原子提交的内环方案、Flink 两阶段提交检查点的外环方案,以及什么时候该退回业务幂等。

系统梳理 Flink 作业调优的入口与顺序:并行度与资源评估、内存模型关键参数、Checkpoint 与状态优化、反压定位后的对症手段。

讲清数据倾斜在 keyBy/窗口聚合/Join 场景的表现,以及加盐打散、两阶段聚合、热点 key 单独处理等实战方案的选择逻辑。

讲清双流 Join 的双侧状态缓存与互相探测机制、interval join 与窗口 join 的区别,以及状态 TTL 的设定依据与防膨胀手段。

讲清 Flink CDC 基于 binlog 增量捕获 + 快照读的原理、无锁快照与断点续传的实现,以及整库同步、实时数仓 ODS 层等典型落地方式。

讲清 Flink 基于信用额度(credit-based)的反压传导原理,以及用 Web UI 指标、线程栈、Metrics 定位反压根因的完整排查套路。

区分内部状态一致性与端到端 Exactly-Once,讲清两阶段提交 sink 的预提交/提交/中止流程,以及 Kafka、MySQL 等常见 sink 的一致性实现方式。

从触发方、生命周期、文件格式、用途四个维度对比 Savepoint 与 Checkpoint,说明升级、扩容、A/B 测试等运维场景为什么必须用 Savepoint。

讲清 keyed state 与 operator state 的区别、三种状态后端的取舍,以及 RocksDB 增量快照的原理和大状态作业的工程配置。

讲清非对齐 Checkpoint 的原理(跳过对齐、连缓冲数据一起快照)、适用场景(严重反压下救活 Checkpoint)与使用前提和限制。

从 Chandy-Lamport 算法讲起,讲清 barrier 注入、对齐、快照写入、确认回报的完整流程,以及对齐的代价与适用前提。

讲清 Trigger 的触发时机与几种内置实现,以及 Watermark、allowedLateness、侧输出流三层迟到数据处理机制的组合用法。