
【阿里】维度建模:星型模型与雪花模型怎么选
阿里数仓实习一面真题。维度建模以业务过程和一致性维度为骨架,星型模型查询简单性能好,雪花模型规范化省存储,实践中星型为主、局部雪花。
共 20 篇文章

阿里数仓实习一面真题。维度建模以业务过程和一致性维度为骨架,星型模型查询简单性能好,雪花模型规范化省存储,实践中星型为主、局部雪花。

京东大数据开发一面真题。Flink 算子分转换、分区、聚合、关联几类,窗口覆盖滚动/滑动/会话/全局四种,附 Window API 与事件时间触发要点。

京东大数据开发一面真题。ClickHouse 读快靠列存+向量化+稀疏索引+数据分区裁剪,写快靠追加写 parts+异步 merge 的 LSM 类机制。

京东大数据开发一面真题。以电商实时数仓为例讲清 Kafka 分层、Flink 加工、ClickHouse/Doris 服务的架构全貌,以及每个选型背后的理由。

阿里数仓实习一面真题。重复来自生产者重试、消费者位移提交与 rebalance 两个方向;项目里用幂等生产者、手动位移提交、下游幂等去重三板斧应对。

阿里(飞猪数据团队)数仓实习一面真题。主题域是面向分析的业务视角,数据域是面向建设的加工视角,两者解决的是分类和归属两个不同问题。

阿里数仓实习一面(飞猪数据团队)真题。分层带来复用、口径统一、隔离变化和问题定位四大收益;最难的是 DWS,难在公共沉淀的粒度与边界拿捏。

阿里云大数据开发三面真题。两者都是分布式计算体系,Hadoop 提供存储+调度+批处理全家桶,Spark 以内存迭代计算和统一栈见长,实际生产中互补共存。

字节跳动大数据一面真题。HDFS 写流程的 pipeline 复制机制、机架感知副本放置,以及 NameNode 单点问题的 HA 方案与 Federation 扩展。

字节跳动大数据一面真题。Broadcast Hash、Shuffle Hash、Sort Merge 三种 join 的执行原理、触发条件与调优参数,结合数据量级讲清怎么选。

字节跳动大数据一面真题。Kafka 高吞吐靠顺序写、零拷贝、批量压缩、页缓存和分区并行五板斧,生产者与消费者侧的批处理参数同样关键。

字节跳动大数据一面真题。Checkpoint 是 Chandy-Lamport 分布式快照的流式实现,barrier 注入、对齐、状态快照、确认四步完成全局一致点。

字节跳动大数据一面真题。Watermark 是事件时间的进度标尺,窗口触发、allowedLateness、侧输出流三层兜住迟到数据,附生产调参经验。

字节跳动大数据一面真题。Flink 是事件驱动的真流处理,Spark Streaming 是微批模型,两者在延迟、状态、时间语义、Exactly-Once 上系统性不同。

字节跳动大数据一面真题。Kafka 靠幂等生产者和事务做到单分区及跨分区 Exactly-Once,Flink 靠两阶段提交 checkpoint 协议实现端到端语义。

字节跳动数仓一面真题。窗口函数分排序、分布、取值、聚合四类,附 row_number/rank、ntile 分桶、percent_rank 分位数的现场手写 SQL 与易错点。

字节跳动数仓二面真题。模型优化从复用度治理、宽表与拆分、分区与存储格式、生命周期管理到指标口径收敛,覆盖设计与成本两个维度。

字节跳动数仓一面真题。从 ODS 到 ADS 的分层职责、维度建模落地方式,再到数仓团队按业务域和层的分工协作模式,按真实大厂实践作答。

字节跳动数仓一面真题。两者都是 map 输出分区落盘、reduce 端拉取归并,但 Spark 用 hash 跳过强制排序,并经历 hash/sort/Tungsten 多代演进。

字节跳动数仓一面真题。数据倾斜在 Map、Shuffle、Join、聚合各阶段的表现不同,解法从加盐打散、两阶段聚合到 map join、分桶表逐个对应。