
公司真题库2026-07-20
【京东】ClickHouse 的写入和读取为什么快
京东大数据开发一面真题。ClickHouse 读快靠列存+向量化+稀疏索引+数据分区裁剪,写快靠追加写 parts+异步 merge 的 LSM 类机制。
91学AI·5 阅读
共 6 篇文章

京东大数据开发一面真题。ClickHouse 读快靠列存+向量化+稀疏索引+数据分区裁剪,写快靠追加写 parts+异步 merge 的 LSM 类机制。

用户画像系统核心是三件事:ID-Mapping 打通身份、标签分层存储(明细宽表 + 位图)、圈人查询用位图交并加速,存储选型按更新频率和查询模式拆给 Doris 与 CK。

实时大屏设计核心是分层降载:Kafka 接流、Flink 做窗口预聚合、OLAP 存多粒度结果、缓存挡并发,让大屏查询只扫小数据量,秒级刷新生生不息。

OLAP 引擎按批组织存储,ClickHouse 攒批防 part 爆炸,Doris Stream Load 按批次生成 segment;导入调优核心是批大小、频率与上游幂等重试。

位图索引把低基数列的等值/集合查询转成位运算,Doris/StarRocks 还用它做精确去重加速;BloomFilter 用哈希概率结构做低成本存在性过滤,牺牲一点误判换 IO 大降。

OLAP 选型先定三个硬指标:数据量级与增速、查询并发与延迟要求、数据更新频率,再叠加 join 复杂度、团队运维能力和生态,用排除法收敛候选。