
精选·数据湖与治理2026-07-13
数据资产盘点怎么做?存储与计算成本治理有哪些招?
数据资产盘点的方法(元数据驱动、打标签、定责任人),以及存储分层、僵尸表下线、计算优化的成本治理组合拳。
91学AI·7 阅读
共 10 篇文章

数据资产盘点的方法(元数据驱动、打标签、定责任人),以及存储分层、僵尸表下线、计算优化的成本治理组合拳。

埋点方案选型(代码/全埋点/可视化)、事件模型设计、从端上 SDK 到 Kafka 入湖的采集链路,以及数据质量保障手段。

讲清 RBAC/ABAC 权限模型、Ranger 的列级管控,以及静态/动态脱敏的实现方式、脱敏算法选择和审计要求。

元数据的三类划分、数据目录的核心能力(搜索/血缘/owner),以及 DataHub 和 Apache Atlas 的架构差异与选型建议。

数据治理的四条主线:元数据管理、数据质量、数据安全与合规、成本与生命周期,各自的抓手、工具和落地顺序。

湖仓一体的落地路径:存储层统一用湖格式、计算层多引擎共存、按 ODS/DWD/DWS/ADS 分层建模,以及迁移时的现实步骤。

基于快照的时间旅行查询、快照保留策略,以及增量读取(incremental read/CDC)的实现方式和典型用途。

讲清湖表格式用快照隔离+乐观并发实现 ACID 的原理,以及列变更的兼容性规则与演进中的工程细节。

从元数据架构、更新模型、生态绑定三个角度对比 Iceberg/Hudi/Delta Lake,给出不同业务场景下的选型结论。

数据湖与数仓在数据形态、schema 时机、成本模型、适用场景上的本质差异,以及为什么行业在往湖仓一体收敛。