精选·数据湖与治理

数据治理体系到底包含什么?元数据、质量、安全、成本四条线

91学AI·2026/7/13·10 阅读

考察点

治理题容易答空。面试官反感的是「建体系、定规范、强意识」这类正确废话,想听的是每条线具体抓什么、用什么工具、怎么度量。回答时按元数据、质量、安全、成本四条线展开,每条都落到可执行的抓手,追问通常会挑你最熟的一条线深挖。

参考答案

治理为什么会被提上日程

触发点通常很具体:报表口径打架、出故障找不到影响面、数据量翻倍成本失控、合规审计过不了。治理不是一个系统,是一组「让数据可发现、可信、可控、划算」的机制。我常把它拆成四条线讲。

元数据管理:治理的地基

元数据分三类:技术元数据(表结构、分区、血缘)、业务元数据(指标口径、负责人、业务含义)、操作元数据(任务调度、访问记录)。抓手是数据目录(DataHub、Apache Atlas、Amundsen)加上血缘自动采集——血缘能从 SQL 解析和调度系统里挖出来,做影响面分析和故障传播判断。没有元数据,后面三条线都无从谈起,所以这条线永远先建。

数据质量:从救火到设防

质量的度量维度常讲五性:完整性、准确性、一致性、及时性、唯一性。落地靠规则引擎:在关键表的关键字段上配监控规则——行数波动超阈值告警、主键重复率、null 率、枚举值越界、同比环比异常。工具上开源有 Apache Griffin、Great Expectations,自研的更多。关键工程实践是把质量检查嵌进调度链路:DQC 规则不过就阻断下游任务,宁可延迟出数也不放脏数据下去,出了问题再开质量分复盘会,形成闭环。只有监控没有阻断,等于没有质量治理。

数据安全与合规

三个抓手:分类分级、权限管控、脱敏审计。先把数据按敏感度分级(公开/内部/机密,个人信息单列),权限按 RBAC 或 ABAC 模型收到统一平台(Apache Ranger),敏感列做静态脱敏(存储时)或动态脱敏(查询时掩码),所有访问留审计日志。国内环境下《数据安全法》《个人信息保护法》是硬约束,手机号、身份证这类字段从入湖第一天就要有处理策略。

成本与生命周期

存储成本治理:冷热分层(热数据标准存储,30/90 天转低频,再老转归档)、小文件合并、快照和孤儿文件清理、僵尸表下线(结合元数据的访问记录,半年没人查的表走下线流程)。计算成本治理:识别大任务大 SQL(按扫描量排序 Top N 优化)、错峰调度、资源队列隔离。成本线最容易出量化成果,常是治理团队向管理层交账的首选。

落地顺序的建议

元数据先行(不然其他都瞎),质量抓核心链路的核心表(别一上来全量铺规则),安全跟合规节奏走,成本治理穿插做、持续做。治理的价值度量最后要回到业务语言:口径一致的指标数、阻断的脏数据次数、下线的存储量、省下的钱。

可能的追问

  • 你们数据质量监控具体怎么配的? 答举例:核心交易表配行数波动 ±30% 告警、订单号唯一性、金额 null 率 <0.1%,规则不过阻断下游,值班群告警+责任人认领。
  • 血缘怎么采? 答离线任务从 Spark/Hive SQL 用 SQLLineage 类工具解析,调度平台(Airflow/DolphinScheduler)任务依赖兜底,Flink 任务血缘最难,常靠打点和人工登记。
  • 治理推不动怎么办? 答别全面铺开,找一个痛点场景(比如核心报表口径统一)做出成果,用省下的钱和少出的事故换团队话语权,再扩大范围。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.