精选·数仓与建模

怎么评价一个数仓建得好不好?从五个维度看

91学AI·2026/7/13·10 阅读

考察点

这是开放题,常在终面或管理岗出现,考的是你有没有从「建表的人」成长为「对数仓整体负责的人」。面试官期待体系化的回答而不是零散的点,最好还能给出可量化的度量。追问常问「你们当时最大的短板是什么、怎么改进的」。

参考答案

数据质量:底线指标

质量是数仓的信誉,业务方发现一个错数,对全盘数据的信任都会打折。经典四性:

  • 完整性:该到的数据到没到。每天 ODS 同步后校验行数波动(环比超阈值告警)、关键字段非空率、枚举值范围;
  • 准确性:数对不对。和业务源系统对数(订单总额 vs 财务系统)、跨表交叉校验(支付事实表金额合计应等于订单表的已支付金额);
  • 一致性:同一指标各报表是否相等,这回到一致性事实和指标字典的治理;
  • 及时性:承诺几点产出就几点产出。核心报表 SLA(比如早 8 点前就绪)的达成率要监控。

工程落地是 DQC(数据质量中心):规则配置在表上,任务跑完自动校验,触阈值阻断下游并告警。可量化指标:DQC 告警次数、阻断次数、业务方报障工单数。

模型复用度:架构水平的直接体现

好数仓的核心特征是公共逻辑沉淀在中间层,烟囱少。几个可量化的观察角度:DWS 层表被 ADS 引用的覆盖率——应用层是否大多从汇总层取数,还是各自回 DWD 甚至 ODS 重算;重复表比例——不同任务产出字段高度雷同的表有多少;平均每个指标被几张表重复计算。复用度低的直接后果就是口径漂移和成本翻倍,所以这一条和第一条是因果相连的。

稳定性与 SLA

包括两块:任务稳定性和产出时效。量化指标很直接:核心任务成功率、平均破线(超过承诺产出时间)次数、故障恢复时长(MTTR)、任务重跑频率。背后考察的是调度体系的成熟度:基线管理有没有(核心链路任务识别出来重点保障)、依赖配置是否自动解析(手工配依赖必然出错)、数据回溯机制是否演练过。一个细节能区分老手:知不知道怎么处理「数据晚了」和「数据错了」两种不同的故障——前者等或限流,后者要回溯重刷加订正,预案完全不同。

资源成本

数仓不是建完就完,存储和计算成本是持续的账。健康度看:存储增长曲线是否可解释(和业务增长匹配,还是失控)、僵尸表占比(长期无访问的表有没有生命周期管理)、任务资源浪费(小文件问题、数据倾斜导致的算力空耗、重复计算)。成本治理手段:表生命周期强制配置、存储格式优化(ORC/Parquet + 压缩)、低频大表降采样、按域核算成本分摊到团队。能说出「每张核心表的单次产出成本」的团队,说明精细化程度到位。

规范性与可维护性

偏「软」但决定数仓能不能活过三年:命名规范执行率(dwd_ 前缀、业务过程命名统一)、元数据完整度(表和字段有中文注释、有 owner、有血缘)、代码评审覆盖率、文档和实际口径的一致性。检验方法很实在:新人接手一个域,看文档和元数据能不能独立干活。如果离开原作者就没人敢动,说明知识全在人脑里,规范性是不及格的。

综合判断

五个维度里,质量和 SLA 是底线(做不到业务不信任),复用度和成本是效率(做不到公司养不起),规范性是寿命(做不到系统会腐烂)。实操上建议做成数仓健康度看板,每月把这五维的量化指标拉出来过一遍,短板在哪一目了然,治理投入也有了依据。

可能的追问

  • 如果只能选一个指标评价数仓? 我会选「业务方数据工单的结构」:对数类、催数类工单多说明质量和时效不行;需求排期类多但故障类少,反而是健康的——说明数仓在稳定供数,瓶颈在产能。
  • 复用度和业务响应速度矛盾吗? 短期矛盾(等公共层排期不如自己拉表快),长期必须守住。折中做法是允许 ADS 临时直连 DWD 快速交付,但挂技术债登记,公共层就绪后限期迁移。
  • 数据质量规则配多少算够? 核心链路强规则(阻断式),边缘链路弱规则(告警式),按表等级分级配置。全量强规则会产生告警疲劳,最后没人看,等于没配。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.