我们的方法
同一支团队负责范围界定、执行与复测,结论以证据而非清单交付。
01
架构从业务主题域出发
总线矩阵先于技术选型。确定主题域、一致性维度与指标后,再选择存储与计算组件。
02
模型评审是硬性环节
每张核心表上线前经过命名、分层、维度一致性与性能四项评审,评审记录归档,评审清单随交付物提供。
03
实时与离线共用一套口径
CDC 与流处理管道复用离线模型的维度与指标定义,实时报表与日报的数值一致。
交付物
01
数据架构设计文档
分层、主题域、总线矩阵、技术选型与容量规划。
02
数据模型与开发规范
概念 / 逻辑 / 物理模型、命名规范、评审清单。
03
数据管道与调度
ETL / ELT 作业、CDC 实时管道、调度依赖与质量门禁。
交付方式
四个阶段,每个阶段有明确的输入、输出与客户侧确认点。
01第 1–2 周
需求与现状
业务主题、数据源、现有作业与痛点。
02第 3–6 周
架构与建模
分层架构、总线矩阵、核心模型设计与评审。
032–4 个月
开发与迁移
管道开发、历史数据迁移、调度上线。
04上线后 1 个月
稳定性保障
性能调优、作业监控、交接培训。
湖仓适合半结构化数据多、需要同时支持批与流、希望降低存储成本的场景;传统数仓在结构化报表与强一致性要求下仍有优势。选型在架构阶段按数据类型、查询模式与团队技能确定。
