Agent-readable wiki
Flink 电商实时数仓工程解读
一套 Maven 多模块的电商实时数仓教学工程,覆盖从埋点日志与业务库经 Kafka 到 Flink 分层加工(DIM/DWD/DWS)、落 ClickHouse 再由可视化工程查询的完整链路。值得研究的是它把数仓分层方法论落成了可运行的 Flink 代码,并在维表、去重、窗口聚合上给出了典型取舍。
Pages
- 导读:一套电商实时数仓的教学全景从整体定位仓库:三个 Maven 工程各司其职,实时模块按数仓分层组织代码,两个发布工程负责把结果查询出来做可视化。作为开篇,先建立模块边界与技术栈印象,再给出从架构、数据流、计算存储、系统优化到业务实现的阅读路线,避免与后续各页重复。
- 数仓分层与数据流转讲解一条数据从哪来、往哪去:业务库与埋点日志先进 Kafka 主题,再按 DIM 维表层、DWD 明细层、DWS 汇总层的顺序被加工。以 DimApp、BaseLogApp 和交易预处理的代码为例,说明主题命名约定、脏数据侧输出流、维表配置的广播式加载,以及层与层之间如何靠主题衔接。
- 计算模型与存储选型围绕“算在哪、存哪里”讲清技术底座:DataStream 与 FlinkSQL 两种写法各自的使用场景,状态与 Checkpoint 在生产上的注意点,以及 Kafka、MySQL、Phoenix/HBase、ClickHouse、Redis 在链路中的分工。重点解释针对维度关联的 Redis 旁路缓存与异步查询、维表配置的广播状态等系统优化手段。
- 业务域落地:指标口径与可复用经验把前几页的通用机制放回业务场景,以流量、交易、用户三个域为线索还原典型指标在代码中的落地方式:新老用户判定与 UV、跳出行为、页面浏览窗口、交易预处理后的支付与下单汇总、注册回流统计。收尾给出从这套工程抽象出的实时数仓分层方法论与踩坑经验,作为全文总结。
Complete Markdown
The complete agent-readable Markdown files are published separately from this HTML page.