今天阳光很暖
Apache Hudi 学习笔记 06:Hudi 写入流程与写操作类型详解 Apache Hudi 学习笔记 06:Hudi 写入流程与写操作类型详解
前面讲完 COW、MOR 和查询类型以后,再看写入操作就清楚多了。Hudi 写入不是简单把 DataFrame 保存成 Parquet,而是要根据 record key、partition path、precombine 字段、索引定位和表
2025-07-29
Apache Hudi 学习笔记 05:COW 与 MOR 表类型,以及三种查询方式 Apache Hudi 学习笔记 05:COW 与 MOR 表类型,以及三种查询方式
前面几篇已经把 Hudi 的定位、测试环境、Timeline、FileGroup、FileSlice 和索引机制串起来了。到这里再看 COW 和 MOR,就不是背两个名词,而是在回答一个很实际的问题:更新数据写进数据湖以后,到底是在写入时就
2025-07-17
Apache Hudi 学习笔记 04:Hudi 索引机制与索引选型 Apache Hudi 学习笔记 04:Hudi 索引机制与索引选型
上一篇把 Timeline、Instant、FileGroup 和 FileSlice 串了一遍。理解这些概念以后,再看 Hudi 的索引机制会更自然:Hudi 传统写入索引的核心不是让普通 SQL 查询更快,而是帮助写入端在 Upsert
2025-07-06
Apache Hudi 学习笔记 03:Timeline、Instant、FileGroup 与 FileSlice Apache Hudi 学习笔记 03:Timeline、Instant、FileGroup 与 FileSlice
前两篇分别讲了 Hudi 的定位和测试环境安装。到这里已经可以用 Spark DataSource 写出一张 Hudi 表,也能在 HDFS 上看到 .hoodie 目录和 Parquet 文件。 但如果只是看到这些文件,还不能真正理解 H
2025-06-27
Apache Hudi 学习笔记 02:Hudi 测试环境安装 Apache Hudi 学习笔记 02:Hudi 测试环境安装
上一篇先把 Hudi 放在数据湖架构里看了一遍,知道它不是一个单纯的文件格式,而是一套能在 HDFS、S3 这类存储上管理表、事务、更新和增量消费的系统。 这篇开始搭环境。Hudi 本身并不孤立,它要和 Hadoop、Hive、Spark、
2025-06-15
Apache Hudi 学习笔记 01:Hudi 是什么?为什么数据湖需要 Hudi? Apache Hudi 学习笔记 01:Hudi 是什么?为什么数据湖需要 Hudi?
前面整理 Hadoop、Hive、Spark、Flink 这些组件时,更多关注的是计算引擎怎么跑、任务怎么提交、SQL 怎么查询。真正把数据长期沉淀到 HDFS 或对象存储之后,还会遇到另一个问题:文件系统只负责存文件,并不天然知道一张表的
2025-06-04
Prometheus 监控实战 06:Flink 异常检测与告警规则配置 Prometheus 监控实战 06:Flink 异常检测与告警规则配置
前面已经把 Prometheus、Flink 指标和 Grafana 看板都串起来了。到这里,监控链路已经能看到指标,但还缺少最关键的一步:指标异常时不能只靠人工查看,而应该由 Prometheus 主动计算规则并触发告警。 Flink 作
2025-05-29
Prometheus 监控实战 05:Grafana 接入与 Flink 看板配置 Prometheus 监控实战 05:Grafana 接入与 Flink 看板配置
上一篇已经把 Flink 的 JobManager 和 TaskManager 指标暴露给了 Prometheus。到这一步,指标已经能被采集,但是直接在 Prometheus 里写 PromQL 更适合排查问题,不适合长期观察。 监控体系
2025-05-17
Prometheus 监控实战 04:Flink 指标接入 Prometheus Prometheus 监控实战 04:Flink 指标接入 Prometheus
前面已经把 Prometheus、Node Exporter、Pushgateway 和 PromQL 的基础用法整理了一遍。到这里,Prometheus 已经能采集主机指标和短任务指标,但还没有接入真正的大数据计算组件。 这篇开始把 Fl
2025-05-09
Prometheus 监控实战 03:PromQL 查询语法与指标排查 Prometheus 监控实战 03:PromQL 查询语法与指标排查
前两篇已经把 Prometheus Server、Node Exporter 和 Pushgateway 都接起来了。现在 Prometheus 里至少有三类指标: Prometheus 自身指标。 Linux 主机指标。 Pushgat
2025-04-27
Prometheus 监控实战 02:主机指标采集与 Pushgateway 接入 Prometheus 监控实战 02:主机指标采集与 Pushgateway 接入
上一篇已经把 Prometheus Server 部署起来了,并且让 Prometheus 先采集了自己的 /metrics 接口。这个最小闭环可以证明 Prometheus 的配置、启动、抓取和查询链路是通的,但它还不能回答主机
2025-04-18
Prometheus 监控实战 01:监控体系介绍与 Server 部署 Prometheus 监控实战 01:监控体系介绍与 Server 部署
前面整理 YARN 的时候,更多关注的是 ResourceManager、NodeManager、Application、Container 这些对象本身。通过 Web UI 和命令行可以看到应用状态、队列资源、节点健康和日志,但是这种方式
2025-04-07
5 / 35