03-11 大数据组件 八股总结 原理剖析 +1 🚀 大数据开发 核心八股 文章梳理大数据核心知识体系:涵盖 HDFS 架构与读写、HA及小文件治理;MapReduce 原理与 Shuffle;Yarn 调度与架构;Spark 组件、RDD/DAG、Stage/Shuffle、调优排错与数据倾斜、Join 策略;Doris 架构与存储;数仓分层建模;Hive 架构与优化。 46 0 0
12-04 数仓建模 数仓建模 原理剖析 🏗️ 维度建模理论 文章系统梳理 Kimball 维度建模:维度+事实、总线架构与一致性维度/事实;对比范式建模及三范式;讲解星型/雪花/星座模型;结合 ODS→ADS 分层与四步流程,并介绍事实表类型与 SCD 处理方案。 79 0 0
12-01 大数据组件 Doris 原理剖析 📘 Doris 存储体系与关键技术 本文梳理 Doris 核心底层机制:Segment V2 存储分层与文件格式(数据区/索引区/Footer)、多类索引加速查询;介绍正交 Bitmap 通过分桶并行实现高效去重;并解析 Unique Key+Sequence Column 解决并发更新覆盖与防回退问题。 42 0 0
11-30 大数据组件 Doris 原理剖析 📘 Doris 架构详解 本文概览 Apache Doris 架构与演进:3.0 前 FE/BE 存算一体,FE 负责 SQL 与元数据(Paxos+WAL+Checkpoint),BE 负责列存与向量化执行;3.0 起引入云原生存算分离三层架构,支持对象存储与多租户弹性扩缩容,并解析 Segment、前缀索引及三种数据模型。 217 0 0
11-26 大数据组件 Spark 原理剖析 ✨Spark 内存模型 文章围绕 Spark Executor 端 JVM 内存展开,介绍堆内/堆外内存作用与内存不足带来的 GC、spill、OOM 风险;对比 1.6 前静态内存(固定比例、易浪费)与 1.6+ 统一内存(动态共享、可互借)机制,并给出常用资源配置与调优参数建议。 79 0 0
11-26 大数据组件 Spark 原理剖析 🔗 Spark 的几种 Join 机制 文章梳理 Spark 在大数据场景下的 5 种 Join 策略:Broadcast Hash、Shuffle Hash、Sort Merge(默认)、Cartesian、Broadcast Nested Loop,并说明 Catalyst 会按数据量、Join 条件与排序情况自动选型及其优缺点与适用场景。 120 0 0
11-26 大数据组件 Spark 原理剖析 🔥 Spark Shuffle 文章系统讲解 Spark Shuffle:其本质是跨节点按 key 重分布并伴随排序、分组与合并,触发宽依赖并决定 Stage 划分。梳理 Hash→Sort→Tungsten 演进,说明读写流程、常见瓶颈(IO/网络/GC/倾斜)及优化手段(预聚合、分区与内存调优等)。 75 0 0
11-25 大数据组件 Spark 原理剖析 🚀 Spark 任务提交流程 梳理 Spark 核心组件与职责,讲清运行模式差异:Driver 位置决定 Client/Cluster;并概述 Standalone 与 YARN(cluster)提交流程及 Master URL 参数。 80 0 0
11-25 大数据组件 Spark 原理剖析 🧠 Spark 计算模型详解(RDD & 算子 & DAG) 本文系统梳理 Spark RDD 核心:不可变分区、血缘与惰性执行;窄/宽依赖与 Stage 划分;Shuffle 全流程及优化;序列化与统一内存;广播变量、累加器、checkpoint 容错;并给出性能调优清单与示例速记。 86 0 0
11-24 大数据组件 Hadoop 原理剖析 📚 大数据存储格式详解:TextFile / ORC / Parquet 本文对比 TextFile、ORC、Parquet 三种数据存储格式:指出 TextFile 行式存储压缩率低、无法列裁剪与优化;详解 ORC/Parquet 的列式结构、索引与过滤机制及适用生态;并介绍通过排序+分发重排提升压缩率与查询性能的实践建议。 29 0 0
11-24 大数据组件 Hadoop 原理剖析 📘 YARN 资源调度与核心架构 文章梳理YARN资源调度与执行机制:对比FIFO、Capacity、Fair三类调度器的特点与适用场景;解析YARN主从架构中RM、NM、AM、Container职责;说明作业提交到容器执行的全流程,并补充数据本地化与MR运行过程。 82 0 0
11-24 大数据组件 Hadoop 原理剖析 ✨ MapReduce 原理与机制 本文概述 Hadoop MapReduce:基于分治思想,将批处理拆为 Map→Shuffle→Reduce 并行执行,具备容错、调度与分片能力;解析 WordCount、InputSplit 与 Shuffle(落盘/排序/拉取)细节及性能瓶颈,并介绍压缩优化策略。 76 1 0