11-23 大数据组件 Hadoop 原理剖析 NameNode 的 高可用(High Availability)机制详解 本文介绍 HDFS NameNode 的 HA 机制:Hadoop1.x 单点故障影响全局,Hadoop2.x 采用 Active/Standby 架构并由 ZKFC 自动切换提升可用性。元数据由 Fsimage+EditLog 组成,Standby 定期 Checkpoint 合并;生产常用 QJM+JournalNode 保证一致性。 84 0 0
11-19 大数据组件 Hive 实战教程 +1 📘 企业级 Hive 调优指南(Hive on MR) 本文介绍 Hive on MR 的性能调优思路:集群层面优化 YARN 的内存、CPU及容器分配上下限;作业层面按 SQL 调整 Map/Reduce 资源;并结合 Explain 执行计划分析 Stage 与算子树,定位扫描、Join、聚合等瓶颈。 59 0 0
11-19 大数据组件 Hive 原理剖析 📘 Hive 文件格式与压缩机制详解 文章介绍 Hive 常见存储格式 TextFile、ORC、Parquet 等对性能与压缩的影响,重点对比行式/列式存储,说明 ORC 更适合 Hive、Parquet 兼容多引擎,并给出文件级与 MR 过程压缩配置建议。 50 0 0
11-10 大数据组件 Spark 八股总结 +1 ⚡ Spark Core & SQL 核心知识 本文梳理 Spark 常见部署模式(Local、Standalone、YARN、Mesos)与 spark-submit 提交流程,重点解析 Driver/Executor 架构、YARN client/cluster 差异;介绍 RDD Lineage 容错、宽窄依赖及 Stage/Task 划分,并汇总常用算子与性能调优要点。 63 0 0
11-06 大数据组件 原理剖析 实战教程 🚀 Kafka 架构与核心机制详解 概述Kafka架构组件与ZK职责,给出集群机器/磁盘/分区估算公式,介绍副本、ISR与acks可靠性,压测瓶颈与参数调优,含监控、清理策略及顺序性要点。 58 0 0
11-06 大数据组件 原理剖析 🌀 Flume 核心原理与组件详解 本文介绍 Flume 日志采集架构:Source/Channel/Sink 三组件与 Put/Take 事务保障“至少一次”传输。重点解析 TaildirSource 断点续传与重复处理,比较 File/Memory/Kafka Channel 选型,说明 HDFS Sink 滚动写入、拦截器与通道选择器,并给出监控与性能优化建议。 52 0 0
10-27 大数据组件 Hadoop 原理剖析 Shuffle 优化 YARN 工作机制 本文梳理 Hadoop MapReduce Shuffle 全流程(Map 溢写排序/合并、Reduce 拉取归并聚合),并给出缓冲区、Combiner、并行拉取与压缩等优化点;同时介绍 YARN 组件与调度器、多队列优势、Benchmark 测试,以及宕机、数据倾斜与资源分配问题的排查方案。 75 0 0
10-27 大数据组件 Hadoop 原理剖析 HDFS_读写流程笔记 本文梳理 Hadoop/HDFS 常用端口与核心配置文件作用,详解 HDFS 文件写入(副本分配、管道传输与确认)和读取(就近访问、故障切换)流程,并总结小文件问题危害及 HAR、合并输入、JVM 重用等优化策略与面试要点。 74 1 0
10-24 数仓建模 数仓建模 原理剖析 📘 数据仓库建模与维度建模笔记 笔记梳理数据仓库建模意义,比较 Inmon 的 ER 与 Kimball 维度模型;详解事务/周期快照/累积快照三类事实表及可加性;总结维度表设计、星型/雪花模型,以及慢变维快照与拉链表处理。 51 0 0