11-06 大数据组件 原理剖析 🌀 Flume 核心原理与组件详解 本文介绍 Flume 日志采集架构:Source/Channel/Sink 三组件与 Put/Take 事务保障“至少一次”传输。重点解析 TaildirSource 断点续传与重复处理,比较 File/Memory/Kafka Channel 选型,说明 HDFS Sink 滚动写入、拦截器与通道选择器,并给出监控与性能优化建议。 52 0 0
11-05 大数据组件 入门指南 数仓建模 DolphinScheduler 简介与入门 Apache DolphinScheduler 是分布式可扩展的可视化 DAG 工作流调度平台,支持多任务类型与监控告警。介绍其核心架构(Master/Worker/ZK/API/UI)、三种部署模式(单机/伪集群/集群)及安全中心配置要点(租户、用户、队列、告警、环境、令牌)。 82 0 0
10-27 大数据组件 Hadoop 原理剖析 Shuffle 优化 YARN 工作机制 本文梳理 Hadoop MapReduce Shuffle 全流程(Map 溢写排序/合并、Reduce 拉取归并聚合),并给出缓冲区、Combiner、并行拉取与压缩等优化点;同时介绍 YARN 组件与调度器、多队列优势、Benchmark 测试,以及宕机、数据倾斜与资源分配问题的排查方案。 75 0 0
10-27 大数据组件 Hadoop 原理剖析 HDFS_读写流程笔记 本文梳理 Hadoop/HDFS 常用端口与核心配置文件作用,详解 HDFS 文件写入(副本分配、管道传输与确认)和读取(就近访问、故障切换)流程,并总结小文件问题危害及 HAR、合并输入、JVM 重用等优化策略与面试要点。 74 1 0