12-24 求职与面经 面经复盘 数据倾斜 +1 🚀 字节跳动大数据开发面经 2️⃣ 文章汇总大数据/数仓面试高频点:数据倾斜成因与治理、CTE执行与物化、Spark Stage划分及宽依赖算子、Hive内外表差异、HDFS小文件问题与优化,并附SQL手撕题(时间段借书、连续登录)及二分统计有序数组元素次数。 74 0 0
12-08 数据治理 数据治理 Spark +1 📊 数据治理之计算资源治理 梳理计算资源治理痛点(延迟、过载、降本、冗余)及小文件、调度错配、DQC浪费等问题;按安全优先推进Spark3升级调优、清理无效规则/任务、优化调度;以成本与交付SLA量化成效,建立周期化治理。 60 0 0
12-06 数据治理 数据治理 Hadoop +1 📁 HDFS 小文件治理 本文聚焦 HDFS 小文件痛点,系统梳理小文件定义、成因与对 NameNode、调度和存储的影响;给出 Spark3 AQE 自动合并、控制 Reduce、源头合并及存量/增量治理方案,并总结生产避坑与常见答疑。 124 0 0
12-02 求职与面经 数据倾斜 面经复盘 +1 🚨 数据倾斜调优 面试题 数据倾斜是 Hive/Spark shuffle 的性能杀手,会导致任务卡顿、超时或 OOM。文章从参数配置、Map/Reduce 阶段实操入手,给出 Map Join、AQE、自适应分区、随机打散、拆分大 Key、替代 distinct 及小文件治理等优化方案。 89 0 0
11-26 大数据组件 Spark 原理剖析 ✨Spark 内存模型 文章围绕 Spark Executor 端 JVM 内存展开,介绍堆内/堆外内存作用与内存不足带来的 GC、spill、OOM 风险;对比 1.6 前静态内存(固定比例、易浪费)与 1.6+ 统一内存(动态共享、可互借)机制,并给出常用资源配置与调优参数建议。 79 0 0
11-26 大数据组件 Spark 原理剖析 🔗 Spark 的几种 Join 机制 文章梳理 Spark 在大数据场景下的 5 种 Join 策略:Broadcast Hash、Shuffle Hash、Sort Merge(默认)、Cartesian、Broadcast Nested Loop,并说明 Catalyst 会按数据量、Join 条件与排序情况自动选型及其优缺点与适用场景。 120 0 0
11-26 大数据组件 Spark 原理剖析 🔥 Spark Shuffle 文章系统讲解 Spark Shuffle:其本质是跨节点按 key 重分布并伴随排序、分组与合并,触发宽依赖并决定 Stage 划分。梳理 Hash→Sort→Tungsten 演进,说明读写流程、常见瓶颈(IO/网络/GC/倾斜)及优化手段(预聚合、分区与内存调优等)。 75 0 0
11-25 大数据组件 Spark 原理剖析 🚀 Spark 任务提交流程 梳理 Spark 核心组件与职责,讲清运行模式差异:Driver 位置决定 Client/Cluster;并概述 Standalone 与 YARN(cluster)提交流程及 Master URL 参数。 80 0 0
11-25 大数据组件 Spark 原理剖析 🧠 Spark 计算模型详解(RDD & 算子 & DAG) 本文系统梳理 Spark RDD 核心:不可变分区、血缘与惰性执行;窄/宽依赖与 Stage 划分;Shuffle 全流程及优化;序列化与统一内存;广播变量、累加器、checkpoint 容错;并给出性能调优清单与示例速记。 86 0 0
11-25 大数据组件 Spark 基础概念 🚀 Spark 基础知识 介绍 Spark 的基本概念与性能优势(内存计算、DAG、Shuffle),并概览 Driver/Executor 架构及生态组件与运行模式。 62 0 0
11-10 大数据组件 Spark 八股总结 +1 ⚡ Spark Core & SQL 核心知识 本文梳理 Spark 常见部署模式(Local、Standalone、YARN、Mesos)与 spark-submit 提交流程,重点解析 Driver/Executor 架构、YARN client/cluster 差异;介绍 RDD Lineage 容错、宽窄依赖及 Stage/Task 划分,并汇总常用算子与性能调优要点。 63 0 0