03-11 大数据组件 八股总结 原理剖析 +1 🚀 大数据开发 核心八股 文章梳理大数据核心知识体系:涵盖 HDFS 架构与读写、HA及小文件治理;MapReduce 原理与 Shuffle;Yarn 调度与架构;Spark 组件、RDD/DAG、Stage/Shuffle、调优排错与数据倾斜、Join 策略;Doris 架构与存储;数仓分层建模;Hive 架构与优化。 46 0 0
01-14 求职与面经 八股总结 面经复盘 +1 📝 字节数开面试 八股复盘 汇总大数据面试高频:数据倾斜定位与打散/广播方案,Spark OOM排查调参;涵盖排序算法、MySQL连接、PySpark实战及ClickHouse/ES对比。 83 0 0
01-11 求职与面经 面经复盘 数仓建模 +1 📝 字节跳动 大数据开发实习生 面试经历整理 文章总结两场数据方向面试:商业产品与技术、泛TikTok数据平台搜索。涵盖自我介绍、项目深挖、数仓分层、数据倾斜、Spark Shuffle/Hive/ClickHouse等知识点,并包含有序数组统计、连续登录、7日移动平均等手撕与实操题。 76 0 0
12-24 求职与面经 面经复盘 数据倾斜 +1 🚀 字节跳动大数据开发面经 2️⃣ 文章汇总大数据/数仓面试高频点:数据倾斜成因与治理、CTE执行与物化、Spark Stage划分及宽依赖算子、Hive内外表差异、HDFS小文件问题与优化,并附SQL手撕题(时间段借书、连续登录)及二分统计有序数组元素次数。 74 0 0
12-02 求职与面经 数据倾斜 面经复盘 +1 🚨 数据倾斜调优 面试题 数据倾斜是 Hive/Spark shuffle 的性能杀手,会导致任务卡顿、超时或 OOM。文章从参数配置、Map/Reduce 阶段实操入手,给出 Map Join、AQE、自适应分区、随机打散、拆分大 Key、替代 distinct 及小文件治理等优化方案。 89 0 0