01-08 求职与面经 Hive 面经复盘 +1 字节 Hive面试核心知识点笔记 📚 本文从字节面试官视角梳理数据开发岗Hive高频考点:Hive定位与Metastore、内部/外部表,分区分桶与视图原理及场景,Join/开窗等SQL实操,性能优化与参数调优,并总结数据倾斜、小文件等常见问题解决思路。 104 0 0
12-10 求职与面经 面经复盘 SQL +1 💼 京东数据开发面经 汇总网络面试题与答法,覆盖一到三面:SQL窗口/连续、Hive架构与优化参数、数据倾斜/Join及Shuffle优化、HDFS读写流程,并含HR自我优缺点等问题。 117 0 0
12-09 数据治理 数据治理 数仓建模 +1 📚 存储资源治理 本文聚焦数仓存储资源治理:以表元数据与血缘为基石,识别临时/无用/空表;通过Parquet+Snappy、分区生命周期、二级分区拆分及全量改增量降本;以量化指标与打分体系评估,并通过持续监控长期维护。 67 0 0
11-23 大数据组件 Hive SQL +1 📘 Hive SQL 数据表操作笔记(CREATE / DROP / ALTER) 本文整理 Hive SQL 表管理常用 DDL:建表与字段类型、分区(单/多级)及其作用、TBLPROPERTIES 配置表/分区生命周期、CTAS 临时表与视图、DROP 删除表/分区、ALTER 改表名/字段/注释/生命周期,并给出命名、统一 pt 分区等最佳实践。 68 0 0
11-19 大数据组件 Hive 实战教程 +1 📘 企业级 Hive 调优指南(Hive on MR) 本文介绍 Hive on MR 的性能调优思路:集群层面优化 YARN 的内存、CPU及容器分配上下限;作业层面按 SQL 调整 Map/Reduce 资源;并结合 Explain 执行计划分析 Stage 与算子树,定位扫描、Join、聚合等瓶颈。 59 0 0
11-19 大数据组件 Hive 原理剖析 📘 Hive 文件格式与压缩机制详解 文章介绍 Hive 常见存储格式 TextFile、ORC、Parquet 等对性能与压缩的影响,重点对比行式/列式存储,说明 ORC 更适合 Hive、Parquet 兼容多引擎,并给出文件级与 MR 过程压缩配置建议。 50 0 0
11-10 大数据组件 Hive 八股总结 +1 🐝 Hive 知识体系与高频面试要点 本文梳理 Hive 核心知识:架构与执行引擎、与传统数据库差异;内部/外部表及四种 By;常用函数与 UDF/UDTF、窗口函数;MapJoin、分区列存、小文件与数据倾斜优化;字段分隔符、Tez 优点、元数据备份及 UNION 区别。 92 0 0
10-28 数仓建模 数仓建模 Hive +1 🌏 电商数仓项目全链路架构详解 文章从全局视角梳理数据全链路体系:数据由端与业务系统产生,经 DataX/Maxwell/Flume+Kafka 采集汇聚至 HDFS,再以 Hive 构建 ODS-DWD-DM-ADS 分层数仓,最终同步至 MySQL 并用 BI 可视化,实现数据闭环与业务价值输出。 79 0 0
10-13 数仓建模 数仓建模 Hive +1 SGG电商数仓6.0概要 项目搭建用户行为与业务数据采集平台,规划ODS-DWD-DWS-ADS分层并进行维度建模,支撑电商核心主题近100项指标。通过Kafka消峰、修复零点漂移、SCD拉链表与分区分桶ORC优化,提供即席查询与Superset可视化服务。 184 0 1