课程目录
/2-048-以慕课网日志分析为例 进入大数据 Spark SQL 的世界/
第10章 Spark SQL扩展和总结/
第1章 初探大数据/
第2章 Spark及其生态圈概述/
第3章 实战环境搭建/
第4章 Spark SQL概述/
第5章 从Hive平滑过渡到Spark SQL/
第6章 DateFrame&Dataset/
第7章 External Data Source/
第8章 SparkSQL愿景/
第9章 慕课网日志实战/
解决什么问题 Spark SQL 是 Spark 生态中最易上手且使用频率最高的模块,但多数教程只讲语法,缺乏完整的数据处理闭环。本课程以慕课网真实业务日志为切入点,解决的核心问题是如何在分布式环境下,对大规模半结构化数据进行高效清洗、分析与查询。它填补了从单机 SQL 思维到分布式计算思维转换过程中的实践空白,帮助开发者理解数据倾斜、分区策略以及引擎优化…
Spark SQL 是 Spark 生态中最易上手且使用频率最高的模块,但多数教程只讲语法,缺乏完整的数据处理闭环。本课程以慕课网真实业务日志为切入点,解决的核心问题是如何在分布式环境下,对大规模半结构化数据进行高效清洗、分析与查询。它填补了从单机 SQL 思维到分布式计算思维转换过程中的实践空白,帮助开发者理解数据倾斜、分区策略以及引擎优化等实际工程中必然遇到的痛点。
本课程适合已掌握 Java 或 Scala 基础,并熟悉传统关系型数据库 SQL 语法的后端开发者。如果你对 Hadoop 生态系统仅有概念性了解,无需担心,课程前几章会快速梳理 Spark 及其生态圈概述,帮你建立整体认知。建议学习时按以下顺序推进:先通过「实战环境搭建」章节完成本地或集群环境的部署,确保运行正常;接着在「从 Hive 平滑过渡到 Spark SQL」章节中,利用已有的 Hive 经验快速理解 Spark SQL 的底层逻辑;最后进入「DataFrame & Dataset」和「External Data Source」章节,掌握现代 API 编程范式。跳过环境搭建直接看代码,往往会在依赖冲突上浪费大量时间。
完成本课程后,你将能够独立构建基于 Spark SQL 的数据分析管道,实现从日志采集到多维报表生成的全流程开发。特别是第 9 章的慕课网日志实战和第 10 章的扩展总结,将整合前序所有知识点,让你具备处理真实业务场景的能力。资料包中的代码示例并非单纯演示,而是可作为工程模板直接复用。建议在观看视频时同步打开 IDE,对照源码逐行调试,重点关注 Dataset 算子的组合用法及 SQL 执行计划的优化技巧,这样才能将知识转化为可落地的工程能力。
/2-048-以慕课网日志分析为例 进入大数据 Spark SQL 的世界/
第10章 Spark SQL扩展和总结/
第1章 初探大数据/
第2章 Spark及其生态圈概述/
第3章 实战环境搭建/
第4章 Spark SQL概述/
第5章 从Hive平滑过渡到Spark SQL/
第6章 DateFrame&Dataset/
第7章 External Data Source/
第8章 SparkSQL愿景/
第9章 慕课网日志实战/