课程简介
Hadoop MapReduce 核心机制与实践 很多开发者在处理大规模数据时,往往只停留在调用框架 API 的层面,缺乏对底层执行原理和性能优化手段的系统认知。本资料针对这一痛点,以 Hadoop 3 环境为基础,深入拆解 MapReduce 分布式计算的核心流程。它不仅仅讲解如何写出一个可用的程序,更重点剖析代码背后的资源调度、数据分发以及执行效率优化…
Hadoop MapReduce 核心机制与实践
很多开发者在处理大规模数据时,往往只停留在调用框架 API 的层面,缺乏对底层执行原理和性能优化手段的系统认知。本资料针对这一痛点,以 Hadoop 3 环境为基础,深入拆解 MapReduce 分布式计算的核心流程。它不仅仅讲解如何写出一个可用的程序,更重点剖析代码背后的资源调度、数据分发以及执行效率优化策略,帮助开发者建立从理论到集群部署的完整工程闭环。
学习路径与核心模块建议
建议按照以下顺序对照实践:首先通过 WordCount 章节理解最基础的 Map、Reduce 任务实现及 Driver 配置,这是掌握整个框架的基石;接着进入 DistributedCount 章节,重点研读 Map 端合并与代码优化部分,学习如何通过二次排序或本地聚合减少网络传输开销;最后深入移动计算而非移动数据章节,结合 Yarn Web UI 和 History Server,分析 Container 分配规则(最小最大规则、整数倍规则)以及 MRAppMaster 的资源配置。这种由浅入深、由代码到集群监控的路径,能有效避免“知其然不知其所以然”。
适用基础与独立实践能力
本课程适合具备 Java 基础、了解 Linux 操作及 Hadoop HDFS 基本概念,但希望深入理解分布式计算调度原理的开发者。学完后,你将能够独立设计并实现复杂的 MapReduce 作业,具备根据文件大小合理设置 Map Task 数量、优化 Reduce 分区规则以平衡负载的能力。更重要的是,你能熟练运用 Yarn 集群监控工具排查运行故障,理解数据倾斜产生的原因并进行针对性优化,从而在实际工作中独立承担大数据批处理任务的开发与调优工作,将资料中的视频案例转化为可落地的工程经验。
课程目录
第10章分布式计算 - DistributedCount程序
1.DistributedCount 流程.mp4
2.Map 任务实现.mp4
3.Reduce 任务实现.mp4
4.Driver 实现.mp4
5.Map 端合并.mp4
6.代码优化.mp4
7.在集群上运行程序.mp4
8.集群状态的变化.mp4
9.Map Task 的数量和文件大小的关系.mp4
第11章分布式计算 - 移动计算而非移动数据
1.Yarn Web UI 查看日志.mp4
10.Container 分配规则二:整数倍规则.mp4
11.Container 分配规则总结.mp4
12.数据块移动的原因.mp4
13.移动计算而尽可能少的移动数据.mp4
14.设置 reduce task 的数量.mp4
15.代码优化-1678427776.mp4
2.问题:为什么移动了数据块?.mp4
3.打开History Server 服务.mp4
4.MRAppMaster 计算资源的配置.mp4
5.YarnChild 计算资源的配置.mp4
6.代码中设置 MR 进程需要的资源.mp4
7.Yarn 中的 Container 概念.mp4
8.Yarn 应用启动流程.mp4
9.Container 分配规则一:最小最大规则.mp4
第12章分布式计算 - WordCount
1.WordCount 计算流程.mp4
10.Shuffle 和 Sort.mp4
11.MapReduce On Yarn 运行原理.mp4
2.WordCount Map Task 实现.mp4
3.Reduce Task 实现.mp4
4.WordCount Driver 实现.mp4
5.集群运行 WordCount.mp4
6.MapReduce 默认的分区规则.mp4
7.Input 和 Output Format.mp4
8.MapReduce 执行流程.mp4
9.WordCount 执行流程.mp4
第13章Hadoop 2 之 HDFS 安装
1.Hadoop 2 学习前说明.mp4
2.HDFS的安装(一).mp4
3.WebUI看不了怎么办.mp4
4.HDFS的安装(二).mp4
第14章Hadoop 2 之 HDFS 运维相关
1.Federation配置.mp4
2.ViewFS的配置.mp4
3.回退到一个NameNode的状态.mp4
4.告诉你怎么使用Snapshots.mp4
5.平衡数据.mp4
6.SafeMode.mp4
第15章Hadoop 2 之 MapReduce 和 Yarn
1.Yarn的安装.mp4
2.MapReduce安装.mp4
3.MapReduce应用(了解即可).mp4
4.Hadoop压缩机制(了解即可).mp4
第16章Hadoop 2 之文件格式(这章能理解代码即可)
1.text文件格式的读写.mp4
2.avro文件和parquet文件的讲解.mp4
3.avro文件的读写(能看懂代码即可).mp4
4.parquet文件的读写(必须掌握).mp4
5.sequenceFile文件(看懂代码即可).mp4
6.sequenceFile合并小文件.mp4
7.CombineTextInputFormat.mp4
第17章Hadoop 2 之 Yarn 资源调度机制
1.Yarn的三种资源调度机制.mp4
2.Capacity Scheduler.mp4
3.Yarn Fair Scheduler配置.mp4
第18章阶段项目实战 - NCDC 气候数据分析实战(跟着操作一遍)
1.NCDC数据源的获取.mp4
2.NCDC数据字段的详解.mp4
3.NCDC数据的预处理.mp4
4.数据处理逻辑以及实现方案讲解.mp4
5.MapReduce代码实现讲解.mp4
6.Hadoop的本地安装.mp4
7.单元测试、集成测试以及验证.mp4
8.求每一年highest的温度.mp4
第1章课程答疑
老汤大数据课程体系介绍.mp4
第2章大数据技术思想入门
1.分布式存储的特点.mp4
2.分布式存储集群特点.mp4
3.分布式文件存储的流程.mp4
4.主节点中的元数据是怎么存储的.mp4
5.分布式计算的特点.mp4
第3章分布式存储 - HDFS 集群配置安装
1.HDFS 课程内容介绍.mp4
10.HDFS 相关配置值的设置.mp4
11.配置 Java Home以及从节点.mp4
12.配置 HADOOP_HOME.mp4
13.HDFS 集群启动.mp4
14.验证 HDFS 集群是否正常.mp4
15.怎么样查看 HDFS 的日志信息.mp4
16.HDFS 集群正确停止的方式.mp4
2.HDFS 集群介绍.mp4
3.安装前准备:准备 3 台虚拟机.mp4
4.安装前准备:配置无密钥登录.mp4
5.安装前准备:配置 JAVA_HOME.mp4
6.安装前准备:关闭防火墙.mp4
7.安装包的下载和解压.mp4
8.配置 HDFS 的基本路径.mp4
9.创建名字节点和数据节点存储数据的文件目录.mp4
第4章分布式存储 - HDFS 集群的使用
1.HDFS Web UI 的讲解.mp4
10.HDFS 分布式文件读的过程.mp4
2.HDFS shell 命令介绍.mp4
3.本地文件上传到 HDFS 集群.mp4
4.文件操作命令.mp4
5.修改文件的权限.mp4
6.df 和 du.mp4
7.文件恢复机制.mp4
8.准备一个大文件.mp4
9.HDFS 分布式文件写的过程.mp4
第5章分布式存储 - 数据块
1.数据块元数据.mp4
2.设置数据块的备份数.mp4
3.设置数据块的大小.mp4
4.数据块真正存储的地方.mp4
5.DataNode 和 NameNode 交互.mp4
6.HDFS 分布式文件删除的流程.mp4
第6章分布式存储 - EditsLog 和 FsImage
1.回顾 NameNode 元数据是怎么存储的.mp4
2.EditsLog 存储目录和内容.mp4
3.EditsLog 记录每次元数据操作信息.mp4
4.EditsLog恢复NameNode元数据.mp4
5.EditsLog 合并的条件.mp4
6.FsImage 文件内容.mp4
7.为什么还要 EditsLog 呢?.mp4
8.EditsLog 合并的流程.mp4
第7章分布式存储 - Java 操作 HDFS
1.Java 操作 HDFS 准备.mp4
2.Java 写 HDFS 文件.mp4
3.Java 读 HDFS 文件.mp4
4.Java 查询 HDFS 文件元数据.mp4
5.Java 删除 HDFS 文件.mp4
6.在 Java 代码中设置参数.mp4
7.在 classpath 中设置参数.mp4
8.两种设置参数的优先级.mp4
9.HDFS 文件系统的两个特点.mp4
第8章分布式计算 - 内容介绍
1.分布式计算内容介绍.mp4
第9章分布式计算 - 基础
1.数据准备.mp4
10.Hadoop 序列化机制.mp4
2.回顾分布式计算的特点.mp4
3.Yarn 的作用.mp4
4.Yarn 的安装配置.mp4
5.Yarn 的 Web UI 简介.mp4
6.有了 Yarn 后的分布式计算.mp4
7.MapReduce 配置.mp4
8.创建项目.mp4
9.序列化的作用.mp4