课程概述

入门级大数据课程,适合初学者,完备的课程在线服务体系,可以帮助初学者实现“零基础”学习大数据课程。课程采用厦门大学林子雨老师编著的国内高校第一本系统性介绍大数据知识专业教材《大数据技术原理与应用》。课程紧紧围绕“构建知识体系、阐明基本原理、引导初级实践、了解相关应用”的指导思想,对大数据知识体系进行系统梳理,做到“有序组织、去粗取精、由浅入深、渐次展开”。课程由国内高校知名大数据教师厦门大学林子雨助理教授主讲。

课程内容:
第一讲: 大数据概述
第二讲: 大数据处理架构Hadoop
第三讲: 分布式文件系统HDFS
第四讲: 分布式并行编程模型MapReduce
第五讲: 基于Hadoop的数据仓库Hive

第六讲: Hadoop再探讨

证书要求

参见《大数据系统及应用》课程教学大纲

预备知识

面向对象编程(比如Java)、数据库、操作系统

授课大纲

第0讲 课程介绍

课程及其配套在线资源介绍

本讲配套讲义PPT-第0讲 课程介绍

第1讲 大数据概述

1.1 大数据时代

1.2 大数据概念和影响

1.3 大数据的应用

1.4 大数据的关键技术

1.5 大数据与云计算、物联网

本讲配套讲义PPT-第1讲-大数据概述

第2讲 大数据处理架构Hadoop

2.1 概述

2.2 Hadoop项目结构

2.3 Hadoop的安装与使用

2.4 Hadoop集群的部署和使用

本讲配套讲义PPT-第2讲-大数据处理架构Hadoop

第3讲 分布式文件系统HDFS

3.1 分布式文件系统HDFS简介

3.2 HDFS相关概念

3.3 HDFS体系结构

3.4 HDFS存储原理

3.5 HDFS数据读写过程

3.6 HDFS编程实践

本讲配套讲义PPT-第3讲-分布式文件系统HDFS

第4讲 分布式并行编程模型MapReduce

4.1 MapReduce概述

4.2 MapReduce的体系结构

4.3 MapReduce工作流程

4.4 Shuffle过程原理

4.5 MapReduce应用程序执行过程

4.6 实例分析:WordCount

4.7 MapReduce的具体应用

4.8 MapReduce编程实践

本讲配套讲义PPT-第4讲-分布式并行编程模型MapReduce

第5讲 基于Hadoop的数据仓库Hive

5.1 数据仓库概念

5.2 Hive简介

5.3 SQL转换成MapReduce作业的原理

5.4 Hive编程实践

本讲配套讲义PPT-第5讲-基于Hadoop的数据仓库Hive

第6讲 Hadoop再探讨

6.1 Hadoop的优化与发展

6.2 HDFS2.0的新特性

6.3 新一代资源管理调度框架YARN

本讲配套讲义PPT-第6讲-Hadoop再探讨

参考资料

林子雨.大数据技术原理与应用(第2版),人民邮电出版社,2017年2月(教材官网)。

林子雨-大数据基础编程、实验和案例教程,清华大学出版社,2017年8月(教材官网)。

林子雨,赖永炫,陶继平.Spark编程基础(Scala版),人民邮电出版社,2018年8月(教材官网)。

高校大数据课程公共服务平台:https://dblab.xmu.edu.cn/post/8197/

大数据学习路线图:https://dblab.xmu.edu.cn/post/10164/

【后续学习内容】学习完本入门级课程以后,欢迎继续在中国大学MOOC平台学习后续的进阶级大数据课程《Spark编程基础》(课程地址:https://www.icourse163.org/course/XMU-1205811805