HDFS与MapReduce与Zookeeper与HBase与Spark等大数据工具的使用与实操
课程简介
随着大数据时代的快速到来,以及大数据在生产生活中迅速应用,大数据领域如雨后春笋般的出现大量的新技术,如Hadoop、Spark、MPP等技术,大数据领域的数据处理、统计分析、数据挖掘、机器学习、人工智能、大数据应用开发等各种不同类型的计算操作,应用范围广泛、前景非常广阔。本课程是尹老师多年大数据工作经验的总结和归纳,从实际业务案例为入口,使学员从理论层到实操层面系统的学习大数据技术、数据挖掘、数据创新应用,使学员深入理解大数据分析工具。通过本课程的学习,学员即可以正确的分析企业的数据,为管理者、决策层提供数据支撑。
Hadoop生态系统是大数据技术事实标准,是大数据思想、理念、机制的具体实现,是整个大数据技术中公认的核心框架和具有极强的使用价值与研究价值。Hadoop 系统是一款开源软件,能够处理海量的各种结构(包括结构化、非结构化、半结构化)的数据。
Spark是成为替代MapReduce架构的大数据分析技术,Spark的大数据生态体系包括流处理、图技术、机器学习等顶级项目。
培训目标
大数据生态圈各组件介绍,包括应用场景、架构原理等,主要包括Hadoop、HDFS、MapReduce、Hive、HBase、Spark;
大数据平台搭建的实战,侧重讲解平台建设的安全性、性能调优、实际案例分析,基础搭建知识不需要过多讲解;
大数据实战,大数据项目中架构,技术选型,安全保障等,以及经验分享;
ETL基础组件Flume、Sqoop架构与使用,包括数据清洗的实际使用案例介绍;
通过该课程学习使学员具备Hadoop企业级大数据管理与应用的能力;
通过该课程学习使学员具备Hive企业级大数据分析的能力;
通过该课程学习使学员具备HBase企业级大数据分布式NoSQL数据库的开发能力;
培训对象:
对大数据、分布式存储、分析等感兴趣的朋友;
Java、PHP、C等任意一门编程语言的开发者;
大型网站、电商网站等运维人员;
云计算、大数据从业者;
熟悉Hadoop生态体系,想了解和学习Hadoop与Spark整合在企业应用实战案例的朋友;
系统架构师、系统分析师、高级程序员、资深开发人员;
牵涉到大数据处理的数据中心运行、规划、设计负责人;
政府机关,金融保险、移动互联网等大数据单位的负责人;
高校、科研院所大数据研究人员,涉及到大数据与分布式数据处理的人员;
数据仓库管理人员、建模人员,分析和开发人员、系统管理人员、数据库管理人员以及对数据仓库感兴趣的其他人员;
培训方式:
以课堂讲解、演示、案例分析为主,辅以互动研讨、现场答疑、学以致用。
课程安排
课程时间:4天
课程内容
时间 内容 备注
第一天 大数据相关技术(深入剖析大数据相关技术)(90分钟) 什么是大数据 大数据的特征 大数据发展历史 大数据应用现状 大数据发展趋势 大数据生态体系介绍 大数据优势 大数据的核心技术 大数据与云计算之间的关系剖析 大数据与虚拟化之间的关系剖析 大数据与供应商剖析 大数据与成本投入的关系剖析 企业级案例:马云预测经济危机案例剖析(20分钟) 互动交流及问题咨询 Hadoop生态体系(系统理解Hadoop生态体系)(90分钟) 什么是Hadoop Hadoop由来介绍 Google四篇论文的剖析 GFS、MapReduce、BigTable、Chubby Hadoop的四大核心组件 Hadoop相关概念 块、副本 Hadoop是大数据架构的事实标准 Hadoop的四大核心组件 Hadoop生态体系介绍 Pig Hadoop客户端 HBase大数据分布式NoSQL列式数据库 Hive大数据的数据仓库 Zookeeper分布式协调器 Sqoop大数据导入导出工具 Avro大数据系列化工具 Chukwa大数据分布式数据收集系统 Cassandra大数据分布式NoSQL列式数据库 Ambari提供监控、管理Hadoop资源的工具 Mahout Hadoop数据挖掘算法库 Spark大数据内存计算框架 Tez通用的数据流框架 Hadoop 的数据文件格式介绍:JSON, SequenceFile, Avro 与 Parquet 互动交流及问题咨询 Hadoop集群规划与部署(深入剖析Hadoop集群规划与部署Hadoop集群)(90分钟) Hadoop工作原理及架构 Hadoop部署规划 Hadoop部署优化 Hadoop安全管理 Hadoop HA部署介绍 Hadoop集群的监控 动态增加Hadoop的Slave节点 Hadoop集群的运维 Hadoop 集群的多租户架构 Hadoop 安全体系 企业级案例:基于共享存储的Hadoop集群部署案例分享(10分钟) 企业级案例:基于云计算集群的Hadoop集群部署案例分享(10分钟) 企业级案例:启动Hadoop集群4台机器(10分钟;老师带领学员一起操作,及学员问题指导员) 互动交流及问题咨询 HDFS大数据分布式文件系统使用与实操(深入理解大数据分布式文件系统的原理与机制、使用与实操)(120分钟) HDFS架构剖析 NameNode、DataNode、SecondaryNameNode介绍 NodeName高可靠性最佳实践 DataNode中Block划分的原理和具体存储方式 CLI操作HDFS Java操作HDFS RESTful操作HDFS 动态修改Hadoop的Replication数目 Hadoop序列化 Hadoop流压缩 Hadoop RPC SequenceFile与MapFile Hadoop Avro 企业级案例:Hadoop与RAID之间的关系 企业级案例:Java语言读写HDFS文件系统(时长:20分钟;老师带领学员一起操作,及学员问题指导员) 互动交流及问题咨询
时间 内容 备注
第二天 YARN剖析(深入理解YARN的原理和使用YARN的能力)(30分钟) YARN介绍 YARN的设计思想 YARN的核心组件 YARN为核心的生态系统 Yarn的HA机制 YARN应用程序编写 ResourceManager深入剖析 ClientRMService与AdminService NodeManager深入剖析 Container 互动交流及问题咨询 MapReduce大数据批分布式技术使用与实操(深入理解MapReduce原理及开发MapReduce程序能力培养)(120分钟) MapReduce算法剖析 MapReduce数据输入和输出; MapReduce编程思想 MapReduce命令操作 MapReduce运行过程解析 Hadoop的调度器介绍 Combiner的使用原则 Partitioner的使用最佳实践 MapReduce排序算法剖析 用Streaming写MapReduce程序 MapReduce 程序的单元测试程序; Hadoop API 的深度钻研; 实践性的开发窍门和技术; Partitioners 和 Reducers; 子查询、触发器等常见性能问题分析及优化; MapReduce 作业中实现不同数据集的连接操作; 企业级案例:Java语言编写MapReduce程序、运行MapReduce程序、查看运行结果(时长:20分钟,老师带领学员一起操作,及学员问题指导员) 企业级案例:Java语言编写MapReduce实现马云预测经济案例 互动交流及问题咨询 大数据分析技术Pig使用与实操(大数据分析工具Pig的使用与实操)(60分钟) Pig 设计的目标 Pig Latine介绍 Pig关键性技术 Pig的实用案例 互动交流及问题咨询 大数据数据仓库工具Hive的使用与实操(大数据分析工具深入剖析与应用案例和实操)(120分钟) Hive简介 Hive的组件与体系架构 Hive架构 Hive vs RDBMS Hive的高可用部署方案 Hive Data Types Hive安装模式 Hive安装部署 Hive Shell Hive API开发演示 Hive中UDF和UDAF Hive数据分析 企业级案例:Hive交易数据统计分析(时长:40分钟,老师带领学员一起操作,及学员问题指导员) Zookeeper大数据分布式协调器使用与被扣(深入剖析分布式协调器技术原理和使用与实操)(60分钟) Zookeeper介绍 Paxos算法 Paxos 算法应用场景 Zookeeper的数据模型 Zookeeper的节点 Zookeeper的角色 Zookeeper工作原理 Leader选举 部署ZooKeeper Shell操作Zookeeper Java程序操作Zookeeper Zookeeper典型使用场景 互动交流及问题咨询
时间 内容 备注
第三天 HBase大数据NoSQL技术的使用与实操(深入剖析分布式NoSQL技术及原理的使用与实操)(120分钟) HBase介绍 HBase的特点 HBase逻辑模型 HBase列族与列 HBase时间戳 行式数据库 vs 列式数据库 HBase物理模型 数据存储结构:LSM HBase的REST接口 HBase安装部署 HBase Shell 倒排索引 HBase应用场景介绍 开发实践分享:微博 企业级案例:基于HBase开发微博实时大数据系统(时长:60分钟,老师带领学员一起操作,及学员问题指导员) HBase Filter HBase Coprocessor 互动交流及问题咨询 大数据ETL工具使用与实操(大数据ETL工具,包括:Sqoop、Flume的使用与实操)(120分钟) Sqoop简介 Sqoop架构 Sqoop安装 Sqoop Shell Sqoop应用场景介绍 课堂实操:Sqoop数据导入与导出 Flume简介及使用 Flume架构 Flume数据源类型 Flume收集数据2种主要工作模式 Flume应用场景介绍 课堂实操:电商客户日志收集 大数据内存计算技术的使用与实操(深入剖析Spark实现原理、使用与实操)(120分钟) Scala介绍 Mesos介绍 Spark介绍 Spark基本概念介绍 Spark架构剖析 Spark RDD计算模型解析 Spark的执行机制解析 DAG有向无环图介绍 Spark的调试与任务分配 Spark编程 Java编写Spark程序 Scala编写Spark程序 Python编写Spark程序 R编写Spark程序 Spark可访问的数据源介绍 文件系统 HDFS HBase Hive Cassandra Tachyon Spark与MapReduce对比分析 Spark的容错机制剖析 Spark集群部署 Spark Shell 构建与运行Spark应用 Spark RDD操作剖析 Shark基于Spark的综合应用 Spark开发分析 Spark作业测试解析 Spark的性能调优 Spark生态体系剖析 Spark应用现状 Spark应用优势 Spark应用案例 Spark企业级案例解析 互动交流及问题咨询
时间 内容 备注
第四天 Spark SQL技术的使用与实操(深入剖析Spark SQL实现原理及开发实战)(120分钟) Spark SQL概述 Spark SQL原理剖析 Spark SQL架构介绍 SparkSQL CLI Tree和Rule sqlContext和hiveContext的运行过程 Load/Save函数 Parquet文件读写 Spark SQL连接JDBC Spark SQL连接ODBC Spark SQL分布式文件HDFS读写 JSON数据集 Hive表 数据类型 Spark SQL与 Cassandra集成 Spark SQL APIs全面介绍 Spark SQL and DataFrames Spark SQL and DataSets Spark SQL HiveQL Spark SQL编程 运行Spark SQL程序 在内存中缓存数据 Spark SQL UDFs Spark SQL UADFs Spark SQL SerDes Spark SQL BI Tools 企业级案例:数据分析案例剖析 互动交流及问题咨询 Spark Streaming流计算技术的使用与实操(深入理解Spark Streaming实现原理及开发实战)(120分钟) Spark Streaming概述 Spark Streaming原理剖析 Spark Streaming流数据处理框架介绍 Spark Streaming编程剖析 初始化StreamingContext Discretized Streams (DStreams) 输入DStreams与Receivers 基于DStreams的Transformations 基于DStreams的输出操作 Accumulators和Broadcast Variables DataFrame和SQL操作 MLlib操作 Caching与Persistence Checkpointing 运行Spark Streaming程序 性能调优:减少批处理时间 性能调优:设置正确的批处理间隔时间 内存调优 容错元语 企业级案例:Spark Streaming与Kafka整合实现数据实时数据分析处理设计与分析 互动交流及问题咨询 Spark MLlib机器学习库的使用与实操(深入剖析Spark MLlib实现原理及开发实战)(120分钟) Spark MLlib概述 Spark MLlib算法库介绍 Spark MLlib架构剖析 Spark MLlib机器学习算法剖析 数据类型 基本统计算法 分类与回归 协同过滤 聚类 降维 特征提取与转换 频繁模式挖掘 评价指标 Spark MLlib编程 Spark MLlib APIs介绍 Spark MLlib机器学习算法应用实战 企业级案例:运营商基站数据聚类分析案例剖析 互动交流及问题咨询
授课老师
尹立庆 某大型知名互联网企业首席架构
常驻地:北京
邀请老师授课:13439064501 陈助理

