大数据应用技术介绍 ppt课件

合集下载
  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
Zookeeper: Zookeeper Quorum存储-ROOT-表地址、HMaster地址 HRegionServer把自己以Ephedral方式注册到Zookeeper中,HMaster随时感知各个HRegionServer的健康 状况 Zookeeper避免HMaster单点问题
HMaster: HMaster没有单点问题,HBase中可以启动多个HMaster,通过Zookeeper的Master Election机制保证总有 一个Master在运行 主要负责Table和Region的管理工作: 1 管理用户对表的增删改查操作 2 管理HRegionServer的负载均衡,调整Region分布 3 Region Split后,负责新Region的分布 4 在HRegionServer停机后,负责失效HRegionServer上Region迁移
Map
Reduce
MapReduce实例
MapReduce内部结构
Hadoop 2.0
引入一个新的资源管理系统YARN HDFS单点故障得以解决 HDFS Federation HDFS 快照 通过NFS访问HDFS 支持Window系统
Hadoop1 VS Hadoop2
Table&Region
Table随着记录增多不断变大,会自动分裂成多份Splits,成为Regions 一个region由[startkey,endkey)表示 不同region会被Master分配给相应的RegionServer进行管理
HregionServer
-ROOT- & .META.
.META. 记录用户表的Region信息,同时,.META.也可以有多region -ROOT- 记录.META.表的Region信息,但是,-ROOT-只有一个region Zookeeper中记录了-ROOT-表的location 客户端访问数据的流程:
Client -> Zookeeper -> -ROOT- -> .META. -> 用户数据表 多次网络操作,不过client端有cache缓存
集群资源管理 Hadoop介绍
Yarn 运行原理图
Hbase介绍
1 高可靠性 2 高效性 3 面向列 4 可伸缩 5 可在廉价PC
Server搭建大规模 结构化存储集群
Hbase体系结构
HBient: 使用HBase RPC机制与HMaster和HRegionServer进行通信 Client与HMaster进行通信进行管理类操作 Client与HRegionServer进行数据读写类操作
• 管理集群资 源和Job调度
TaskTracker
• 管理Task运 行
MapReduce 计算模型
Input
k1, v1 Map k2, v2 Reduce k3, v3
Output
MapReduce 扩展接口
InputFormat Mapper Partitioner Reducer OutputFormat
支持高效的跨语言RPC和持久数据存储的序列化系统 分布式数据处理模型和执行环境,运行在大型商用机集群
分布式文件系统,用于大型商用机集群
Pig是SQL-like语言,是在MapReduce上构建的一种高级查询语言,把一 些运算编译进MapReduce模型的Map和Reduce中,并且用户可以定义 自己的功能。
分布式、按列存储的数据仓库。Hive管理HDFS中存储的数据,并提供 基于SQL的查询语言(由运行时引擎翻译成MapReduce作业) 分布式、按列存储的数据库。HBase使用HDFS作为底层存储,同时支 持MapReduce的批量式计算和点查询(随机读取) 分布式、可用性高的协调服务。提供类似分布式锁的基础服务。
HBase 数据模型
Row Key:
Table主键,Table中记录按照Row Key排序
Timestamp:
每次对数据操作对应的时间戳,也即数据的version number
Column Family: 列簇,一个table在水平方向有一个或者多个列簇,列簇可由任
意多个
Column组成,列簇支持动态扩展,无须预定义数量及
文件是分离的。 数据维护:更新操作是替换版本,删除只是逻辑标记 可伸缩性:
参考资料
Lucene搜索结构
基于文档的搜索
Tika是一个内容抽取的工具集合。 支持work,ppt,execl,PDF等
类型,二进制存储,用户需自行
进行类型转换
Hbase Shell
Hbase shell
Hbase与RDBMS
数据类型:Hbase只有简单的字符串类型。 数据操作:Hbase只有很简单的插入、查询、删除、清空操作,没有复杂的
表和表之间的关系。 存储模式:Hbase是基于列式存储,每个列族由几个文件保存,不同列族的
大数据应用技术介绍
ppt课件
1
Hadoop生态系统
Hadoop生态系统
Sub Project common
Avro MapReduce HDFS PIG
Hive
Hbase
ZooKeeper Sqoop Flume Chukwa
描述
分布式文件系统和通用I/O的组件与接口(序列化,Java RPC和持久化 数据结构)
在数据库和HDFS之间高效传输数据的工具 分布式、可靠、和高可用的海量日志聚合的系统。
Chukwa是基于Hadoop的大集群监控系统,由yahoo贡献。
Hadoop介绍
HDFS 特点
存储大文件
• 百兆以上级别文件 • 百万级文件由于亿级别文件
流式处理数据
• 一次写多次多模式 • 支持追加操作
廉价的硬件环境
• 普通pc server组成集群环境
HDFS缺点
低延时读操作
• 高吞吐量而非低延时 • Hbase 解决了这个问题
大量小数据文件
• 最好每个文件大于100M
多次写
• 只支持一次写 • 只支持在文件尾部添加,不支持随机写
HDFS 部署结构
HDFS 读写过程
MapReduce 部署结构
JobTracker
相关文档
最新文档