基于 ZooKeeper 搭建 Hadoop 高可用集群的教程图解

2025-03-30 10:01:46

一、高可用简介

Hadoop 高可用 (High Availability) 分为 HDFS 高可用和 YARN 高可用，两者的实现基本类似，但 HDFS NameNode 对数据存储及其一致性的要求比 YARN ResourceManger 高得多，所以它的实现也更加复杂，故下面先进行讲解：

1.1 高可用整体架构

HDFS 高可用架构如下：

图片引用自： https://www.edureka.co/blog/how-to-set-up-hadoop-cluster-with-hdfs-high-availability/

HDFS 高可用架构主要由以下组件所构成：

Active NameNode 和 Standby NameNode：两台 NameNode 形成互备，一台处于 Active 状态，为主 NameNode，另外一台处于 Standby 状态，为备 NameNode，只有主 NameNode 才能对外提供读写服务。

主备切换控制器 ZKFailoverController：ZKFailoverController 作为独立的进程运行，对 NameNode 的主备切换进行总体控制。ZKFailoverController 能及时检测到 NameNode 的健康状况，在主 NameNode 故障时借助 Zookeeper 实现自动的主备选举和切换，当然 NameNode 目前也支持不依赖于 Zookeeper 的手动主备切换。
Zookeeper 集群：为主备切换控制器提供主备选举支持。共享存储系统：共享存储系统是实现 NameNode 的高可用最为关键的部分，共享存储系统保存了 NameNode 在运行过程中所产生的 HDFS 的元数据。
主 NameNode 和 NameNode 通过共享存储系统实现元数据同步。在进行主备切换的时候，新的主 NameNode 在确认元数据完全同步之后才能继续对外提供服务。
DataNode 节点：除了通过共享存储系统共享 HDFS 的元数据信息之外，主 NameNode 和备 NameNode 还需要共享 HDFS 的数据块和 DataNode 之间的映射关系。
DataNode 会同时向主 NameNode 和备 NameNode 上报数据块的位置信息。

1.2 基于 QJM 的共享存储系统的数据同步机制分析

目前 Hadoop 支持使用 Quorum Journal Manager (QJM) 或 Network File System (NFS) 作为共享的存储系统，这里以 QJM 集群为例进行说明：Active NameNode 首先把 EditLog 提交到 JournalNode 集群，然后 Standby NameNode 再从 JournalNode 集群定时同步 EditLog，当 Active NameNode 宕机后， Standby NameNode 在确认元数据完全同步之后就可以对外提供服务。

需要说明的是向 JournalNode 集群写入 EditLog 是遵循 “过半写入则成功” 的策略，所以你至少要有3个 JournalNode 节点，当然你也可以继续增加节点数量，但是应该保证节点总数是奇数。同时如果有 2N+1 台 JournalNode，那么根据过半写的原则，最多可以容忍有 N 台 JournalNode 节点挂掉。

1.3 NameNode 主备切换

NameNode 实现主备切换的流程下图所示：

HealthMonitor 初始化完成之后会启动内部的线程来定时调用对应 NameNode 的 HAServiceProtocol RPC 接口的方法，对 NameNode 的健康状态进行检测。

HealthMonitor 如果检测到 NameNode 的健康状态发生变化，会回调 ZKFailoverController 注册的相应方法进行处理。

如果 ZKFailoverController 判断需要进行主备切换，会首先使用 ActiveStandbyElector 来进行自动的主备选举。

ActiveStandbyElector 与 Zookeeper 进行交互完成自动的主备选举。

ActiveStandbyElector 在主备选举完成后，会回调 ZKFailoverController 的相应方法来通知当前的 NameNode 成为主 NameNode 或备 NameNode。

ZKFailoverController 调用对应 NameNode 的 HAServiceProtocol RPC 接口的方法将 NameNode 转换为 Active 状态或 Standby 状态。

1.4 YARN高可用

YARN ResourceManager 的高可用与 HDFS NameNode 的高可用类似，但是 ResourceManager 不像 NameNode ，没有那么多的元数据信息需要维护，所以它的状态信息可以直接写到 Zookeeper 上，并依赖 Zookeeper 来进行主备选举。

二、集群规划

按照高可用的设计目标：需要保证至少有两个 NameNode (一主一备) 和两个 ResourceManager (一主一备) ，同时为满足“过半写入则成功”的原则，需要至少要有3个 JournalNode 节点。这里使用三台主机进行搭建，集群规划如下：

三、前置条件所有服务器都安装有JDK，安装步骤可以参见：Linux下JDK的安装；搭建好ZooKeeper集群，搭建步骤可以参见：Zookeeper单机环境和集群环境搭建所有服务器之间都配置好SSH免密登录。

四、集群配置

4.1 下载并解压

下载Hadoop。这里我下载的是CDH版本Hadoop，下载地址为：http://archive.cloudera.com/cdh5/cdh/5/

# tar -zvxf hadoop-2.6.0-cdh5.15.2.tar.gz

4.2 配置环境变量

编辑profile文件：

# vim /etc/profile

增加如下配置：

export HADOOP_HOME=/usr/app/hadoop-2.6.0-cdh5.15.2export PATH=${HADOOP_HOME}/bin:$PATH

执行source命令，使得配置立即生效：

# source /etc/profile

4.3 修改配置

进入${HADOOP_HOME}/etc/hadoop目录下，修改配置文件。各个配置文件内容如下：

1. hadoop-env.sh

# 指定JDK的安装位置export JAVA_HOME=/usr/java/jdk1.8.0_201/

2. core-site.xml

<configuration>
 <property>
 <!-- 指定namenode的hdfs协议文件系统的通信地址 -->
 <name>fs.defaultFS</name>
 <value>hdfs://hadoop001:8020</value>
 </property>
 <property>
 <!-- 指定hadoop集群存储临时文件的目录 -->
 <name>hadoop.tmp.dir</name>
 <value>/home/hadoop/tmp</value>
 </property>
 <property>
 <!-- ZooKeeper集群的地址 -->
 <name>ha.zookeeper.quorum</name>
 <value>hadoop001:2181,hadoop002:2181,hadoop002:2181</value>
 </property>
 <property>
 <!-- ZKFC连接到ZooKeeper超时时长 -->
 <name>ha.zookeeper.session-timeout.ms</name>
 <value>10000</value>
 </property>
</configuration>

3. hdfs-site.xml

<configuration>
 <property>
 <!-- 指定HDFS副本的数量 -->
 <name>dfs.replication</name>
 <value>3</value>
 </property>
 <property>
 <!-- namenode节点数据（即元数据）的存放位置，可以指定多个目录实现容错，多个目录用逗号分隔 -->
 <name>dfs.namenode.name.dir</name>
 <value>/home/hadoop/namenode/data</value>
 </property>
 <property>
 <!-- datanode节点数据（即数据块）的存放位置 -->
 <name>dfs.datanode.data.dir</name>
 <value>/home/hadoop/datanode/data</value>
 </property>
 <property>
 <!-- 集群服务的逻辑名称 -->
 <name>dfs.nameservices</name>
 <value>mycluster</value>
 </property>
 <property>
 <!-- NameNode ID列表-->
 <name>dfs.ha.namenodes.mycluster</name>
 <value>nn1,nn2</value>
 </property>
 <property>
 <!-- nn1的RPC通信地址 -->
 <name>dfs.namenode.rpc-address.mycluster.nn1</name>
 <value>hadoop001:8020</value>
 </property>
 <property>
 <!-- nn2的RPC通信地址 -->
 <name>dfs.namenode.rpc-address.mycluster.nn2</name>
 <value>hadoop002:8020</value>
 </property>
 <property>
 <!-- nn1的http通信地址 -->
 <name>dfs.namenode.http-address.mycluster.nn1</name>
 <value>hadoop001:50070</value>
 </property>
 <property>
 <!-- nn2的http通信地址 -->
 <name>dfs.namenode.http-address.mycluster.nn2</name>
 <value>hadoop002:50070</value>
 </property>
 <property>
 <!-- NameNode元数据在JournalNode上的共享存储目录 -->
 <name>dfs.namenode.shared.edits.dir</name>
 <value>qjournal://hadoop001:8485;hadoop002:8485;hadoop003:8485/mycluster</value>
 </property>
 <property>
 <!-- Journal Edit Files的存储目录 -->
 <name>dfs.journalnode.edits.dir</name>
 <value>/home/hadoop/journalnode/data</value>
 </property>
 <property>
 <!-- 配置隔离机制，确保在任何给定时间只有一个NameNode处于活动状态 -->
 <name>dfs.ha.fencing.methods</name>
 <value>sshfence</value>
 </property>
 <property>
 <!-- 使用sshfence机制时需要ssh免密登录 -->
 <name>dfs.ha.fencing.ssh.private-key-files</name>
 <value>/root/.ssh/id_rsa</value>
 </property>
 <property>
 <!-- SSH超时时间 -->
 <name>dfs.ha.fencing.ssh.connect-timeout</name>
 <value>30000</value>
 </property>
 <property>
 <!-- 访问代理类，用于确定当前处于Active状态的NameNode -->
 <name>dfs.client.failover.proxy.provider.mycluster</name>
 <value>org.apache.hadoop.hdfs.server.namenode.ha.ConfiguredFailoverProxyProvider</value>
 </property>
 <property>
 <!-- 开启故障自动转移 -->
 <name>dfs.ha.automatic-failover.enabled</name>
 <value>true</value>
 </property>
</configuration>

4. yarn-site.xml

<configuration>
 <property>
 <!--配置NodeManager上运行的附属服务。需要配置成mapreduce_shuffle后才可以在Yarn上运行MapReduce程序。-->
 <name>yarn.nodemanager.aux-services</name>
 <value>mapreduce_shuffle</value>
 </property>
 <property>
 <!-- 是否启用日志聚合(可选) -->
 <name>yarn.log-aggregation-enable</name>
 <value>true</value>
 </property>
 <property>
 <!-- 聚合日志的保存时间(可选) -->
 <name>yarn.log-aggregation.retain-seconds</name>
 <value>86400</value>
 </property>
 <property>
 <!-- 启用RM HA -->
 <name>yarn.resourcemanager.ha.enabled</name>
 <value>true</value>
 </property>
 <property>
 <!-- RM集群标识 -->
 <name>yarn.resourcemanager.cluster-id</name>
 <value>my-yarn-cluster</value>
 </property>
 <property>
 <!-- RM的逻辑ID列表 -->
 <name>yarn.resourcemanager.ha.rm-ids</name>
 <value>rm1,rm2</value>
 </property>
 <property>
 <!-- RM1的服务地址 -->
 <name>yarn.resourcemanager.hostname.rm1</name>
 <value>hadoop002</value>
 </property>
 <property>
 <!-- RM2的服务地址 -->
 <name>yarn.resourcemanager.hostname.rm2</name>
 <value>hadoop003</value>
 </property>
 <property>
 <!-- RM1 Web应用程序的地址 -->
 <name>yarn.resourcemanager.webapp.address.rm1</name>
 <value>hadoop002:8088</value>
 </property>
 <property>
 <!-- RM2 Web应用程序的地址 -->
 <name>yarn.resourcemanager.webapp.address.rm2</name>
 <value>hadoop003:8088</value>
 </property>
 <property>
 <!-- ZooKeeper集群的地址 -->
 <name>yarn.resourcemanager.zk-address</name>
 <value>hadoop001:2181,hadoop002:2181,hadoop003:2181</value>
 </property>
 <property>
 <!-- 启用自动恢复 -->
 <name>yarn.resourcemanager.recovery.enabled</name>
 <value>true</value>
 </property>
 <property>
 <!-- 用于进行持久化存储的类 -->
 <name>yarn.resourcemanager.store.class</name>
 <value>org.apache.hadoop.yarn.server.resourcemanager.recovery.ZKRMStateStore</value>
 </property>
</configuration>

5. mapred-site.xml

<configuration>
 <property>
 <!--指定mapreduce作业运行在yarn上-->
 <name>mapreduce.framework.name</name>
 <value>yarn</value>
 </property>
</configuration>

5. slaves

配置所有从属节点的主机名或IP地址，每行一个。所有从属节点上的DataNode服务和NodeManager服务都会被启动。

hadoop001
hadoop002
hadoop003

4.4 分发程序

将Hadoop安装包分发到其他两台服务器，分发后建议在这两台服务器上也配置一下Hadoop的环境变量。

# 将安装包分发到hadoop002
scp -r /usr/app/hadoop-2.6.0-cdh5.15.2/ hadoop002:/usr/app/
# 将安装包分发到hadoop003
scp -r /usr/app/hadoop-2.6.0-cdh5.15.2/ hadoop003:/usr/app/

5.1 启动ZooKeeper

分别到三台服务器上启动ZooKeeper服务：

 zkServer.sh start

5.2 启动Journalnode

分别到三台服务器的的${HADOOP_HOME}/sbin目录下，启动journalnode进程：

hadoop-daemon.sh start journalnode

5.3 初始化NameNode

在hadop001上执行NameNode初始化命令：

hdfs namenode -format

执行初始化命令后，需要将NameNode元数据目录的内容，复制到其他未格式化的NameNode上。元数据存储目录就是我们在hdfs-site.xml中使用dfs.namenode.name.dir属性指定的目录。这里我们需要将其复制到hadoop002上：

 scp -r /home/hadoop/namenode/data hadoop002:/home/hadoop/namenode/

5.4 初始化HA状态

在任意一台NameNode上使用以下命令来初始化ZooKeeper中的HA状态：

hdfs zkfc -formatZK

5.5 启动HDFS

进入到hadoop001的${HADOOP_HOME}/sbin目录下，启动HDFS。此时hadoop001和hadoop002上的NameNode服务，和三台服务器上的DataNode服务都会被启动：

start-dfs.sh

5.6 启动YARN

进入到hadoop002的${HADOOP_HOME}/sbin目录下，启动YARN。此时hadoop002上的ResourceManager服务，和三台服务器上的NodeManager服务都会被启动：

start-yarn.sh

需要注意的是，这个时候hadoop003上的ResourceManager服务通常是没有启动的，需要手动启动：

yarn-daemon.sh start resourcemanager

六、查看集群

6.1 查看进程

成功启动后，每台服务器上的进程应该如下：

[root@hadoop001 sbin]# jps
4512 DFSZKFailoverController
3714 JournalNode
4114 NameNode
3668 QuorumPeerMain
5012 DataNode
4639 NodeManager
[root@hadoop002 sbin]# jps
4499 ResourceManager
4595 NodeManager
3465 QuorumPeerMain
3705 NameNode
3915 DFSZKFailoverController
5211 DataNode
3533 JournalNode
[root@hadoop003 sbin]# jps
3491 JournalNode
3942 NodeManager
4102 ResourceManager
4201 DataNode
3435 QuorumPeerMain

6.2 查看Web UI

HDFS和YARN的端口号分别为50070和8080，界面应该如下：

此时hadoop001上的NameNode处于可用状态：

而hadoop002上的NameNode则处于备用状态：

hadoop002上的ResourceManager处于可用状态：

hadoop003上的ResourceManager则处于备用状态：

同时界面上也有Journal Manager的相关信息：

七、集群的二次启动

上面的集群初次启动涉及到一些必要初始化操作，所以过程略显繁琐。但是集群一旦搭建好后，想要再次启用它是比较方便的，步骤如下（首选需要确保ZooKeeper集群已经启动）：

在hadoop001启动 HDFS，此时会启动所有与 HDFS 高可用相关的服务，包括 NameNode，DataNode 和 JournalNode：

start-dfs.sh

在hadoop002启动YARN：

start-yarn.sh

这个时候hadoop003上的ResourceManager服务通常还是没有启动的，需要手动启动：

yarn-daemon.sh start resourcemanager

参考资料

以上搭建步骤主要参考自官方文档：

HDFS High Availability Using the Quorum Journal Manager ResourceManager High Availability

总结

以上所述是小编给大家介绍的基于 ZooKeeper 搭建 Hadoop 高可用集群的教程图解,希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对我们网站的支持！
如果你觉得本文对你有帮助，欢迎转载，烦请注明出处，谢谢！

ActiveMQ基于zookeeper的主从（levelDB Master/Slave）搭建

ActiveMQ 5.9.0新推出的主从实现,基于zookeeper来选举出一个master,其他节点自动作为slave实时同步消息.因为有实时同步数据的slave的存在,master不用担心数据丢失,所以leveldb会优先采用内存存储消息,异步同步到磁盘,所以该方式的activeMQ读写性能最好因为选举机制要超过半数,所以最少需要3台节点,才能实现高可用.如果集群是两台则master失效后slave会不起作用,所以集群至少三台.此种方式仅实现主备功能,避免单点故障,没有负载均衡功能. 1.环
SpringCloud用Zookeeper搭建配置中心的方法

本文介绍了SpringCloud +Zookeeper完成配置中心,分享给大家,具有如下: 使用场景项目配置更改不需要打包,重启提供配置文件的可视化界面和springcloud快速整合为什么使用zookeeper Zookeeper 作为一个分布式的服务框架,主要用来解决分布式集群中应用系统的一致性问题,它能提供基于类似于文件系统的目录节点树方式的数据存储, Zookeeper 作用主要是用来维护和监控存储的数据的状态变化,通过监控这些数据状态的变化,从而达到基于数据的集群管理. 怎么使
Zookeeper 单机环境和集群环境搭建

一.单机环境搭建# 1.1 下载# 下载对应版本 Zookeeper,这里我下载的版本 3.4.14.官方下载地址:https://archive.apache.org/dist/zookeeper/ # wget https://archive.apache.org/dist/zookeeper/zookeeper-3.4.14/zookeeper-3.4.14.tar.gz 1.2 解压# # tar -zxvf zookeeper-3.4.14.tar.gz 1.3 配置环境变量# #
centos7下搭建ZooKeeper3.4中间件常用命令小结

一.下载解压 1.Zookeeper简介 Zookeeper 作为一个分布式的服务框架,主要用来解决分布式集群中应用系统的一致性问题,它能提供基于类似于文件系统的目录节点树方式的数据存储,但是 Zookeeper 并不是用来专门存储数据的,它的作用主要是用来维护和监控你存储的数据的状态变化.通过监控这些数据状态的变化,从而可以达到基于数据的集群管理. 2.下载环境版本 centos7 zookeeper 3.4.14 [root@localhost mysoft]$ cd /usr/local
在Linux下搭建Zookeeper管理中心步骤分享

最近在做宜立方商城项目时要求使用dubbo-Zookeeper服务搭建一个SOA服务架构,虽然在Windows环境下也可以启动Zookeeper服务,但是作为搭建服务的不二选择,使用Linux服务器搭建Zookeeper服务无疑更为合适,今天我们就在Linux环境下搭建一个基于Zookeeper的分布式服务注册中心. 搭建环境要求虚拟机(以下为虚拟机9的安装软件以及注册机) 链接: https://pan.baidu.com/s/1c2YbZ92 密码: jyya centos系统(CentO
基于 ZooKeeper 搭建 Hadoop 高可用集群的教程图解

一.高可用简介 Hadoop 高可用 (High Availability) 分为 HDFS 高可用和 YARN 高可用,两者的实现基本类似,但 HDFS NameNode 对数据存储及其一致性的要求比 YARN ResourceManger 高得多,所以它的实现也更加复杂,故下面先进行讲解: 1.1 高可用整体架构 HDFS 高可用架构如下: 图片引用自: https://www.edureka.co/blog/how-to-set-up-hadoop-cluster-with-hdfs-hi
基于mysql+mycat搭建稳定高可用集群负载均衡主备复制读写分离操作

数据库性能优化普遍采用集群方式,oracle集群软硬件投入昂贵,今天花了一天时间搭建基于mysql的集群环境. 主要思路简单说,实现mysql主备复制-->利用mycat实现负载均衡. 比较了常用的读写分离方式,推荐mycat,社区活跃,性能稳定. 测试环境 MYSQL版本:Server version: 5.5.53,到官网可以下载WINDWOS安装包. 注意:确保mysql版本为5.5以后,以前版本主备同步配置方式不同. linux实现思路类似,修改my.cnf即可. A主mysql.19
centos环境下nginx高可用集群的搭建指南

目录 1.概述 2.CentOS中nginx集群搭建 2.1 集群架构图 2.2 Keepalived 2.3 集群搭建准备 2.4 集群搭建 2.4.1 安装keepalived 2.4.2 配置keepalived.conf 2.4.3 编写nginx监测脚本 2.4.4 启动keepalived 2.4.5 启动nginx 2.4.6 测试 3.小结 4.参考文献总结 1.概述 nginx单机部署时,一旦宕机就会导致整个服务的不可用,导致雪崩式效应.集群式部署是解决单点式雪崩效应的有效方
CentOS下RabbitMq高可用集群环境搭建教程

CentOS下RabbitMq高可用集群环境搭建教程分享给大家. 准备工作 1.准备两台或多台安装有rabbitmq-server服务的服务器我这里准备了两台,分别如下: 192.168.40.130 rabbitmq01 192.168.40.131 rabbitmq02 2.确保防火墙是关闭的3,官网参考资料 http://www.rabbitmq.com/clustering.html hosts映射修改每台服务上的hosts文件(路径:/etc/hosts),设置成如下: 192.1
Redis5之后版本的高可用集群搭建的实现

一.安装redis 1.安装gcc yum install gcc 2.下载redis-5.0.8.tar.gz 3.把下载好的redis-5.0.8.tar.gz放在/gyu/software文件夹下,并解压 > tar xzf redis-5.0.8.tar.gz > cd redis-5.0.8 4.进入到解压好的redis-5.0.8目录下,进行编译与安装 > make & make install 5.启动并指定配置文件 > src/redis-server re
nginx搭建高可用集群的实现方法

目录 Keepalived+Nginx 高可用集群(主从模式) Keepalived+Nginx 高可用集群(主从模式) 集群架构图 1.准备两台装有Nginx虚拟机 2.都需安装Keepalived yum install keepalived -y 查看是否安装成功 rpm -q -a keepalived 安装之后,在 etc 里面生成目录 keepalived,有文件 keepalived.conf 3.完成高可用配置(主从配置) 修改/etc/keepalived/keepalivec
MySQL之高可用集群部署及故障切换实现

一.MHA 1.概念 2.MHA 的组成 3.MHA 的特点二.搭建MySQL+MHA 思路和准备工作 1.MHA架构数据库安装一主两从 MHA搭建 2.故障模拟模拟主库失效备选主库成为主库原故障主库恢复重新加入到MHA成为从库 3.准备4台安装MySQL虚拟机 MHA高可用集群相关软件包 MHAmanager IP:192.168.221.30 MySQL1 IP:192.168.221.20 MySQL2 IP:192.168.221.100 MySQL3 IP: 192.168
运用.net core中实例讲解RabbitMQ高可用集群构建

目录一.集群架构简介二.普通集群搭建 2.1 各个节点分别安装RabbitMQ 2.2 把节点加入集群 2.3 代码演示普通集群的问题三.镜像集群四.HAProxy环境搭建. 五.KeepAlived 环境搭建一.集群架构简介当单台 RabbitMQ 服务器的处理消息的能力达到瓶颈时,此时可以通过 RabbitMQ 集群来进行扩展,从而达到提升吞吐量的目的.RabbitMQ 集群是一个或多个节点的逻辑分组,集群中的每个节点都是对等的,每个节点共享所有的用户,虚拟主机,队列,交换器,绑
Redis高可用集群redis-cluster详解

哨兵模式主要解决了手动切换主从节点的问题 1 , 哨兵模式的缺陷 .主从节点切换的时候存在访问瞬断,等待时间较长, .只有一个master节点提供写,slave节点提供读,尽管写的效率是10万/秒,在电商大促时,写的压力全部集中在master节点上. .master节点的内存不能设置的太大,否则持久化文件过大,影响主从同步 2,redis-cluster集群模式 Redis Cluster是社区版推出的Redis分布式集群解决方案,主要解决Redis分布式方面的需求,比如,当遇到单机内存,并发和
sentinel支持的redis高可用集群配置详解

目录一.首先配置redis的主从同步集群二.sentinel高可用一.首先配置redis的主从同步集群 1.主库的配置文件不用修改,从库的配置文件只需增加一行,说明主库的IP端口.如果需要验证的,也要加多一行,认证密码. slaveof 192.168.20.26 5268 masterauth hodge01 一主多从的话,就启用多个从库.其中,从库都是一样的方案.本次有两个slave. 2.命令检查 /usr/local/redis/bin/redis-cli -p 5257 -a h