CentOS 7安装MySQL5.7 – 大数据环境

一、课前准备

  1. 准备一台CentOS 7的服务器

二、课堂主题

  1. 如何在CentOS 7当中安装mysql数据库,并开启mysql数据库的远程连接

三、课堂目标

  1. 熟练在CentOS 7中安装mysql5.7数据库

四、知识要点

1. root用户下安装mysql

  • CentOS 7中切换到root用户,安装mysql
  • 在CentOS 7中默认安装有MariaDB,这个是MySQL的分支;但还是要安装MySQL,而且安装完成之后会直接覆盖掉MariaDB

2. 安装mysql

2.1 下载并安装mysql官方的yum源

若是在学完Hadoop、ZooKeeper课程后,接着要学习Hive课程时,需要先安装mysql

安装到第三个节点node03上

  • 使用root用户,在CentOS 7服务器的/kkb/soft路径下执行以下命令
  • 切换到root用户
[hadoop@node03 ~]$ su root
  • 进入/kkb/soft目录,并安装wget软件
[root@node03 hadoop]# cd /kkb/soft/
[root@node03 soft]# yum -y install wget

出现Installed!字样,表示成功安装

  • 使用wget命令下载mysql的rpm包
[root@node03 soft]# wget -i -c http://dev.mysql.com/get/mysql57-community-release-el7-10.noarch.rpm

-i 指定输入文件

-c 表示断点续传

2.2 安装mysql

[root@node03 soft]# yum -y install mysql57-community-release-el7-10.noarch.rpm

  • 安装mysql server

    这步可能会花些时间,需要在线下载,视网速而定;然后再安装;安装完成后就会覆盖掉之前的mariadb

[root@node03 soft]# yum -y install mysql-community-server

3. 设置mysql

3.1 mysql服务
  • 首先启动MySQL服务
[root@node03 soft]# systemctl start mysqld.service
  • 查看mysql启动状态
[root@node03 soft]# systemctl status mysqld.service

下图active(running)表示mysql服务已启动

3.2 修改密码

  • 此时MySQL已经开始正常运行,不过要登陆MySQL,还得先找出此时mysql的root用户的临时密码

    如下命令可以在日志文件中找出临时密码

[root@node03 hadoop]# grep "password" /var/log/mysqld.log
  • 可以查看到我的临时密码为

    注意:不同人的临时密码不一样,根据自己的实际情况而定

fHy3Su:&REkh

  • 使用临时密码,登陆mysql客户端
[root@node03 hadoop]# mysql -uroot -p
  • 设置密码策略为LOW,此策略只检查密码的长度
set global validate_password_policy=LOW;

关键字“Query OK”表示,sql语句执行成功

  • 设置密码最小长度
set global validate_password_length=6;

  • 修改mysql的root用户,本地登陆的密码为123456
ALTER USER 'root'@'localhost' IDENTIFIED BY '123456';
  • 开启mysql的远程连接权限
grant all privileges  on  *.* to 'root'@'%' identified by '123456' with grant option;
flush privileges;
  • 若不再需要使用mysql命令行,可以退出
exit

4. mysql的卸载

注意:mysql安装有问题的,才做此步骤

  • 上面我们在CentOS 7当中已经安装好了5.7版本的mysql服务;
  • 如果以后我们不需要mysql了,或者mysql安装失败了需要重新安装,那么我们需要将mysql卸载掉
  • 使用root用户
4.1 停止mysql服务
[root@node03 hadoop]# systemctl stop mysqld.service
4.2 列出已安装的mysql相关的包
  • 有两种方式,都可以,任选其一

    方式一

[root@node03 hadoop]# yum list installed mysql*

​ 方式二

[root@node03 hadoop]# rpm -qa | grep -i mysql

4.3 卸载mysql包
  • 卸载rpm包,使用rpm -e --nodeps方式卸载,后边依次加入上图的①~⑥的包名,包名之间有空格

    注意:==根据自己的实际情况,指定包名进行卸载==

[root@node03 hadoop]# rpm -e --nodeps mysql57-community-release-el7-10.noarch mysql-community-common-5.7.28-1.el7.x86_64 mysql-community-client-5.7.28-1.el7.x86_64 mysql-community-libs-compat-5.7.28-1.el7.x86_64 mysql-community-libs-5.7.28-1.el7.x86_64 mysql-community-server-5.7.28-1.el7.x86_64
  • 卸载完后,用两个命令再次确认,mysql相关的包已经被卸载

    注意:确保mysql卸载干净,再继续往下操作

[root@node03 hadoop]# rpm -qa | grep -i mysql
[root@node03 hadoop]# yum list installed mysql*

4.4 删除mysql残留文件
  • 查看mysql相关目录
[root@node03 hadoop]# find / -name mysql

根据自己的实际情况,删除find出来的目录

[root@node03 hadoop]# rm -rf /var/lib/mysql/
[root@node03 hadoop]# rm -rf /usr/share/mysql/
[root@node03 hadoop]# rm -rf /etc/selinux/targeted/active/modules/100/mysql
  • 另外删除文件:
[root@node03 hadoop]# rm -rf /root/.mysql_history
[root@node03 hadoop]# rm -f /var/log/mysqld.log
  • 从步骤2.2重新开始

Views: 63

Hive安装部署(Ver3.1.2)

一、课前准备

  1. 安装好对应版本的hadoop集群,并启动hadoop的HDFS以及YARN服务
  2. 安装了MySQL服务,并启动MySQL的服务

二、课堂主题

  1. hive安装部署

三、课堂目标

  1. 掌握hive的安装部署

四、知识要点

1. Hive的安装部署(10分钟)

注意hive就是一个构建数据仓库的工具,只需要在一台服务器上安装就可以了,不需要在多台服务器上安装。

此处以安装到node03为例;请大家保持统一

使用hadoop普通用户操作

1.1 先决条件

  • 搭建好三节点Hadoop集群;
  • node03上先安装好MySQL服务;
  • 参考文档:《CentOS 7安装MySQL5.7版本》

1.2 准备安装包

1.3 解压

  • 解压安装包到指定的规划目录/kkb/install

    [hadoop@node03 ~]$ cd /kkb/soft/
    [hadoop@node03 soft]$ tar -xzvf apache-hive-3.1.2-bin.tar.gz -C /kkb/install

1.4 修改配置文件

  1. 进入hive安装目录
[hadoop@node03 install]$ cd /kkb/install/
  1. 重新命名hive目录
[hadoop@node03 install]$ mv apache-hive-3.1.2-bin/ apache-hive-3.1.2
  1. 修改/kkb/install/conf目录下的hive-site.xml, 默认没有该文件, 需要手动创建
[hadoop@node03 install]$ cd /kkb/install/apache-hive-3.1.2/conf/
[hadoop@node03 conf]$ vim hive-site.xml
  1. 进入编辑模式, 文件内容如下
<?xml version="1.0"?>
<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>
<configuration>
        <property>
                <name>javax.jdo.option.ConnectionURL</name>
                <value>jdbc:mysql://node03:3306/metastore?useSSL=false</value>
        </property>

        <property>
                <name>javax.jdo.option.ConnectionDriverName</name>
                <value>com.mysql.jdbc.Driver</value>
        </property>
        <property>
                <name>javax.jdo.option.ConnectionUserName</name>
                <value>root</value>
        </property>
              <property>
                <name>hive.metastore.warehouse.dir</name>
                <value>/user/hive/warehouse</value>
        </property>
        <property>
                <name>javax.jdo.option.ConnectionPassword</name>
                <value>123456</value>
        </property>
        <property>
                <name>hive.metastore.schema.verification</name>
                <value>false</value>
        </property>
        <property>
                <name>hive.metastore.event.db.notification.api.auth</name>
                <value>false</value>
        </property>
         <property>
                <name>hive.cli.print.current.db</name>
                <value>true</value>
        </property>
         <property>
                <name>hive.cli.print.header</name>
                <value>true</value>
        </property>
        <property>
                <name>hive.server2.thrift.bind.host</name>
                <value>node03</value>
        </property>
        <property>
                <name>hive.server2.thrift.port</name>
                <value>10000</value>
        </property>
</configuration>
  1. 修改日志配置文件hive-log4j.properties
  • 创建hive日志存储目录
[hadoop@node03 conf]$ mkdir -p /kkb/install/apache-hive-3.1.2/logs/
  • 重命名生成文件hive-log4j.properties
[hadoop@node03 conf]$ pwd
/kkb/install/apache-hive-3.1.2/conf
[hadoop@node03 conf]$ mv hive-log4j2.properties.template hive-log4j2.properties
[hadoop@node03 conf]$ vim hive-log4j2.properties # 修改文件
  • 修改此文件的hive.log.dir属性的值
#更改以下内容,设置我们的hive的日志文件存放的路径,便于排查问题
property.hive.log.dir=/kkb/install/apache-hive-3.1.2/logs/

image-20201111101836343

1.5 拷贝mysql驱动包

  • 上传mysql驱动包,如mysql-connector-java-5.1.38.jar/kkb/soft目录中
  • 由于运行hive时,需要向mysql数据库中读写元数据,所以==需要将mysql的驱动包上传到hive的lib目录下==
[hadoop@node03 ~]$ cd /kkb/soft/
[hadoop@node03 soft]$ cp mysql-connector-java-5.1.38.jar /kkb/install/apache-hive-3.1.2/lib/

1.6 解决日志Jar包冲突

# 进入lib目录
[hadoop@node03 conf]$ cd /kkb/install/apache-hive-3.1.2/lib/
# 重新命名 或者直接删除
[hadoop@node03 lib]$ mv log4j-slf4j-impl-2.10.0.jar log4j-slf4j-impl-2.10.0.jar.bak

1.6 配置Hive环境变量

  • 切换到root用户下
[hadoop@node03 soft]$ su root
Password:
  • 打开/etc/profile文件
[root@node03 soft]# vim /etc/profile
  • 末尾添加如下内容
export HIVE_HOME=/kkb/install/apache-hive-3.1.2
export PATH=$PATH:$HIVE_HOME/bin
  • 切换回hadoop用户,并source
[root@node03 soft]# su hadoop
[hadoop@node03 soft]$ source /etc/profile

1.7 初始化元数据库

  1. 新建一个node03连接, 登录MySQL
# 连接MySQL, 用户名root, 密码123456
[hadoop@node03 ~]$ mysql -uroot -p123456
  1. 创建hive元数据, 需要和hive-site.xml中配置的一致
-- 创建数据库, 数据库名为: metastore
create database metastore;
show databases;
  1. 退出mysql
exit
  1. 初始化元数据库
[hadoop@node03 ~]$ schematool -initSchema -dbType mysql -verbose

image-20201104145352060

看到schemaTool completed 表示初始化成功

1.7 验证安装

  • ==hadoop集群已启动==
  • ==mysql服务已启动==
  • 在node03上任意目录启动hive cli命令行客户端
[hadoop@node03 ~]$ hive  
# 启动成功之后, 警告信息可以忽略
  • 查看有哪些数据库
show databases;

image-20201104154118088

  • 说明hive安装成功
  • 退出cli
quit;

1.8 通过beeline连接代理服务器hiveserver2 操作hive

后期课堂中主要使用这种方式操作hive

  1. node01修改hadoop的core-site.xml文件
[hadoop@node03 ~]$ cd /kkb/install/hadoop-3.1.4/etc/hadoop
[hadoop@node03 hadoop]$ vim core-site.xml 
  1. 在core-site.xml中添加以下配置信息
    1. 配置信息hadoop.proxyuser.hadoop.hostshadoop.proxyuser.hadoop.groups中的hadoop用户需要修改为自己的用户名
    2. image-20210416113542602
 <property>
         <name>hadoop.proxyuser.hadoop.hosts</name>
        <value>*</value>
    </property>
    <property>
        <name>hadoop.proxyuser.hadoop.groups</name>
        <value>*</value>
    </property>
  1. 将core-site.xml文件同步到node02和node03
scp /kkb/install/hadoop-3.1.4/etc/hadoop/core-site.xml node02:/kkb/install/hadoop-3.1.4/etc/hadoop/

scp /kkb/install/hadoop-3.1.4/etc/hadoop/core-site.xml node03:/kkb/install/hadoop-3.1.4/etc/hadoop/
  1. 启动hiveserver2
[hadoop@node03 hive]$ cd /kkb/install/hive/
[hadoop@node03 hive]$ bin/hiveserver2  # 启动警告信息可以忽略

image-20201104152847036

  1. 新建node03连接, 连接hiveserver2
[hadoop@node03 hive]$ cd /kkb/install/hive/
[hadoop@node03 hive]$ bin/beeline --color=true

image-20201104153110962

  1. 通过jdbc方式连接hiveserver2, 输入用户名和密码
beeline> !connect jdbc:hive2://node03:10000
  1. 输入用户名: hadoop、密码: 123456
Enter username for jdbc:hive2://node03:10000: hadoop
Enter password for jdbc:hive2://node03:10000: 123456
  1. 测试
0: jdbc:hive2://node03:10000> show databases;

image-20201104153645880

创建启停脚本

hive-services.sh

#!/bin/bash
HIVE_LOG_DIR=$HIVE_HOME/logs

mkdir -p $HIVE_LOG_DIR

#检查进程是否运行正常,参数1为进程名,参数2为进程端口
function check_process()
{
    pid=$(ps -ef 2>/dev/null | grep -v grep | grep -i $1 | awk '{print $2}')
    ppid=$(netstat -nltp 2>/dev/null | grep $2 | awk '{print $7}' | cut -d '/' -f 1)
    echo $pid
    [[ "$pid" =~ "$ppid" ]] && [ "$ppid" ] && return 0 || return 1
}

function hive_start()
{
    metapid=$(check_process HiveMetastore 9083)
    cmd="nohup hive --service metastore >$HIVE_LOG_DIR/metastore.log 2>&1 &"
    cmd=$cmd" sleep 4; hdfs dfsadmin -safemode wait >/dev/null 2>&1"
    [ -z "$metapid" ] && eval $cmd || echo "Metastroe服务已启动"
    server2pid=$(check_process HiveServer2 10000)
    cmd="nohup hive --service hiveserver2 >$HIVE_LOG_DIR/hiveServer2.log 2>&1 &"
    [ -z "$server2pid" ] && eval $cmd || echo "HiveServer2服务已启动"
}

function hive_stop()
{
    metapid=$(check_process HiveMetastore 9083)
    [ "$metapid" ] && kill $metapid || echo "Metastore服务未启动"
    server2pid=$(check_process HiveServer2 10000)
    [ "$server2pid" ] && kill $server2pid || echo "HiveServer2服务未启动"
}

case $1 in
"start")
    hive_start
    ;;
"stop")
    hive_stop
    ;;
"restart")
    hive_stop
    sleep 2
    hive_start
    ;;
"status")
    check_process HiveMetastore 9083 >/dev/null && echo "Metastore服务运行正常" || echo "Metastore服务运行异常"
    check_process HiveServer2 10000 >/dev/null && echo "HiveServer2服务运行正常" || echo "HiveServer2服务运行异常"
    ;;
*)
    echo Invalid Args!
    echo 'Usage: '$(basename $0)' start|stop|restart|status'
    ;;
esac

HiveServer2启动异常处理

一般hiverServer2的启动比较花时间,需等待5分钟左右才能启动,如果长时间还没有启动需要查看日志寻找失败原因:

异常1

Safe mode is ON. The reported blocks 3 needs additional 2 blocks to reach the threshold 0.9990 of total blocks 5. The number of live datanodes 2 has reached the minimum number 0. Safe mode will be turned off automatically once the thresholds have been reached.

说明我们的损坏的文件比例超过了阈值, 这个阈值配置在hdfs中, 也就是说不允许任何一个块损坏掉. 如果我们配置成99%应该就不会触发safemode了.
由于系统断电,内存不足等原因导致dataNode丢失超过设置的丢失百分比,系统自动进入安全模式

解决办法

执行命令退出安全模式:

hadoop dfsadmin -safemode leave`

执行健康检查,删除损坏掉的block
hdfs fsck  /  -delete

运行后如果出现下面提示,表示修复完毕

The filesystem under path '/' is HEALTHY

如果没有修复则可以多执行一次hdfs fsck命令

异常2

java.lang.NoClassDefFoundError: org/apache/tez/dag/api/TezConfiguration

Views: 86

Zookeeper集群安装部署

一、课前准备

  1. 准备一台内存最少8G(建议16G)、cpu i7 4核的电脑

二、课堂主题

  1. 搭建3节点zookeeper集群

三、课堂目标

  1. 完成zookeeper集群安装

四、知识要点

1. zookeeper集群的安装

注意事项:三台机器一定要保证时钟同步

1.1 下载zookeeper的压缩包

  • 下载网址

  • 我们在这个网址下载我们使用的zk版本为apache-zookeeper-3.6.2

  • 下载完成之后,上传到我们的node01的/kkb/soft路径下准备进行安装

1.2 解压

  • node01执行以下命令解压zookeeper的压缩包到node01服务器的/kkb/install路径下去,然后准备进行安装
cd /kkb/soft

tar -zxvf apache-zookeeper-3.6.2-bin.tar.gz  -C /kkb/install/

1.3 修改配置文件

  • 第一台机器修改配置文件
cd /kkb/install/apache-zookeeper-3.6.2-bin/conf

mkdir -p /kkb/install/apache-zookeeper-3.6.2-bin/zkdatas

cp zoo_sample.cfg zoo.cfg
  • vim zoo.cfg修改文件,修改如下属性值
dataDir=/kkb/install/apache-zookeeper-3.6.2-bin/zkdatas

autopurge.snapRetainCount=3

autopurge.purgeInterval=1

#文件末尾增加如下三行
server.1=node01:2888:3888
server.2=node02:2888:3888
server.3=node03:2888:3888

1.4 添加myid配置

  • 在第一台机器的/kkb/install/apache-zookeeper-3.6.2-bin/zkdatas/这个路径下创建一个文件,文件名为myid ,文件内容为1
echo 1 >  /kkb/install/apache-zookeeper-3.6.2-bin/zkdatas/myid

1.5 安装包分发并修改myid的值

  • 第一台机器上面执行以下两个命令
scp -r /kkb/install/apache-zookeeper-3.6.2-bin/ node02:/kkb/install/

scp -r /kkb/install/apache-zookeeper-3.6.2-bin/ node03:/kkb/install/
  • ==第二台==机器上修改myid的值为2;直接在第二台机器任意路径执行以下命令
echo 2 > /kkb/install/apache-zookeeper-3.6.2-bin/zkdatas/myid
  • ==第三台==机器上修改myid的值为3;直接在第三台机器任意路径执行以下命令
echo 3 > /kkb/install/apache-zookeeper-3.6.2-bin/zkdatas/myid

1.6 配置环境变量

  • 三台节点都配置/etc/profile文件
sudo vim /etc/profile
export ZK_HOME=/kkb/install/apache-zookeeper-3.6.2-bin
export PATH=$PATH:$ZK_HOME/bin
  • 三台节点,让新添环境变量生效(hadoop用户下执行)
source /etc/profile

1.7 三台机器启动zookeeper服务

  • 三台机器启动zookeeper服务;这个命令三台机器都要执行
zkServer.sh start
  • 查看启动状态
zkServer.sh status

一个zkServer的状态要么是follower,要么是leader

三个节点中,一个节点为leader,另外两个为follower,类似下图

![](https://imgs.delucia.cn/imgs/2021/Image201910221141 (2).png)

  • jps每个服务器上有一个QuorumPeerMain进程

1.8 如何关闭zookeeper集群
  • 三个节点运行
zkServer.sh stop

==提醒:如果要关闭电脑时,清一定要按照以下顺序操作,否则集群可能会出问题==

  • 关闭zookeeper集群

  • 关闭虚拟机

  • 关闭电脑

Views: 94

Hadoop集群搭建(3.X版本,3节点)

一、课前准备

  1. 准备一台内存最少8G(建议16G)、cpu i7 4核的电脑

二、课堂主题

  1. 安装虚拟化软件VMware
  2. 准备3台linux虚拟机
  3. 搭建3节点zookeeper集群
  4. 搭建3节点的hadoop集群

三、课堂目标

  1. 完成大数据课程课前环境准备

四、知识要点

VMware版本:

VMware建议使用比较新的版本,如VMware 15.5
关于VMware的安装,直接使用安装包一直下一步安装即可,且安装包当中附带破解秘钥,进行破解即可使用

linux版本

linux统一使用centos7.6 64位版本
种子文件下载地址:http://mirrors.aliyun.com/centos/7.6.1810/isos/x86_64/CentOS-7-x86_64-DVD-1810.torrent

  • 具体实操过程请参考视频

安装hadoop集群时,无论是windows还是mac,都可以参考此文档

3. hadoop集群的安装

  • 安装环境服务部署规划
服务器IP node01 node02 node03
HDFS NameNode
HDFS SecondaryNameNode
HDFS DataNode DataNode DataNode
YARN ResourceManager
YARN NodeManager NodeManager NodeManager
历史日志服务器 JobHistoryServer
第一步:上传压缩包并解压
  • 将我们重新编译之后支持snappy压缩的hadoop包上传到第一台服务器并解压;第一台机器执行以下命令

链接:https://pan.baidu.com/s/1sn946HHw0OyJ7YGsOdCdPQ
提取码:yb61

cd /kkb/soft/
tar -xzvf hadoop-3.1.4.tar.gz -C /kkb/install
第二步:查看hadoop支持的压缩方式以及本地库

第一台机器执行以下命令

cd /kkb/install/hadoop-3.1.4/
bin/hadoop checknative

image-20201027152059863

如果出现openssl为false,那么==所有机器==在线安装openssl即可,执行以下命令,虚拟机联网之后就可以在线进行安装了

sudo yum -y install openssl-devel
第三步:修改配置文件
修改hadoop-env.sh

第一台机器执行以下命令

cd /kkb/install/hadoop-3.1.4/etc/hadoop/
vim hadoop-env.sh
export JAVA_HOME=/kkb/install/jdk1.8.0_141
修改core-site.xml

第一台机器执行以下命令

vim core-site.xml
<configuration>
    <property>
        <name>fs.defaultFS</name>
        <value>hdfs://node01:8020</value>
    </property>
    <property>
        <name>hadoop.tmp.dir</name>
        <value>/kkb/install/hadoop-3.1.4/hadoopDatas/tempDatas</value>
    </property>
    <!--  缓冲区大小,实际工作中根据服务器性能动态调整;默认值4096 -->
    <property>
        <name>io.file.buffer.size</name>
        <value>4096</value>
    </property>
    <!--  开启hdfs的垃圾桶机制,删除掉的数据可以从垃圾桶中回收,单位分钟;默认值0 -->
    <property>
        <name>fs.trash.interval</name>
        <value>10080</value>
    </property>
</configuration>
修改hdfs-site.xml

第一台机器执行以下命令

vim hdfs-site.xml
<configuration>
    <!-- NameNode存储元数据信息的路径,实际工作中,一般先确定磁盘的挂载目录,然后多个目录用,进行分割   --> 
    <!--   集群动态上下线 
    <property>
        <name>dfs.hosts</name>
        <value>/kkb/install/hadoop-3.1.4/etc/hadoop/accept_host</value>
    </property>
    <property>
        <name>dfs.hosts.exclude</name>
        <value>/kkb/install/hadoop-3.1.4/etc/hadoop/deny_host</value>
    </property>
     -->
     <property>
            <name>dfs.namenode.secondary.http-address</name>
            <value>node01:9868</value>
    </property>
    <property>
        <name>dfs.namenode.http-address</name>
        <value>node01:9870</value>
    </property>
    <!-- namenode保存fsimage的路径 -->
    <property>
        <name>dfs.namenode.name.dir</name>
        <value>file:///kkb/install/hadoop-3.1.4/hadoopDatas/namenodeDatas</value>
    </property>
    <!--  定义dataNode数据存储的节点位置,实际工作中,一般先确定磁盘的挂载目录,然后多个目录用,进行分割  -->
    <property>
        <name>dfs.datanode.data.dir</name>
        <value>file:///kkb/install/hadoop-3.1.4/hadoopDatas/datanodeDatas</value>
    </property>
    <!-- namenode保存editslog的目录 -->
    <property>
        <name>dfs.namenode.edits.dir</name>
        <value>file:///kkb/install/hadoop-3.1.4/hadoopDatas/dfs/nn/edits</value>
    </property>
    <!-- secondarynamenode保存待合并的fsimage -->
    <property>
        <name>dfs.namenode.checkpoint.dir</name>
        <value>file:///kkb/install/hadoop-3.1.4/hadoopDatas/dfs/snn/name</value>
    </property>
    <!-- secondarynamenode保存待合并的editslog -->
    <property>
        <name>dfs.namenode.checkpoint.edits.dir</name>
        <value>file:///kkb/install/hadoop-3.1.4/hadoopDatas/dfs/nn/snn/edits</value>
    </property>
    <property>
        <name>dfs.replication</name>
        <value>3</value>
    </property>
    <property>
        <name>dfs.permissions.enabled</name>
        <value>false</value>
    </property>
    <property>
        <name>dfs.blocksize</name>
        <value>134217728</value>
    </property>
</configuration>
修改mapred-site.xml

第一台机器执行以下命令

vim mapred-site.xml
<configuration>
    <property>
        <name>mapreduce.framework.name</name>
        <value>yarn</value>
    </property>
    <property>
        <name>mapreduce.job.ubertask.enable</name>
        <value>true</value>
    </property>
    <property>
        <name>mapreduce.jobhistory.address</name>
        <value>node01:10020</value>
    </property>
    <property>
        <name>mapreduce.jobhistory.webapp.address</name>
        <value>node01:19888</value>
    </property>
        <property>
        <name>yarn.app.mapreduce.am.env</name>
        <value>HADOOP_MAPRED_HOME=${HADOOP_HOME}</value>
    </property>
    <property>
        <name>mapreduce.map.env</name>
        <value>HADOOP_MAPRED_HOME=${HADOOP_HOME}</value>
    </property>
    <property>
        <name>mapreduce.reduce.env</name>
        <value>HADOOP_MAPRED_HOME=${HADOOP_HOME}</value>
    </property>
</configuration>
修改yarn-site.xml

第一台机器执行以下命令

vim yarn-site.xml
<configuration>
    <property>
       <name>yarn.resourcemanager.hostname</name>
        <value>node01</value>
    </property>
    <property>
        <name>yarn.nodemanager.aux-services</name>
        <value>mapreduce_shuffle</value>
    </property>
    <!-- 如果vmem、pmem资源不够,会报错,此处将资源监察置为false -->
    <property>
        <name>yarn.nodemanager.vmem-check-enabled</name>
        <value>false</value>
    </property>
    <property>
        <name>yarn.nodemanager.pmem-check-enabled</name>
        <value>false</value>
    </property>
</configuration>
修改workers文件

第一台机器执行以下命令

vim workers

原内容替换为

node01
node02
node03
第四步:创建文件存放目录

第一台机器执行以下命令

node01机器上面创建以下目录

mkdir -p /kkb/install/hadoop-3.1.4/hadoopDatas/tempDatas
mkdir -p /kkb/install/hadoop-3.1.4/hadoopDatas/namenodeDatas
mkdir -p /kkb/install/hadoop-3.1.4/hadoopDatas/datanodeDatas 
mkdir -p /kkb/install/hadoop-3.1.4/hadoopDatas/dfs/nn/edits
mkdir -p /kkb/install/hadoop-3.1.4/hadoopDatas/dfs/snn/name
mkdir -p /kkb/install/hadoop-3.1.4/hadoopDatas/dfs/nn/snn/edits
第五步:安装包的分发scp与rsync

在linux当中,用于向远程服务器拷贝文件或者文件夹可以使用scp或者rsync,这两个命令功能类似都是向远程服务器进行拷贝,只不过scp是全量拷贝,rsync可以做到增量拷贝,rsync的效率比scp更高一些

1. 通过scp直接拷贝

scp(secure copy)安全拷贝

可以通过scp进行不同服务器之间的文件或者文件夹的复制

使用语法

scp -r sourceFile  username@host:destpath

用法示例

scp -r hadoop-lzo-0.4.20.jar hadoop@node01:/kkb/

node01执行以下命令进行拷贝

cd /kkb/install/
scp -r hadoop-3.1.4/ node02:$PWD
scp -r hadoop-3.1.4/ node03:$PWD
2. 通过rsync来实现增量拷贝

rsync 远程同步工具

rsync主要用于备份和镜像。具有速度快、避免复制相同内容和支持符号链接的优点。

rsync和scp区别:用rsync做文件的复制要比scp的速度快,rsync只对差异文件做更新。scp是把所有文件都复制过去。

三台机器执行以下命令安装rsync工具

sudo yum -y install rsync

(1) 基本语法

node01执行以下命令同步zk安装包

rsync -av /kkb/soft/apache-zookeeper-3.6.2-bin.tar.gz node02:/kkb/soft/

命令 选项参数 要拷贝的文件路径/名称 目的用户@主机:目的路径/名称

选项参数说明

选项 功能
-a 归档拷贝
-v 显示复制过程

(2)案例实操

(3)把node01机器上的/kkb/soft目录同步到node02服务器的hadooop用户下的/kkb/目录

rsync -av /kkb/soft node02:/kkb/soft
3. 通过rsync来封装分发脚本

我们可以通过rsync这个命令工具来实现脚本的分发,可以增量的将文件分发到我们所有其他的机器上面去

(1)需求:循环复制文件到所有节点的相同目录下

(2)需求分析:

(a)rsync命令原始拷贝:

rsync -av /kkb/soft hadoop@node02:/kkb/soft

(b)期望脚本使用方式:

xsync要同步的文件名称

(c)说明:在/home/hadoop/bin这个目录下存放的脚本,hadoop用户可以在系统任何地方直接执行。

(3)脚本实现

(a)在/home/hadoop目录下创建bin目录,并在bin目录下xsync创建文件,文件内容如下:

[hadoop@node01 ~]$ cd ~
[hadoop@node01 ~]$ mkdir bin
[hadoop@node01 bin]$ cd /home/hadoop/bin
[hadoop@node01 ~]$ touch xsync
[hadoop@node01 ~]$ vim xsync

在该文件中编写如下代码

#!/bin/bash
#1 获取输入参数个数,如果没有参数,直接退出
pcount=$#
if ((pcount==0)); then
echo no args;
exit;
fi

#2 获取文件名称
p1=$1
fname=<code>basename $p1

echo $fname

#3 获取上级目录到绝对路径
pdir=cd -P $(dirname $p1); pwd
echo $pdir

#4 获取当前用户名称
user=whoami

#5 循环
for((host=1; host<4; host++)); do
       echo ------------------- node0$host --------------
       rsync -av $pdir/$fname $user@node0$host:$pdir
done

(b)修改脚本 xsync 具有执行权限

[hadoop@node01 bin]$ cd ~/bin/
[hadoop@node01 bin]$ chmod 777 xsync

(c)调用脚本形式:xsync 文件名称

[hadoop@node01 bin]$ xsync /home/hadoop/bin/

注意:如果将xsync放到/home/hadoop/bin目录下仍然不能实现全局使用,可以将xsync移动到/usr/local/bin目录下

第六步:配置hadoop的环境变量

三台机器都要进行配置hadoop的环境变量

三台机器执行以下命令

sudo vim /etc/profile
export HADOOP_HOME=/kkb/install/hadoop-3.1.4
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin

配置完成之后生效

source /etc/profile
第七步:格式化集群
  • 要启动 Hadoop 集群,需要启动 HDFS 和 YARN 两个集群。

  • 注意:首次启动HDFS时,必须对其进行格式化操作。本质上是一些清理和准备工作,因为此时的 HDFS 在物理上还是不存在的。格式化操作只有在首次启动的时候需要,以后再也不需要了

  • node01执行一遍即可

hdfs namenode -format
  • 或者
hadoop namenode –format
  • 下图高亮表示格式化成功;

image-20201019211525368

第八步:集群启动
  • 启动集群有两种方式:
    • ①脚本一键启动;
    • ②单个进程逐个启动
1. 启动HDFS、YARN、Historyserver
  • 如果配置了 etc/hadoop/workers 和 ssh 免密登录,则可以使用程序脚本启动所有Hadoop 两个集群的相关进程,在主节点所设定的机器上执行。

  • 启动集群

  • 主节点node01节点上执行以下命令

start-dfs.sh
start-yarn.sh
# 已过时mr-jobhistory-daemon.sh start historyserver
mapred --daemon start historyserver
  • 停止集群(主节点node01节点上执行):
stop-dfs.sh
stop-yarn.sh 
# 已过时 mr-jobhistory-daemon.sh stop historyserver
mapred --daemon stop historyserver
2. 单个进程逐个启动
# 在主节点上使用以下命令启动 HDFS NameNode: 
# 已过时 hadoop-daemon.sh start namenode 
hdfs --daemon start namenode

# 在主节点上使用以下命令启动 HDFS SecondaryNamenode: 
# 已过时 hadoop-daemon.sh start secondarynamenode 
hdfs --daemon start secondarynamenode

# 在每个从节点上使用以下命令启动 HDFS DataNode: 
# 已过时 hadoop-daemon.sh start datanode
hdfs --daemon start datanode

# 在主节点上使用以下命令启动 YARN ResourceManager: 
# 已过时 yarn-daemon.sh start resourcemanager 
yarn --daemon start resourcemanager

# 在每个从节点上使用以下命令启动 YARN nodemanager: 
# 已过时 yarn-daemon.sh start nodemanager 
yarn --daemon start nodemanager

以上脚本位于$HADOOP_HOME/sbin/目录下。如果想要停止某个节点上某个角色,只需要把命令中的start 改为stop 即可。
3. 一键启动hadoop集群的脚本
  • 为了便于一键启动hadoop集群,我们可以编写shell脚本

  • 在node01服务器的/home/hadoop/bin目录下创建脚本

[hadoop@node01 bin]$ cd /home/hadoop/bin/
[hadoop@node01 bin]$ vim hadoop.sh
  • 内容如下
#!/bin/bash
case $1 in
"start" ){
 source /etc/profile;
 /kkb/install/hadoop-3.1.4/sbin/start-dfs.sh
 /kkb/install/hadoop-3.1.4/sbin/start-yarn.sh
 #/kkb/install/hadoop-3.1.4/sbin/mr-jobhistory-daemon.sh start historyserver
 /kkb/install/hadoop-3.1.4/bin/mapred --daemon start historyserver
};;
"stop"){

 /kkb/install/hadoop-3.1.4/sbin/stop-dfs.sh
 /kkb/install/hadoop-3.1.4/sbin/stop-yarn.sh
 #/kkb/install/hadoop-3.1.4/sbin/mr-jobhistory-daemon.sh stop  historyserver
 /kkb/install/hadoop-3.1.4/bin/mapred --daemon stop historyserver
};;
esac
  • 修改脚本权限
[hadoop@node01 bin]$ chmod 777 hadoop.sh
[hadoop@node01 bin]$ ./hadoop.sh start  # 启动hadoop集群
[hadoop@node01 bin]$ ./hadoop.sh stop   # 停止hadoop集群
第九步:验证集群是否搭建成功
1. 访问web ui界面
  • hdfs集群访问地址

http://192.168.51.100:9870/

  • yarn集群访问地址

http://192.168.51.100:8088

  • jobhistory访问地址:

http://192.168.51.100:19888

  • 若将linux的/etc/hosts文件的如下内容,添加到本机的hosts文件中(==ip地址根据自己的实际情况进行修改==)
192.168.51.100 node01.kaikeba.com  node01
192.168.51.110 node02.kaikeba.com  node02
192.168.51.120 node03.kaikeba.com  node03
  • windows的hosts文件路径是C:\Windows\System32\drivers\etc\hosts

  • mac的hosts文件是/etc/hosts

  • 那么,上边的web ui界面访问地址可以分别写程

    • hdfs集群访问地址

    http://node01:9870/

    • yarn集群访问地址

    http://node01:8088

    • jobhistory访问地址:

    http://node01:19888

2. 所有机器查看进程脚本
  • 我们也可以通过jps在每台机器上面查看进程名称,为了方便我们以后查看进程,我们可以通过脚本一键查看所有机器的进程

  • 在node01服务器的/home/hadoop/bin目录下创建文件xcall

[hadoop@node01 bin]$ cd ~/bin/
[hadoop@node01 bin]$ vim xcall
  • 添加以下内容
#!/bin/bash

params=$@
for (( i=1 ; i <= 3 ; i = $i + 1 )) ; do
    echo ============= node0$i $params =============
    ssh node0$i "source /etc/profile;$params"
done
  • 然后一键查看进程并分发该脚本
chmod 777  /home/hadoop/bin/xcall
xsync /home/hadoop/bin/
  • 各节点应该启动的hadoop进程如下图
xcall jps

image-20200513122314381

3. 运行一个mr例子
  • 任一节点运行pi例子
[hadoop@node01 ~]$ hadoop jar /kkb/install/hadoop-3.1.4/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.4.jar pi 5 5
  • 最后计算出pi的近似值

image-20200522154422389

提醒:如果要关闭电脑时,清一定要按照以下顺序操作,否则集群可能会出问题

  • 关闭hadoop集群

  • 关闭虚拟机

  • 关闭电脑

Views: 140

工作流调度 Azkaban 工作流-操作HDFS和执行MR任务

操作HDFS

  • node01节点用root用户启动hadoop集群
[hadoop@node01 bin]$ su root
密码:
[root@node01 bin]#
[root@node01 bin]# cd
[root@node01 ~]# start-all.sh
  • 编写flow文件operateHdfs.flow,内容如下
nodes:
  - name: jobA
    type: command
    config:
      command: echo "start execute"
      command.1: /export/servers/hadoop-2.7.5/bin/hdfs dfs -mkdir /azkaban
      command.2: /export/servers/hadoop-2.7.5/bin/hdfs dfs -put /export/servers/hadoop-2.7.5/NOTICE.txt  /azkaban
  • 生成zip项目文件、web ui上传zip、执行flow
  • 查看HDFS结果

image-20210322230044128

MR任务

  • 记得启动hadoop的historyserver,否则执行mr项目时,job的日志会报如下类似错误日志
22-03-2021 23:17:23 CST jobMR INFO - 21/03/22 23:17:23 INFO impl.YarnClientImpl: Submitted application application_1616423563192_0001
22-03-2021 23:17:39 CST jobMR INFO - 21/03/22 23:17:39 INFO mapred.ClientServiceDelegate: Application state is completed. FinalApplicationStatus=SUCCEEDED. Redirecting to job history server
22-03-2021 23:17:41 CST jobMR INFO - 21/03/22 23:17:41 INFO ipc.Client: Retrying connect to server: node01/192.168.77.30:10020. Already tried 0 time(s); retry policy is RetryUpToMaximumCountWithFixedSleep(maxRetries=10, sleepTime=1000 MILLISECONDS)
22-03-2021 23:17:42 CST jobMR INFO - 21/03/22 23:17:42 INFO ipc.Client: Retrying connect to server: node01/192.168.77.30:10020. Already tried 1 time(s); retry policy is RetryUpToMaximumCountWithFixedSleep(maxRetries=10, sleepTime=1000 MILLISECONDS)
22-03-2021 23:17:44 CST jobMR INFO - 21/03/22 23:17:44 INFO ipc.Client: Retrying connect to server: node01/192.168.77.30:10020. Already tried 2 time(s); retry policy is RetryUpToMaximumCountWithFixedSleep(maxRetries=10, sleepTime=1000 MILLISECONDS)

192.168.77.30:10020 应该是hadoop集群的historyserver服务

  • 编写flow文件mr.flow,内容如下
nodes:
  - name: jobMR
    type: command
    config:
      command: /export/servers/hadoop-2.7.5/bin/hadoop jar /export/servers/hadoop-2.7.5/share/hadoop/mapreduce/hadoop-mapreduce-examples-2.7.5.jar pi 3 3
  • 为了避免执行mr过程中,对hdfs操作的一些权限问题
[hadoop@node01 azkaban-exec-server-4.0.0]$ su root
[root@node01 azkaban-exec-server-4.0.0]# hdfs dfs -chmod -R 777 /tmp/
  • 生成zip项目文件、web ui上传zip、执行flow
  • 查看结果

image-20210322232740822

  • 可以去yarn界面看看此job的执行情况

image-20210322233043321

Views: 35