大数据日志分析项目需求

目标:电商网站+电商网站后台管理系统+大数据分析+数据可视化思路:

按照数据的采集,数据的存储,数据分析处理,数据可视化

逻辑图:

项目要求   

  • 题材不限,但需先经过老师认可
  • 各组组长记录组员项目进度,每周提交给老师
  • 数据源至少来自两处,可以是日志、关系型数据库、以及爬虫的数据
  • 日志允许通过代码生成(或者ab压测工具来生成)
  • 前后台管理页面不能和老师的一样   
  • 讲述清楚nginx、tomcat、flume、sqoop、hadoop各自作用   
  • 重点突出数据分析部分,mapreduce、hive、storm至少使用2种,完成6个不同的分析,hbase、kafka选择使用
  • 日志收集使用flume, 数据导入导出使用sqoop
  • 数据可视化可以使用echarts、或其他类型前端框架、另外superset,datav等也允许使用
  • 能够熟练使用各类脚本及命令
  • 最后一周(17周结束前)完成所有项目演讲,每人1-2分钟时间
  • 大数据采集、存储、分析处理、可视化的过程应该是连续的
  • 允许使用任务调度框架编排执行定时任务
  • 展示的时候所有模块都需要完全部署到虚拟机,不允许本地运行项目

七、开源的爬虫项目   

网站:http://www.geccocrawler.com/tag/sysc/    GitHub:https://github.com/xtuhcy/gecco

Views: 142

分布式调度系统-Apache DolphinScheduler(集群部署)

一、课前准备

  • Hadoop-3.1.2集群
  • MySQL-5.7
  • zookeeper-3.6.2集群
  • Hive-3.1.2
  • spark-2.3.3

二、课堂目标

  • 熟练使用DolphinScheduler调度系统

三、知识要点

1、DolphinScheduler简介

2、DolphinScheduler的特性

2.1 高可靠性
  • 去中心化多Master和Worker,自身支持HA功能,采用任务队列来避免过载,不会造成机器卡死

2.2.简单易用

  • DAG监控界面,所有流程定义都是可视化,通过拖拽任务制定DAG
  • 通过API方式与第三方系统对接,一键部署。

2.3.丰富的使用场景

  • 支持暂停、恢复操作,支持多租户,更好的应对大数据的使用场景,支持更多的任务类型,如hive,mr,spark,python

2.4.高扩展性

  • 支持自定义任务类型,调度器使用分布式调度,调度能力随集群线性增长,Master和Worker支持动态上下线

3、DolphinScheduler的架构介绍

3.1 系统架构设计

https://dolphinscheduler.apache.org/zh-cn/blog/architecture-design.html

3.2 DS-1.3改进及新特性

  • 数据库减压,减少极端情况下的可能造成的调度延时

  • Worker去DB、职责更单一

  • Master和Worker直接通信,降低 延时

  • Master多种策略分发任务(有三种方式选择Worker节点:随机、循环、CPU和 内存的线性加权负载平衡 )

  • 资源中心支持多目录

  • 任务类型新增Datax、 Sqoop、条件分支

  • DAG一键格式化

  • 批量导出和导入工作流

  • 工作流复制

3.3 DS-1.3系统架构图

image-20210326163738309

4、前置环境准备

说明:

安装DolphinScheduler(以下简称ds)前,建议跟文档下边说明的环境保持统一

否则安装及使用ds的过程中,可能会出现位置错误需要自己解决

4.1 安装JDK-1.8
  • 此文档以3节点在/kkb/install都安装了jdk1.8.0_141为例进行演示
  • 安装包jdk-8u141-linux-x64.tar.gz
4.2 安装Hadoop-3.1.4集群
4.3 安装Zookeeper-3.6.2集群
4.4 安装Mysql-5.7
4.5 安装hive-3.1.2
  • node02、node03节点安装了hive-3.1.2
  • 若没有如此安装,参考资料《Hive安装部署》进行安装
4.6 安装Spark-2.3.3
  • dolphinscheduler中会演示调度spark程序,先演示基本的用法

  • 此文档以3节点在/kkb/install都安装了spark-2.3.3为例进行演示

  • 若没有如此安装,参考资料《spark安装部署.md》进行安装

5、安装部署

官方安装指导:https://dolphinscheduler.apache.org/zh-cn/docs/1.3.4/user_doc/quick-start.html

5.1节点规划
机器 服务 端口 group
node01 master、api、logger 8787(master)、8888(api)
node02 master、alert、worker、logger 8787(master)、7878(worker) hadoop
node03 worker、logger 7878(worker) hadoop

hadoop 组配置后master分发任务才能根据cpu和内存的负载选择具体哪个worker执行任务

5.2 准备工作
1、创建目录
  • 确保三个节点都有目录/kkb/soft/kkb/install,且所属用户及用户组如下
[hadoop@node01 ~]$ ll /kkb/ 
总用量 0
drwxr-xr-x. 2 hadoop hadoop 6 4月  13 14:21 install
drwxr-xr-x. 2 hadoop hadoop 6 4月  13 14:22 soft

image-20210413142651607

  • 若没有这些目录,那么如下创建;==3个节点==都运行如下命令
sudo mkdir -p /kkb/install
sudo mkdir -p /kkb/soft
sudo chown -R hadoop:hadoop /kkb/
ll /kkb/
  • 确保目录所属变成如下样子

image-20210413142651607

2、确保已安装zookeeper集群
  • 启动zookeeper集群
    • 确保三节点上已经安装了zk;
    • zk版本要求:ZooKeeper (3.4.6+)
    • 若没有安装,请先安装再往下继续
3、启动HDFS
  • 因为ds的资源存储在HDFS上

  • 所以,node01上运行start-dfs.sh启动hdfs

5.3 开始安装

第一步:安装包下载,在node01上执行

[hadoop@node01 ~]$ cd /kkb/soft/
[hadoop@node01 soft]$ wget https://mirrors.tuna.tsinghua.edu.cn/apache/dolphinscheduler/1.3.5/apache-dolphinscheduler-incubating-1.3.5-dolphinscheduler-bin.tar.gz

第二步:解压压缩包

[hadoop@node01 soft]$ tar -xzvf apache-dolphinscheduler-incubating-1.3.5-dolphinscheduler-bin.tar.gz -C /kkb/install/

第三步:重命名

[hadoop@node01 soft]$ cd /kkb/install/
[hadoop@node01 install]$ mv apache-dolphinscheduler-incubating-1.3.5-dolphinscheduler-bin/ dolphinscheduler-1.3.5
[hadoop@node01 install]$ ll
总用量 0
drwxrwxr-x. 9 hadoop hadoop 156 4月  13 14:35 dolphinscheduler-1.3.5

第四步:建库建表

此处以node03安装了mysql为例

node01上

[hadoop@node01 install]$ scp /kkb/install/dolphinscheduler-1.3.5/sql/dolphinscheduler_mysql.sql node03:/kkb/soft/

node03上,进入MySQL命令行执行

mysql -uroot -p

set global validate_password_policy=LOW;
set global validate_password_length=6;
CREATE DATABASE IF NOT EXISTS dolphinscheduler DEFAULT CHARSET utf8 DEFAULT COLLATE utf8_general_ci;
GRANT ALL PRIVILEGES ON dolphinscheduler.* TO 'root'@'%' IDENTIFIED BY '123456';
GRANT ALL PRIVILEGES ON dolphinscheduler.* TO 'root'@'localhost' IDENTIFIED BY '123456';
flush privileges;
use dolphinscheduler;
source /kkb/soft/dolphinscheduler_mysql.sql;
mysql> show tables;
+--------------------------------+
| Tables_in_dolphinscheduler     |
+--------------------------------+
| QRTZ_BLOB_TRIGGERS             |
| QRTZ_CALENDARS                 |
| QRTZ_CRON_TRIGGERS             |
| QRTZ_FIRED_TRIGGERS            |
| QRTZ_JOB_DETAILS               |
| QRTZ_LOCKS                     |
| QRTZ_PAUSED_TRIGGER_GRPS       |
| QRTZ_SCHEDULER_STATE           |
| QRTZ_SIMPLE_TRIGGERS           |
| QRTZ_SIMPROP_TRIGGERS          |
| QRTZ_TRIGGERS                  |
| t_ds_access_token              |
| t_ds_alert                     |
| t_ds_alertgroup                |
| t_ds_command                   |
| t_ds_datasource                |
| t_ds_error_command             |
| t_ds_process_definition        |
| t_ds_process_instance          |
| t_ds_project                   |
| t_ds_queue                     |
| t_ds_relation_datasource_user  |
| t_ds_relation_process_instance |
| t_ds_relation_project_user     |
| t_ds_relation_resources_user   |
| t_ds_relation_udfs_user        |
| t_ds_relation_user_alertgroup  |
| t_ds_resources                 |
| t_ds_schedules                 |
| t_ds_session                   |
| t_ds_task_instance             |
| t_ds_tenant                    |
| t_ds_udfs                      |
| t_ds_user                      |
| t_ds_version                   |
+--------------------------------+
35 rows in set (0.00 sec)

第五步:修改配置文件

[hadoop@node01 ~]$ cd /kkb/install/dolphinscheduler-1.3.5/conf/

1、alert.properties #配置告警邮箱相关信息

  • 此处已126邮箱为例
  • 登录自己的126邮箱

image-20210415113539557

image-20210415113712981

image-20210415113809874

image-20210415113906134

image-20210415114129004

  • 开始配置文件
[hadoop@node01 conf]$ vim alert.properties
#alert type is EMAIL/SMS
alert.type=EMAIL

# mail server configuration
mail.protocol=SMTP
mail.server.host=smtp.126.com
mail.server.port=25
mail.sender=youhy964@126.com
mail.user=youhy964@126.com
mail.passwd=WBNPUGCNZMQQYBUT
# TLS
mail.smtp.starttls.enable=true
# SSL
mail.smtp.ssl.enable=false
mail.smtp.ssl.trust=smtp.126.com

2、application-api.properties

  • 修改web ui端口号
[hadoop@node01 conf]$ vim application-api.properties 
# server port
server.port=8888

image-20210413153616572

3、common.properties

# 修改如下3个属性的值
[hadoop@node01 conf]$ vim common.properties
resource.storage.type=HDFS
fs.defaultFS=hdfs://node01:8020
yarn.application.status.address=http://node01:8088/ws/v1/cluster/apps/%s

4、datasource.properties

假设mysql安装在node03节点

# 修改如下几个属性的值
[hadoop@node01 conf]$ vim datasource.properties

spring.datasource.driver-class-name=com.mysql.jdbc.Driver
spring.datasource.url=jdbc:mysql://node03:3306/dolphinscheduler?useUnicode=true&characterEncoding=UTF-8&allowMultiQueries=true
spring.datasource.username=root
spring.datasource.password=123456

5、master.properties

[hadoop@node01 conf]$ vim master.properties

master.listen.port=8787 

6、worker.properties

[hadoop@node01 conf]$ vim worker.properties 
worker.listen.port=7878
worker.groups=hadoop

image-20210413155102581

7、zookeeper.properties

[hadoop@node01 conf]$ vim zookeeper.properties

zookeeper.quorum=node01:2181,node02:2181,node03:2181

8、env/dolphinscheduler_env.sh

# 修改如下属性,根据自己的实际情况,配置属性值
[hadoop@node01 conf]$ vim env/dolphinscheduler_env.sh

export HADOOP_HOME=/kkb/install/hadoop-3.1.4
export HADOOP_CONF_DIR=/kkb/install/hadoop-3.1.4/etc/hadoop
export SPARK_HOME1=/kkb/install/spark-2.3.3-bin-hadoop2.7
export JAVA_HOME=/kkb/install/jdk1.8.0_141
export HIVE_HOME=/kkb/install/apache-hive-3.1.2

image-20210414114035151

第六步:将hdfs-site.xml、core-site.xml 拷贝至ds的 conf 目录下,同时 把mysql-connector-java-5.1.48-bin.jar驱动包上传到ds的lib目录下

[hadoop@node01 conf]$ cp /kkb/install/hadoop-3.1.4/etc/hadoop/hdfs-site.xml /kkb/install/dolphinscheduler-1.3.5/conf
[hadoop@node01 conf]$ cp /kkb/install/hadoop-3.1.4/etc/hadoop/core-site.xml /kkb/install/dolphinscheduler-1.3.5/conf
# 将mysql-connector-java-5.1.38.jar上传到node01的/kkb/soft目录
[hadoop@node01 soft]$ cd /kkb/soft/
[hadoop@node01 soft]$ cp mysql-connector-java-5.1.38.jar /kkb/install/dolphinscheduler-1.3.5/lib/

第七步:到ds的bin目录下(1.3.5版本,可以跳过此步)

dos2unix dolphinscheduler-daemon.sh   #dos2unix:将DOS格式的文本文件转换成UNIX格式的(DOS/MAC to UNIX text file format converter)
chmod +x dolphinscheduler-daemon.sh

第八步:scp到node02、node03

[hadoop@node01 bin]$ cd /kkb/install/
[hadoop@node01 install]$ scp -r dolphinscheduler-1.3.5/ node02:$PWD
[hadoop@node01 install]$ scp -r dolphinscheduler-1.3.5/ node03:$PWD

部署过程中的问题

建表时出现 Index column size too large. The maximum column size is 767 bytes.(此问题在MySQL-5.6及以前版本会出现)
将建表文件中 CHARSET=utf8mb4 改为 CHARSET=utf8
5.4 调优配置

生产环境上建议,worker.properties里设置的cpu和内存调一下就可以保护worker不至于挂掉,一般别超过cpu核数的2倍,内存留上1~2G(当然如果比较豪,可以预留更多资源),线程数别超过cpu核数的2.5倍。

例如:8c16G机器

worker.exec.threads=20
worker.max.cpuload.avg=16
worker.reserved.memory=1

同理对于master调优配置 8c16G机器
master.properties文件

master.max.cpuload.avg=16
master.reserved.memory=1
5.5 启动

在node01 启动 master、api、logger

[hadoop@node01 ~]$ cd /kkb/install/dolphinscheduler-1.3.5/bin/
[hadoop@node01 bin]$ ./dolphinscheduler-daemon.sh start master-server
[hadoop@node01 bin]$ ./dolphinscheduler-daemon.sh start api-server
[hadoop@node01 bin]$ ./dolphinscheduler-daemon.sh start logger-server

image-20210414141821598

在node02 启动 master、alert、worker、logger

[hadoop@node02 ~]$ cd /kkb/install/dolphinscheduler-1.3.5/bin/
[hadoop@node02 bin]$ ./dolphinscheduler-daemon.sh start master-server
[hadoop@node02 bin]$ ./dolphinscheduler-daemon.sh start alert-server
[hadoop@node02 bin]$ ./dolphinscheduler-daemon.sh start worker-server
[hadoop@node02 bin]$ ./dolphinscheduler-daemon.sh start logger-server

image-20210414142819920

在node03 启动 worker、logger

[hadoop@node03 ~]$ cd /kkb/install/dolphinscheduler-1.3.5/bin/
[hadoop@node03 bin]$ ./dolphinscheduler-daemon.sh start worker-server
[hadoop@node03 bin]$ ./dolphinscheduler-daemon.sh start logger-server

image-20210414143002703

目前3节点已经启动了hadoop集群、zookeeper集群、及ds相关进程;

启动成功之后,会出现如下进程

[hadoop@node01 bin]$ xcall jps
============= node01 jps =============
3680 ApiApplicationServer
2465 DataNode
3761 LoggerServer
3410 JobHistoryServer
2036 QuorumPeerMain
2294 NameNode
3607 MasterServer
2666 SecondaryNameNode
2892 ResourceManager
3037 NodeManager
4351 Jps
============= node02 jps =============
2320 NodeManager
2880 LoggerServer
2179 DataNode
3446 Jps
3287 AlertServer
2616 MasterServer
2798 WorkerServer
2031 QuorumPeerMain
============= node03 jps =============
2160 DataNode
2289 NodeManager
3009 LoggerServer
1996 QuorumPeerMain
2927 WorkerServer
3103 Jps
  • 如何关闭ds集群?
    • 关闭个节点的各角色,就是将上边启动命令中的start换成stop即可
[hadoop@node01 ~]$ cd /kkb/install/dolphinscheduler-1.3.5/bin/
[hadoop@node01 bin]$ ./dolphinscheduler-daemon.sh stop master-server
[hadoop@node01 bin]$ ./dolphinscheduler-daemon.sh stop api-server
[hadoop@node01 bin]$ ./dolphinscheduler-daemon.sh stop logger-server

[hadoop@node02 ~]$ cd /kkb/install/dolphinscheduler-1.3.5/bin/
[hadoop@node02 bin]$ ./dolphinscheduler-daemon.sh stop master-server
[hadoop@node02 bin]$ ./dolphinscheduler-daemon.sh stop alert-server
[hadoop@node02 bin]$ ./dolphinscheduler-daemon.sh stop worker-server
[hadoop@node02 bin]$ ./dolphinscheduler-daemon.sh stop logger-server

[hadoop@node03 ~]$ cd /kkb/install/dolphinscheduler-1.3.5/bin/
[hadoop@node03 bin]$ ./dolphinscheduler-daemon.sh stop worker-server
[hadoop@node03 bin]$ ./dolphinscheduler-daemon.sh stop logger-server

6、快速上手

6.1 web页面

image-20210414152427370

  • 登录后,进入如下界面

image-20210414152550281

6.2 首页
  • 点击上图①,进入“首页”,能够看到任务状态、流程状态

image-20210414152702608

  • 任务状态:
    • 某个任务的各种状态;
    • 如上图:提交成功、正在运行、准备暂停、暂停......
    • 通过各种状态,可以看到集群的繁忙程度,尤其是“等待线程”的数量
  • 流程状态:
    • 流程由一个或多个任务组成
6.3 项目管理

image-20210415144646143

  • 点击导航栏“项目管理”
  • 用来创建项目及列出已有项目
6.4 资源管理

image-20210415144719980

  • 可以创建文件夹
  • 然后在文件夹中创建脚本
  • 以后的项目里的流程中的任务可以用到这些脚本
  • 函数管理:主要是创建hive的UDF函数

image-20210415144912359

6.5 数据源中心

image-20210415145058616

  • 可以贴sql操作
6.6 监控中心
  • 可以查看master、worker、zookeeper、db等统计信息
  • master
    • 集群负载小于10比较正常,如果大于10,就比较繁忙了,意味着机器的性能比较弱了

image-20210415145528740

  • worker

image-20210415151542512

  • zookeeper

image-20210415151757429

  • DB

image-20210415151820549

6.7 安全中心

image-20210415151932577

  • 管理员常用的配置页面

7、演示

7.1 安全中心

####### 1、令牌管理

  • 安全中心 - 令牌管理
  • 令牌管理:
    • 在工作中一般用不到
    • java程序跟ds调度器进行集成,用rest api进行交互的时候,会用到令牌

image-20210415152538936

image-20210415152733911

  • 把token给其他项目组,其他项目组进行源代码的二次开发的时候,进行插件集成的时候,会用到token值
  • 工作中正常使用ds调度时,一般用不到
2、队列管理
  • 指的是yarn调度器中的队列或cdh的动态资源池
  • 提交应用到yarn集群时,可以指定将应用提交到指定的队列中,此队列占据集群的一定量的内存、cpu资源,共此应用使用;具体的可以回顾yarn中的调度器相关的知识

image-20210415154518353

  • 假设yarn的root队列下还有个队列叫dw
  • 那么在ds的ui界面创建队列

image-20210415154826352

  • 效果如下

image-20210415154850916

3、Worker分组管理
  • 默认只有default一个分组

image-20210415155200106

  • 如果将来ds集群有一些机器是高配,一些是低配的,那么可以进行分组,比如提交时,指定提交到高配的机器上执行
4、告警组管理
  • 默认如下

image-20210415155408815

  • 创建告警组

image-20210415155542189

  • 管理告警组关联的管理用户

image-20210415155748320

  • 随后创建好一个ds用户后,再在上图中关联“管理用户” todo
5、租户管理
  • 如果要创建ds的用户,会用到租户
  • 所以,此处,我们先创建租户
  • 租户:
    • ds调度执行时,会通过su - hadoop类似的用法,切换到linux的某用户,进行执行任务

image-20210415162157184

  • 效果如下

image-20210415162245361

6、用户管理

image-20210415162725052

  • 效果如下

image-20210415162822186

  • 接下来去“告警组管理”中,给刚创建的告警组“kkb warning”进行管理用户授权,如下操作
  • 告警发生后,发送给谁?此处我们发送给kkbds用户的邮箱

image-20210415163007041

7.2 项目管理
1、创建项目

image-20210415164314961

image-20210415164342212

image-20210415164406304

2、创建工作流
  • 进入项目页面

image-20210415164438803

image-20210415164609657

image-20210415164628972

image-20210415164824273

  • 拖动shell图标到右侧区域,添加一个shell类型的task,并在下图中设置相关的参数

image-20210415165019560

  • 复制一个task

image-20210415165124319

  • 给新task做参数设置

image-20210415165603515

  • 串联两个task,并保存

image-20210415165911187

  • 弹出下图

image-20210415170044076

  • 出现下图效果

image-20210415170426952

  • 流程按钮说明

image-20210415171529417

  • 点击“运行”按钮

image-20210415172118331

3、工作流实例

image-20210415172743087

  • 下图中有两个task,如果task还正在运行,可以点击右上角“刷新”按钮,刷新其状态

image-20210415172845277

image-20210415172949561

  • 效果如下

image-20210415173017674

image-20210415173619809

  • 查看日志

image-20210415173750442

  • 查看历史

image-20210415173849464

4、任务实例

image-20210415174529225

  • 看到firstflow中的两个任务实例都执行成功
  • 去邮箱确认是否收到邮件

image-20210415174655301

7.3 调度hive
1、hive环境准备

环境说明:

  • 此处以==node03安装mysql-5.7、hive-3.1.2为例==
  • ==node02安装了hive-3.12.为例==
  • 若没有安装,请参考资料《Hive安装部署.md》
  • ==启动Hiveserver2==
[hadoop@node03 ~]$ cd /kkb/install/apache-hive-3.1.2/bin
[hadoop@node03 bin]$ ./hiveserver2
  • 若启动hiveserver2时,报错如下
Exception in thread "main" java.lang.NoSuchMethodError: com.google.common.base.Preconditions.checkArgument(ZLjava/lang/String;Ljava/lang/Object;)V
  • 原因是hadoop、hive中的guava包冲突
  • 解决方案:将hive的此包删除,hadoop的guava包复制一个到hive的lib目录
[hadoop@node03 ~]$ cd /kkb/install/apache-hive-3.1.2/lib/
[hadoop@node03 lib]$ rm -rf guava-19.0.jar
[hadoop@node03 lib]$ cp /kkb/install/hadoop-3.1.4/share/hadoop/common/lib/guava-27.0-jre.jar ./
[hadoop@node03 lib]$
2、方式一:贴hive sql

1、创建hive数据源

  • 如下图操作

image-20210416141935180

  • 点击上图右下角“提交”按钮

  • 效果如下

image-20210416142800187

  • 去“项目管理”,打开前边创建的项目"kkbpro"

image-20210416142929579

image-20210416143057547

  • 进入下图,将task01、task02禁用掉
  • 以task01操作为例:

image-20210416143348069

先在hive的default中创建表,并插入数据,用于一会ds中测试hive数据源操作

create table stu(id int, name string);
insert into stu values(1, "zs");
insert into stu values(2, "ww");
查询结果
hive (default)> select * from stu;
OK
stu.id    stu.name
1 zs
2 ww

image-20210416144535396

image-20210416144605198

image-20210416144640821

image-20210416144816537

image-20210416144911579

  • 查看工作流实例

image-20210416145039900

image-20210416145208006

image-20210416145221814

  • 查看邮件

image-20210416145519318

3、方式二:调度hive脚本

1、hive脚本操作

  • 上边讲了hive数据源中,贴sql的操作
  • 接下来看看如果调用hive脚本
  • 先给ds的admin用户添加租户

image-20210416150450204

image-20210416150511036

  • 资源中心相关操作

image-20210416150613096

image-20210416150639422

image-20210416150733385

image-20210416150951832

创建脚本

image-20210416151655692

文件内容如下

#!/bin/bash

SQL="SELECT * FROM default.stu"

echo "operate with hive cli---->"

hive -e "${SQL}"

echo "operate with beeline---->"
/kkb/install/apache-hive-3.1.2/bin/beeline -u "jdbc:hive2://node03:10000/default" hive -e "${SQL}"

2、调用脚本

  • 项目管理 -》kkbpro项目

image-20210416151841289

  • 将firstflow工作流下线,并重新编辑

image-20210416151915462

image-20210416152027166

  • 让后工作流中添加shell脚本类型的task,task直行上边创建的hive脚本文件

image-20210416152331044

  • 保存工作流
  • 重新上线工作流,然后运行(这些操作之前都已经演示过,不再重复给出截图)

image-20210416152519254

  • 查看工作流实例

image-20210416152833328

  • 查看hive-shell任务的日志

image-20210416152955286

7.4 调度spark
1、spark环境准备
  • 若spark还未学习,可以先看此部分的讲解视频,不进行实操
  • 因为ds可以调度spark,所以此文档先将内容给出

环境说明:

所有的ds worker节点都安装了spark

  • 先启动spark集群
  • node03节点,启动hive的metastore服务
hive --service metastore
  • 启动spark thriftserver服务
[hadoop@node03 sbin]$ cd /kkb/install/spark-2.3.3-bin-hadoop2.7/sbin
[hadoop@node03 sbin]$ ./start-thriftserver.sh \
--hiveconf hive.server2.thrift.port=10000 \
--master yarn-client \
--driver-cores 1 \
--driver-memory 1G \
--executor-cores 1 \
--executor-memory 1G \
--num-executors 2

​ 以yarn-client的方式运行spark thriftserver

​ yarn界面

image-20210416162536120

2、方式一:直接贴sql
  • 数据源中心-创建数据源

image-20210416165625761

image-20210416165733051

  • 进入项目管理 -》 项目kkbpro -》工作流定义 -》下线firstflow工作流 -》编辑firstflow工作流 -》hive-shell 任务停用

image-20210416170041413

  • 然后创建一个新的sql任务,并配置

image-20210416170406671

  • 保存工作流

image-20210416170509205

  • 工作流重新上线,并运行

image-20210416170624387

  • 查看此工作流的工作流实例中spark-datasource任务的日志

image-20210416170858767

  • 查看通知邮件

image-20210416170941093

3、方式二:执行spark脚本
  • 类似于hive脚本操作
  • 通过spark beeline操作脚本
  • 资源中心-创建文件夹

image-20210416175522890

image-20210416175546371

image-20210416175611504

image-20210416175723034

  • 脚本内容如下
#!/bin/bash

SQL="SELECT * FROM default.stu"

echo "operate with spark beeline------------->->->"
/kkb/install/spark-2.3.3-bin-hadoop2.7/bin/beeline \
-u "jdbc:hive2://node03:10000/default" hive -e "${SQL}"
  • 效果如下

image-20210416175817624

  • 如下类似的操作,之前已经做过截图,所以部分操作截图省略

  • 进入项目管理 -》 项目kkbpro -》工作流定义 -》下线firstflow工作流 -》编辑firstflow工作流 -》spark-datasource任务停用

image-20210416180205803

  • 工作流中添加SHELL类型的任务

image-20210416180410253

  • 保存工作流
  • 重新上线firstflow工作流,并运行

image-20210416180530791

  • 查看日志及邮件

image-20210416180637367

image-20210416180738193

Views: 47

CentOS 7安装MySQL5.7 – 大数据环境

一、课前准备

  1. 准备一台CentOS 7的服务器

二、课堂主题

  1. 如何在CentOS 7当中安装mysql数据库,并开启mysql数据库的远程连接

三、课堂目标

  1. 熟练在CentOS 7中安装mysql5.7数据库

四、知识要点

1. root用户下安装mysql

  • CentOS 7中切换到root用户,安装mysql
  • 在CentOS 7中默认安装有MariaDB,这个是MySQL的分支;但还是要安装MySQL,而且安装完成之后会直接覆盖掉MariaDB

2. 安装mysql

2.1 下载并安装mysql官方的yum源

若是在学完Hadoop、ZooKeeper课程后,接着要学习Hive课程时,需要先安装mysql

安装到第三个节点node03上

  • 使用root用户,在CentOS 7服务器的/kkb/soft路径下执行以下命令
  • 切换到root用户
[hadoop@node03 ~]$ su root
  • 进入/kkb/soft目录,并安装wget软件
[root@node03 hadoop]# cd /kkb/soft/
[root@node03 soft]# yum -y install wget

出现Installed!字样,表示成功安装

  • 使用wget命令下载mysql的rpm包
[root@node03 soft]# wget -i -c http://dev.mysql.com/get/mysql57-community-release-el7-10.noarch.rpm

-i 指定输入文件

-c 表示断点续传

2.2 安装mysql

[root@node03 soft]# yum -y install mysql57-community-release-el7-10.noarch.rpm

  • 安装mysql server

    这步可能会花些时间,需要在线下载,视网速而定;然后再安装;安装完成后就会覆盖掉之前的mariadb

[root@node03 soft]# yum -y install mysql-community-server

3. 设置mysql

3.1 mysql服务
  • 首先启动MySQL服务
[root@node03 soft]# systemctl start mysqld.service
  • 查看mysql启动状态
[root@node03 soft]# systemctl status mysqld.service

下图active(running)表示mysql服务已启动

3.2 修改密码

  • 此时MySQL已经开始正常运行,不过要登陆MySQL,还得先找出此时mysql的root用户的临时密码

    如下命令可以在日志文件中找出临时密码

[root@node03 hadoop]# grep "password" /var/log/mysqld.log
  • 可以查看到我的临时密码为

    注意:不同人的临时密码不一样,根据自己的实际情况而定

fHy3Su:&REkh

  • 使用临时密码,登陆mysql客户端
[root@node03 hadoop]# mysql -uroot -p
  • 设置密码策略为LOW,此策略只检查密码的长度
set global validate_password_policy=LOW;

关键字“Query OK”表示,sql语句执行成功

  • 设置密码最小长度
set global validate_password_length=6;

  • 修改mysql的root用户,本地登陆的密码为123456
ALTER USER 'root'@'localhost' IDENTIFIED BY '123456';
  • 开启mysql的远程连接权限
grant all privileges  on  *.* to 'root'@'%' identified by '123456' with grant option;
flush privileges;
  • 若不再需要使用mysql命令行,可以退出
exit

4. mysql的卸载

注意:mysql安装有问题的,才做此步骤

  • 上面我们在CentOS 7当中已经安装好了5.7版本的mysql服务;
  • 如果以后我们不需要mysql了,或者mysql安装失败了需要重新安装,那么我们需要将mysql卸载掉
  • 使用root用户
4.1 停止mysql服务
[root@node03 hadoop]# systemctl stop mysqld.service
4.2 列出已安装的mysql相关的包
  • 有两种方式,都可以,任选其一

    方式一

[root@node03 hadoop]# yum list installed mysql*

​ 方式二

[root@node03 hadoop]# rpm -qa | grep -i mysql

4.3 卸载mysql包
  • 卸载rpm包,使用rpm -e --nodeps方式卸载,后边依次加入上图的①~⑥的包名,包名之间有空格

    注意:==根据自己的实际情况,指定包名进行卸载==

[root@node03 hadoop]# rpm -e --nodeps mysql57-community-release-el7-10.noarch mysql-community-common-5.7.28-1.el7.x86_64 mysql-community-client-5.7.28-1.el7.x86_64 mysql-community-libs-compat-5.7.28-1.el7.x86_64 mysql-community-libs-5.7.28-1.el7.x86_64 mysql-community-server-5.7.28-1.el7.x86_64
  • 卸载完后,用两个命令再次确认,mysql相关的包已经被卸载

    注意:确保mysql卸载干净,再继续往下操作

[root@node03 hadoop]# rpm -qa | grep -i mysql
[root@node03 hadoop]# yum list installed mysql*

4.4 删除mysql残留文件
  • 查看mysql相关目录
[root@node03 hadoop]# find / -name mysql

根据自己的实际情况,删除find出来的目录

[root@node03 hadoop]# rm -rf /var/lib/mysql/
[root@node03 hadoop]# rm -rf /usr/share/mysql/
[root@node03 hadoop]# rm -rf /etc/selinux/targeted/active/modules/100/mysql
  • 另外删除文件:
[root@node03 hadoop]# rm -rf /root/.mysql_history
[root@node03 hadoop]# rm -f /var/log/mysqld.log
  • 从步骤2.2重新开始

Views: 63

Hive安装部署(Ver3.1.2)

一、课前准备

  1. 安装好对应版本的hadoop集群,并启动hadoop的HDFS以及YARN服务
  2. 安装了MySQL服务,并启动MySQL的服务

二、课堂主题

  1. hive安装部署

三、课堂目标

  1. 掌握hive的安装部署

四、知识要点

1. Hive的安装部署(10分钟)

注意hive就是一个构建数据仓库的工具,只需要在一台服务器上安装就可以了,不需要在多台服务器上安装。

此处以安装到node03为例;请大家保持统一

使用hadoop普通用户操作

1.1 先决条件

  • 搭建好三节点Hadoop集群;
  • node03上先安装好MySQL服务;
  • 参考文档:《CentOS 7安装MySQL5.7版本》

1.2 准备安装包

1.3 解压

  • 解压安装包到指定的规划目录/kkb/install

    [hadoop@node03 ~]$ cd /kkb/soft/
    [hadoop@node03 soft]$ tar -xzvf apache-hive-3.1.2-bin.tar.gz -C /kkb/install

1.4 修改配置文件

  1. 进入hive安装目录
[hadoop@node03 install]$ cd /kkb/install/
  1. 重新命名hive目录
[hadoop@node03 install]$ mv apache-hive-3.1.2-bin/ apache-hive-3.1.2
  1. 修改/kkb/install/conf目录下的hive-site.xml, 默认没有该文件, 需要手动创建
[hadoop@node03 install]$ cd /kkb/install/apache-hive-3.1.2/conf/
[hadoop@node03 conf]$ vim hive-site.xml
  1. 进入编辑模式, 文件内容如下
<?xml version="1.0"?>
<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>
<configuration>
        <property>
                <name>javax.jdo.option.ConnectionURL</name>
                <value>jdbc:mysql://node03:3306/metastore?useSSL=false</value>
        </property>

        <property>
                <name>javax.jdo.option.ConnectionDriverName</name>
                <value>com.mysql.jdbc.Driver</value>
        </property>
        <property>
                <name>javax.jdo.option.ConnectionUserName</name>
                <value>root</value>
        </property>
              <property>
                <name>hive.metastore.warehouse.dir</name>
                <value>/user/hive/warehouse</value>
        </property>
        <property>
                <name>javax.jdo.option.ConnectionPassword</name>
                <value>123456</value>
        </property>
        <property>
                <name>hive.metastore.schema.verification</name>
                <value>false</value>
        </property>
        <property>
                <name>hive.metastore.event.db.notification.api.auth</name>
                <value>false</value>
        </property>
         <property>
                <name>hive.cli.print.current.db</name>
                <value>true</value>
        </property>
         <property>
                <name>hive.cli.print.header</name>
                <value>true</value>
        </property>
        <property>
                <name>hive.server2.thrift.bind.host</name>
                <value>node03</value>
        </property>
        <property>
                <name>hive.server2.thrift.port</name>
                <value>10000</value>
        </property>
</configuration>
  1. 修改日志配置文件hive-log4j.properties
  • 创建hive日志存储目录
[hadoop@node03 conf]$ mkdir -p /kkb/install/apache-hive-3.1.2/logs/
  • 重命名生成文件hive-log4j.properties
[hadoop@node03 conf]$ pwd
/kkb/install/apache-hive-3.1.2/conf
[hadoop@node03 conf]$ mv hive-log4j2.properties.template hive-log4j2.properties
[hadoop@node03 conf]$ vim hive-log4j2.properties # 修改文件
  • 修改此文件的hive.log.dir属性的值
#更改以下内容,设置我们的hive的日志文件存放的路径,便于排查问题
property.hive.log.dir=/kkb/install/apache-hive-3.1.2/logs/

image-20201111101836343

1.5 拷贝mysql驱动包

  • 上传mysql驱动包,如mysql-connector-java-5.1.38.jar/kkb/soft目录中
  • 由于运行hive时,需要向mysql数据库中读写元数据,所以==需要将mysql的驱动包上传到hive的lib目录下==
[hadoop@node03 ~]$ cd /kkb/soft/
[hadoop@node03 soft]$ cp mysql-connector-java-5.1.38.jar /kkb/install/apache-hive-3.1.2/lib/

1.6 解决日志Jar包冲突

# 进入lib目录
[hadoop@node03 conf]$ cd /kkb/install/apache-hive-3.1.2/lib/
# 重新命名 或者直接删除
[hadoop@node03 lib]$ mv log4j-slf4j-impl-2.10.0.jar log4j-slf4j-impl-2.10.0.jar.bak

1.6 配置Hive环境变量

  • 切换到root用户下
[hadoop@node03 soft]$ su root
Password:
  • 打开/etc/profile文件
[root@node03 soft]# vim /etc/profile
  • 末尾添加如下内容
export HIVE_HOME=/kkb/install/apache-hive-3.1.2
export PATH=$PATH:$HIVE_HOME/bin
  • 切换回hadoop用户,并source
[root@node03 soft]# su hadoop
[hadoop@node03 soft]$ source /etc/profile

1.7 初始化元数据库

  1. 新建一个node03连接, 登录MySQL
# 连接MySQL, 用户名root, 密码123456
[hadoop@node03 ~]$ mysql -uroot -p123456
  1. 创建hive元数据, 需要和hive-site.xml中配置的一致
-- 创建数据库, 数据库名为: metastore
create database metastore;
show databases;
  1. 退出mysql
exit
  1. 初始化元数据库
[hadoop@node03 ~]$ schematool -initSchema -dbType mysql -verbose

image-20201104145352060

看到schemaTool completed 表示初始化成功

1.7 验证安装

  • ==hadoop集群已启动==
  • ==mysql服务已启动==
  • 在node03上任意目录启动hive cli命令行客户端
[hadoop@node03 ~]$ hive  
# 启动成功之后, 警告信息可以忽略
  • 查看有哪些数据库
show databases;

image-20201104154118088

  • 说明hive安装成功
  • 退出cli
quit;

1.8 通过beeline连接代理服务器hiveserver2 操作hive

后期课堂中主要使用这种方式操作hive

  1. node01修改hadoop的core-site.xml文件
[hadoop@node03 ~]$ cd /kkb/install/hadoop-3.1.4/etc/hadoop
[hadoop@node03 hadoop]$ vim core-site.xml 
  1. 在core-site.xml中添加以下配置信息
    1. 配置信息hadoop.proxyuser.hadoop.hostshadoop.proxyuser.hadoop.groups中的hadoop用户需要修改为自己的用户名
    2. image-20210416113542602
 <property>
         <name>hadoop.proxyuser.hadoop.hosts</name>
        <value>*</value>
    </property>
    <property>
        <name>hadoop.proxyuser.hadoop.groups</name>
        <value>*</value>
    </property>
  1. 将core-site.xml文件同步到node02和node03
scp /kkb/install/hadoop-3.1.4/etc/hadoop/core-site.xml node02:/kkb/install/hadoop-3.1.4/etc/hadoop/

scp /kkb/install/hadoop-3.1.4/etc/hadoop/core-site.xml node03:/kkb/install/hadoop-3.1.4/etc/hadoop/
  1. 启动hiveserver2
[hadoop@node03 hive]$ cd /kkb/install/hive/
[hadoop@node03 hive]$ bin/hiveserver2  # 启动警告信息可以忽略

image-20201104152847036

  1. 新建node03连接, 连接hiveserver2
[hadoop@node03 hive]$ cd /kkb/install/hive/
[hadoop@node03 hive]$ bin/beeline --color=true

image-20201104153110962

  1. 通过jdbc方式连接hiveserver2, 输入用户名和密码
beeline> !connect jdbc:hive2://node03:10000
  1. 输入用户名: hadoop、密码: 123456
Enter username for jdbc:hive2://node03:10000: hadoop
Enter password for jdbc:hive2://node03:10000: 123456
  1. 测试
0: jdbc:hive2://node03:10000> show databases;

image-20201104153645880

创建启停脚本

hive-services.sh

#!/bin/bash
HIVE_LOG_DIR=$HIVE_HOME/logs

mkdir -p $HIVE_LOG_DIR

#检查进程是否运行正常,参数1为进程名,参数2为进程端口
function check_process()
{
    pid=$(ps -ef 2>/dev/null | grep -v grep | grep -i $1 | awk '{print $2}')
    ppid=$(netstat -nltp 2>/dev/null | grep $2 | awk '{print $7}' | cut -d '/' -f 1)
    echo $pid
    [[ "$pid" =~ "$ppid" ]] && [ "$ppid" ] && return 0 || return 1
}

function hive_start()
{
    metapid=$(check_process HiveMetastore 9083)
    cmd="nohup hive --service metastore >$HIVE_LOG_DIR/metastore.log 2>&1 &"
    cmd=$cmd" sleep 4; hdfs dfsadmin -safemode wait >/dev/null 2>&1"
    [ -z "$metapid" ] && eval $cmd || echo "Metastroe服务已启动"
    server2pid=$(check_process HiveServer2 10000)
    cmd="nohup hive --service hiveserver2 >$HIVE_LOG_DIR/hiveServer2.log 2>&1 &"
    [ -z "$server2pid" ] && eval $cmd || echo "HiveServer2服务已启动"
}

function hive_stop()
{
    metapid=$(check_process HiveMetastore 9083)
    [ "$metapid" ] && kill $metapid || echo "Metastore服务未启动"
    server2pid=$(check_process HiveServer2 10000)
    [ "$server2pid" ] && kill $server2pid || echo "HiveServer2服务未启动"
}

case $1 in
"start")
    hive_start
    ;;
"stop")
    hive_stop
    ;;
"restart")
    hive_stop
    sleep 2
    hive_start
    ;;
"status")
    check_process HiveMetastore 9083 >/dev/null && echo "Metastore服务运行正常" || echo "Metastore服务运行异常"
    check_process HiveServer2 10000 >/dev/null && echo "HiveServer2服务运行正常" || echo "HiveServer2服务运行异常"
    ;;
*)
    echo Invalid Args!
    echo 'Usage: '$(basename $0)' start|stop|restart|status'
    ;;
esac

HiveServer2启动异常处理

一般hiverServer2的启动比较花时间,需等待5分钟左右才能启动,如果长时间还没有启动需要查看日志寻找失败原因:

异常1

Safe mode is ON. The reported blocks 3 needs additional 2 blocks to reach the threshold 0.9990 of total blocks 5. The number of live datanodes 2 has reached the minimum number 0. Safe mode will be turned off automatically once the thresholds have been reached.

说明我们的损坏的文件比例超过了阈值, 这个阈值配置在hdfs中, 也就是说不允许任何一个块损坏掉. 如果我们配置成99%应该就不会触发safemode了.
由于系统断电,内存不足等原因导致dataNode丢失超过设置的丢失百分比,系统自动进入安全模式

解决办法

执行命令退出安全模式:

hadoop dfsadmin -safemode leave`

执行健康检查,删除损坏掉的block
hdfs fsck  /  -delete

运行后如果出现下面提示,表示修复完毕

The filesystem under path '/' is HEALTHY

如果没有修复则可以多执行一次hdfs fsck命令

异常2

java.lang.NoClassDefFoundError: org/apache/tez/dag/api/TezConfiguration

Views: 86

Zookeeper集群安装部署

一、课前准备

  1. 准备一台内存最少8G(建议16G)、cpu i7 4核的电脑

二、课堂主题

  1. 搭建3节点zookeeper集群

三、课堂目标

  1. 完成zookeeper集群安装

四、知识要点

1. zookeeper集群的安装

注意事项:三台机器一定要保证时钟同步

1.1 下载zookeeper的压缩包

  • 下载网址

  • 我们在这个网址下载我们使用的zk版本为apache-zookeeper-3.6.2

  • 下载完成之后,上传到我们的node01的/kkb/soft路径下准备进行安装

1.2 解压

  • node01执行以下命令解压zookeeper的压缩包到node01服务器的/kkb/install路径下去,然后准备进行安装
cd /kkb/soft

tar -zxvf apache-zookeeper-3.6.2-bin.tar.gz  -C /kkb/install/

1.3 修改配置文件

  • 第一台机器修改配置文件
cd /kkb/install/apache-zookeeper-3.6.2-bin/conf

mkdir -p /kkb/install/apache-zookeeper-3.6.2-bin/zkdatas

cp zoo_sample.cfg zoo.cfg
  • vim zoo.cfg修改文件,修改如下属性值
dataDir=/kkb/install/apache-zookeeper-3.6.2-bin/zkdatas

autopurge.snapRetainCount=3

autopurge.purgeInterval=1

#文件末尾增加如下三行
server.1=node01:2888:3888
server.2=node02:2888:3888
server.3=node03:2888:3888

1.4 添加myid配置

  • 在第一台机器的/kkb/install/apache-zookeeper-3.6.2-bin/zkdatas/这个路径下创建一个文件,文件名为myid ,文件内容为1
echo 1 >  /kkb/install/apache-zookeeper-3.6.2-bin/zkdatas/myid

1.5 安装包分发并修改myid的值

  • 第一台机器上面执行以下两个命令
scp -r /kkb/install/apache-zookeeper-3.6.2-bin/ node02:/kkb/install/

scp -r /kkb/install/apache-zookeeper-3.6.2-bin/ node03:/kkb/install/
  • ==第二台==机器上修改myid的值为2;直接在第二台机器任意路径执行以下命令
echo 2 > /kkb/install/apache-zookeeper-3.6.2-bin/zkdatas/myid
  • ==第三台==机器上修改myid的值为3;直接在第三台机器任意路径执行以下命令
echo 3 > /kkb/install/apache-zookeeper-3.6.2-bin/zkdatas/myid

1.6 配置环境变量

  • 三台节点都配置/etc/profile文件
sudo vim /etc/profile
export ZK_HOME=/kkb/install/apache-zookeeper-3.6.2-bin
export PATH=$PATH:$ZK_HOME/bin
  • 三台节点,让新添环境变量生效(hadoop用户下执行)
source /etc/profile

1.7 三台机器启动zookeeper服务

  • 三台机器启动zookeeper服务;这个命令三台机器都要执行
zkServer.sh start
  • 查看启动状态
zkServer.sh status

一个zkServer的状态要么是follower,要么是leader

三个节点中,一个节点为leader,另外两个为follower,类似下图

![](https://imgs.delucia.cn/imgs/2021/Image201910221141 (2).png)

  • jps每个服务器上有一个QuorumPeerMain进程

1.8 如何关闭zookeeper集群
  • 三个节点运行
zkServer.sh stop

==提醒:如果要关闭电脑时,清一定要按照以下顺序操作,否则集群可能会出问题==

  • 关闭zookeeper集群

  • 关闭虚拟机

  • 关闭电脑

Views: 97