Java转大数据第一课(必修课)(用汗水为后来人做铺垫-----非常详细图文步骤)

本文主要是介绍Java转大数据第一课(必修课)(用汗水为后来人做铺垫-----非常详细图文步骤),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

搭建Hadoop环境(jdk8/Hadoop2.x/viralbox)

准备工作
  • (1)关闭防火墙、主机名
  • (2)安装JDK
  • (3)免密码登录

准备工具:
jdk
virtualBox
iso
安装过程:

1、环境搭建

在这里插入图片描述
安装完毕以后,VirualBox是没有64位显示的,那么我们需要按照如下图更改BIOS配置。在这里插入图片描述
选择自己新建的类型,这里选择linux、选择版本red hat
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

ipv4和掩码,记得ipv4配置192.168的网段,我这里配置192.168.56.111。掩码:255.255.255.0

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

2、关闭防火墙

在这里插入图片描述
补充:

这里如果你依然链接不上链接:检查密码也对。拒绝访问或者就是ping ip超时,那么问题是在网络链接的四种模式。默认是NAT。你可以修改为

3、配置JDK

解压jdk到指定目录/usr/local:tar -zxvf jdk-8u144-linux-x64.tar.gz -C /usr/local

在这里插入图片描述在这里插入图片描述

4、配置Hadoop

解压hadoop到指定文件: tar -xzvf hadoop-2.7.3.tar.gz -C /usr/local

jdk中配置hadoop路径

export JAVA_HOME=/usr/local/jdk1.8.0_144
export JRE_HOME=$JAVA_HOME/jre
export CLASSPATH=.:$JAVA_HOME/lib:${JRE_HOME}/lib
export HADOOP_HOME=/usr/local/hadoop-2.7.3
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export PATH=$JAVA_HOME/bin:$PATH

在这里插入图片描述
每次修改完/etc/profile文件都需要重新激活配置否则不生效:source /etc/profile
在这里插入图片描述
Hadoop中也需要配置jdk:

在这里插入图片描述

5、本地模式启动Hadoop

在这里插入图片描述

小结:在这个过程中,如果你需要上传文件则这里可以通过xftp或者winscp。
这里经常会遇见问题:比如说,拒绝访问。比如说root密码对但是登录不上。别着急,别慌。两种检查方案

1、检查你的连接IP是否正确通过 ifconfig。

如果没有ifconfig。那么可以选用ip addr show的命令格式查看

2、检查是否安装了ssh服务

查看ssh的安装包 :rpm -qa | grep ssh 
查看ssh是否安装成功 :ps -ef | grep ssh
开启sshd服务 :service sshd start 
开启sshd服务 :/bin/systemctl start sshd.service 
查看sshd服务的网络连接情况:netstat -ntlp 安装ssh
因为以后的操作要用到ssh面密登录,现在先确保系统里安装好ssh. 如
果未安装可利用sudo apt-get install ssh 安装,使用ssh localhost 来ssh登陆本机 
使用命令dpkg –l |grep ssh 
检查是否安装openssh-server 
没有的话使用apt-get安装。 
安装完成之后检查是否启动: 
有sshd说明已经启动,没有启动的话使用命令: 
/etc/init.d/ssh start 来启动ssh服务。tips:
service ssh restart是centos 6的命令。
centos 7的命令应该是:systemctl restart sshd

3、检查是否不允许让root登录

编辑/etc/ssh/sshd_config文件
sudo vi /etc/ssh/sshd_config
1.编辑 /etc/ssh/sshd_config文件:  sudo vi /etc/ssh/sshd_config将PermitRootLogin 的值改成 yes将PermitEmptyPassword 的值改成 no保存退出 重启ssh

Hadoop的分布式配置文件图,由于是别人的,所以有些信息和我这里对不上。但是我大体说明下就可以知道了。把/root/training/换成我们这里的/usr/local就可以了
在这里插入图片描述

6、启动伪分布式Hadoop

由于刚才我们有个步骤非常恶心,就是选择yes连续才能启动起来。那么我们需要设置免密登录。

6.1免密登录

所以这里我重新设置了hostName以后再进行面密登录:
步骤如下:ssh-keygen -t rsa -P ''
在这里插入图片描述

cat  /root/.ssh/id_rsa.pub >>  /root/.ssh/authorized_keys
chmod 600 /root/.ssh/authorized_keys

在这里插入图片描述
完成之后,以 root 用户登录,修改 ssh 配置文件

vi /etc/ssh/sshd_config把文件中的下面几条信息的注释去掉: RSAAuthentication yes # 启用 RSA 认证PubkeyAuthentication yes # 启用公钥私钥配对认证方式AuthorizedKeysFile .ssh/authorized_keys # 公钥文件路径(和上面生成的文件同)

在这里插入图片描述
重启服务:systemctl restart sshd.service
然后ssh localhost登录发现异常
在这里插入图片描述
The authenticity of host ‘localhost (::1)’ can’t be established.
ECDSA key fingerprint is SHA256:X+9DEX5+oCD0NyGctt0HK8swVeVvOZOFhJbBt0Vguv8.
ECDSA key fingerprint is MD5:16:33:69:41:1d:99:37:27:5b:81:0e:ee?82:ec:fd.

Fix it:
方法一
ssh -o StrictHostKeyChecking=no 192.168.xxx.xxx(我这里的链接是配置的192.168.56.111)
在这里插入图片描述
方法二
一个彻底去掉这个提示的方法是,修改/etc/ssh/ssh_config文件(或$HOME/.ssh/config)中的配置,添加如下两行配置:
StrictHostKeyChecking no
UserKnownHostsFile /dev/null
修改好配置后,重新启动sshd服务即可。
重启ssh服务命令为systemctl restart sshd.service
在这里插入图片描述
在这里插入图片描述

6.2伪分布式环境搭建配置

6.2.1、上传和解压hadoop并配置环境变量

上面解压和配置etc/profile的hadoop变量已经完成,现在配置伪分布式环境

6.2.2、创建hadoop文件夹下的tmp目录在这里插入图片描述
6.2.3、在hadoop-env.sh增加环境变量

在这里插入图片描述

6.2.4、在hdfs-site.xml修改数据块的冗余度和禁用HDFS权限检查
     (*)hdfs-site.xml<!--数据块的冗余度默认3--><!--原则数据块的冗余度跟数据节点个数一样,最大不超过3--><property><name>dfs.replication</name><value>1</value></property><!--禁用HDFS权限检查--><property><name>dfs.permissions</name><value>false</value></property>

在这里插入图片描述

6.2.5、在core-site.xml修改NameNode的地址和HDFS对应的操作系统目录
     (*)core-site.xml<!--NameNode的地址--><property><name>fs.defaultFS</name><!-- 192.168.56.111是我们之前配置的虚拟机ip地址--><value>hdfs://192.168.56.111:9000</value></property>	<!--HDFS对应的操作系统目录--><property><name>hadoop.tmp.dir</name><!--正式配置参数前创建的目录路径--><value>/usr/local/hadoop-2.7.3/tmp</value></property>	

在这里插入图片描述

6.2.6、在mapred-site.xml增加yarn容器的配置
(*)mapred-site(.xml/.tmplate)<property><name>mapreduce.framework.name</name><value>yarn</value></property>如果是tmplate结尾,更改为复制template,生成xml,命令如下:cp mapred-site.xml.template mapred-site.xml

在这里插入图片描述
在这里插入图片描述

6.2.7、在yarn-site.xml增加resourcemanager的地址和洗牌配置
		(*)yarn-site.xml<!--ResourceManager地址--><property><name>yarn.resourcemanager.hostname</name><value>192.168.56.111</value></property><!--洗牌--><property><name>yarn.nodemanager.aux-services</name><value>mapreduce_shuffle</value></property>		

在这里插入图片描述
到此我们便配置完成一个 hdfs 伪分布式环境
在这里插入图片描述

6.2.7、 启动 hdfs Single Node,格式化NameNode,比较重要

①、初始化 hdfs 文件系统
bin/hdfs namenode -format

②、启动 hdfs
sbin/start-dfs.sh,但是我们这里配置了yarn容器所以我们可以直接start-all.sh启动hdfs服务和yarn服务
在这里插入图片描述
在这里插入图片描述
在你的浏览器内输入你的虚拟主机ip:50070访问namenode服务
在这里插入图片描述
在这里插入图片描述
这里的黄色信息192.168.56.101就是上面我们提到启动的时候日志提示的信息。
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述


以下是错误失败次数导致的积累。从某种意义上说,多经历几次失败就好了。如果你按照上面的教程没有成功,则肯定是你没看仔细或者省略了步骤,再重新来一遍就好了。对了版本要一致,不同的版本不同的坑。


如果不格式化启动服务,然后再格式化的情况下不能访问50070服务namenode,只能访问如下界面

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

问题很难过:
hadoop无法访问50070端口怎么办?

Hadoop 50070是hdfs的web管理页面,在搭建Hadoop集群环境时,有些大数据开发技术人员会遇到Hadoop 50070端口打不开的情况,引起该问题的原因很多,想要解决这个问题需要从以下方面进行排查!1. 排查Namenode是否部署成功排查Namenode是否部署成功可以采用命令jps两种方式之一查看,如Namenode未部署成功,需重新部署Namenode;若已部署成功,请进行第二步排查!2. 排查datanode是否部署成功排查datanode是否部署成功可以采用jps命令进行查看,如果部署未成功,找到问题节点进行解决;若部署成功请进行第三步。3.排查防火墙是否开启排查防火墙是否正常开启,如果防火墙关闭了,可按照以下方式进行设置:netstat –ant  #查看本地开发端口127.0.0.1 50070在hdfs-site.xml中,更改开放端口的绑定IP:<property><name>dfs.http.address</name><value>0.0.0.0:50070</value></property>将绑定IP改为0.0.0.0,而不是本地回环IP,这样,就能够实现外网访问本机的50070端口了

排查问题:5个节点都启动成功
在这里插入图片描述
在这里插入图片描述
更改0.0.0.0:50070依然失败。无法访问50070.

过程中遇见的其他问题:

userdel -r hadoop

group hadoop not removed because it has other members.

免密登录不能使用hostname大写字母
在这里插入图片描述

这篇关于Java转大数据第一课(必修课)(用汗水为后来人做铺垫-----非常详细图文步骤)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/541487

相关文章

JVM 的类初始化机制

前言 当你在 Java 程序中new对象时,有没有考虑过 JVM 是如何把静态的字节码(byte code)转化为运行时对象的呢,这个问题看似简单,但清楚的同学相信也不会太多,这篇文章首先介绍 JVM 类初始化的机制,然后给出几个易出错的实例来分析,帮助大家更好理解这个知识点。 JVM 将字节码转化为运行时对象分为三个阶段,分别是:loading 、Linking、initialization

Spring Security 基于表达式的权限控制

前言 spring security 3.0已经可以使用spring el表达式来控制授权,允许在表达式中使用复杂的布尔逻辑来控制访问的权限。 常见的表达式 Spring Security可用表达式对象的基类是SecurityExpressionRoot。 表达式描述hasRole([role])用户拥有制定的角色时返回true (Spring security默认会带有ROLE_前缀),去

浅析Spring Security认证过程

类图 为了方便理解Spring Security认证流程,特意画了如下的类图,包含相关的核心认证类 概述 核心验证器 AuthenticationManager 该对象提供了认证方法的入口,接收一个Authentiaton对象作为参数; public interface AuthenticationManager {Authentication authenticate(Authenti

Spring Security--Architecture Overview

1 核心组件 这一节主要介绍一些在Spring Security中常见且核心的Java类,它们之间的依赖,构建起了整个框架。想要理解整个架构,最起码得对这些类眼熟。 1.1 SecurityContextHolder SecurityContextHolder用于存储安全上下文(security context)的信息。当前操作的用户是谁,该用户是否已经被认证,他拥有哪些角色权限…这些都被保

Spring Security基于数据库验证流程详解

Spring Security 校验流程图 相关解释说明(认真看哦) AbstractAuthenticationProcessingFilter 抽象类 /*** 调用 #requiresAuthentication(HttpServletRequest, HttpServletResponse) 决定是否需要进行验证操作。* 如果需要验证,则会调用 #attemptAuthentica

Spring Security 从入门到进阶系列教程

Spring Security 入门系列 《保护 Web 应用的安全》 《Spring-Security-入门(一):登录与退出》 《Spring-Security-入门(二):基于数据库验证》 《Spring-Security-入门(三):密码加密》 《Spring-Security-入门(四):自定义-Filter》 《Spring-Security-入门(五):在 Sprin

Java架构师知识体认识

源码分析 常用设计模式 Proxy代理模式Factory工厂模式Singleton单例模式Delegate委派模式Strategy策略模式Prototype原型模式Template模板模式 Spring5 beans 接口实例化代理Bean操作 Context Ioc容器设计原理及高级特性Aop设计原理Factorybean与Beanfactory Transaction 声明式事物

大模型研发全揭秘:客服工单数据标注的完整攻略

在人工智能(AI)领域,数据标注是模型训练过程中至关重要的一步。无论你是新手还是有经验的从业者,掌握数据标注的技术细节和常见问题的解决方案都能为你的AI项目增添不少价值。在电信运营商的客服系统中,工单数据是客户问题和解决方案的重要记录。通过对这些工单数据进行有效标注,不仅能够帮助提升客服自动化系统的智能化水平,还能优化客户服务流程,提高客户满意度。本文将详细介绍如何在电信运营商客服工单的背景下进行

基于MySQL Binlog的Elasticsearch数据同步实践

一、为什么要做 随着马蜂窝的逐渐发展,我们的业务数据越来越多,单纯使用 MySQL 已经不能满足我们的数据查询需求,例如对于商品、订单等数据的多维度检索。 使用 Elasticsearch 存储业务数据可以很好的解决我们业务中的搜索需求。而数据进行异构存储后,随之而来的就是数据同步的问题。 二、现有方法及问题 对于数据同步,我们目前的解决方案是建立数据中间表。把需要检索的业务数据,统一放到一张M

关于数据埋点,你需要了解这些基本知识

产品汪每天都在和数据打交道,你知道数据来自哪里吗? 移动app端内的用户行为数据大多来自埋点,了解一些埋点知识,能和数据分析师、技术侃大山,参与到前期的数据采集,更重要是让最终的埋点数据能为我所用,否则可怜巴巴等上几个月是常有的事。   埋点类型 根据埋点方式,可以区分为: 手动埋点半自动埋点全自动埋点 秉承“任何事物都有两面性”的道理:自动程度高的,能解决通用统计,便于统一化管理,但个性化定