副队长大数据教程(3)--Hadoop伪分布式部署
文章目录1. 引子2. 前置准备必须全部做完2.1 一台已经装好的 CentOS7 虚拟机2.2 关闭防火墙、关闭 SELinux避免端口访问被拦截2.3 配置好主机名与 hosts 映射能够主机名互相解析2.4 配置免密 SSH 登录本机可以 ssh 无密码登录自己2.5 安装 JDK8配置 JAVA_HOME 环境变量Hadoop 依赖 Java 运行2.6 上传 Hadoop 安装包到 CentOS并解压3. 安装配置Hadoop3.1 配置环境变量3.2 修改Hadoop配置文件3.2.1 修改hadoop-env.sh文件3.2.2 修改core-site.xml3.2.3 修改hdfs-site.xml3.2.4 修改mapred-site.xml文件3.2.5 修改yarn-site.xml文件3.3 格式化 HDFS 文件系统4. 启动伪分布式Hadoop4.1 启动4.2 验证是否启动成功4.3 访问 Web UI 页面5. 关闭集群6. 小结1. 引子前面我们已经在 VMware 虚拟机里面装好 CentOS7 系统了。很多同学会疑惑Hadoop 安装分单机、伪分布式、完全分布式这三者到底有什么区别单机模式只是 Hadoop 的本地测试没有真正启动 HDFS 和 YARN算不上真正的集群。而完全分布式需要准备多台虚拟机配置起来工作量大对电脑内存要求很高。对于初学大数据的同学来说伪分布式是最合适的入门环境。它只需要一台 CentOS7 虚拟机所有 Hadoop 的守护进程NameNode、DataNode、ResourceManager、NodeManager都运行在同一台机器上逻辑上是一个集群。伪分布式可以完整模拟 Hadoop 的运行机制HDFS、MapReduce、YARN 都能正常使用学习 Hadoop 基础操作、跑测试案例足够用。今天这篇博客我们一步步讲解 Hadoop 伪分布式完整安装流程。2. 前置准备必须全部做完在安装 Hadoop 伪分布式之前我们要先把环境准备好缺一不可。2.1 一台已经装好的 CentOS7 虚拟机这个上一篇教程介绍的很详细了大家可以直接去看一下。2.2 关闭防火墙、关闭 SELinux避免端口访问被拦截先查看防火墙systemctl status firewalld然后关闭防火墙systemctl stop firewalld禁止开机启动为了避免每次开机后都要关闭防火墙systemctl disable firewalld关闭SELinux(安全增强型Linux)也是为了防止安装过程中报错通过vim修改文件然后重启vim/etc/sysconfig/selinux2.3 配置好主机名与 hosts 映射能够主机名互相解析使用如下命令修改的话重启后会自动还原hostnamelocalhost通过如下方式修改则永久生效vim/etc/hostname2.4 配置免密 SSH 登录本机可以 ssh 无密码登录自己每台机器互相之间无需输入密码可以直接登录。原理是采用公钥-私钥的体系。生成密钥ssh-keygen-trsa查看生成的文件复制pub文件创建密钥文件authorized_keyscp~/.ssh/id_rsa.pub ~/.ssh/authorized_keys验证免密登录无需输入密码就是配置成功2.5 安装 JDK8配置 JAVA_HOME 环境变量Hadoop 依赖 Java 运行首先从windows系统拷贝jdk文件到/usr/local下。第二进入/usr/local目录然后解压文件。cd/usr/localtarzxvf jdk-8u461-linux-x64.tar.gz第三修改文件名方便后续操作mvjdk1.8.0_461 jdk第四修改/etc/profile设置环境变量vim/etc/profile解释英文点表示当前目录冒号表示分割目录$表示取变量的值。2.6 上传 Hadoop 安装包到 CentOS并解压正常情况下直接从Windows系统复制下载好的Hadoop到虚拟机相关目录下即可然后使用如下命令解压然后重命名后待用。tar-zxvfhadoop-3.3.6.tar.gzmvhadoop-3.3.6.tar.gz hadoop3. 安装配置HadoopHadoop 的配置文件都在解压目录下etc/hadoop文件夹中伪分布式一共需要修改 4 个核心配置文件。我们使用 vim 编辑器编辑文件。3.1 配置环境变量编辑全局环境变量文件为Hadoop配置环境变量让系统任意位置都可以直接调用 hadoop 命令。vim/etc/profile在文件末尾增加exportHADOOP_HOME/usr/local/hadoopexportPATH$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin注意Hadoop3.x还需要添加以下配置否则可能报错exportHDFS_NAMENODE_USERrootexportHDFS_DATANODE_USERrootexportHDFS_SECONDARYNAMENODE_USERrootexportYARN_RESOURCEMANAGER_USERrootexportYARN_NODEMANAGER_USERroot保存退出执行命令生效source/etc/profile执行hadoop version如果能输出版本号代表环境变量配置成功。3.2 修改Hadoop配置文件这些配置文件都在/usr/local/hadoop/etc/hadoop下所以先进入该目录cd/usr/local/hadoop/etc/hadoop3.2.1 修改hadoop-env.sh文件这个文件是 Hadoop 的环境变量配置主要指定 Java 的安装路径。vimhadoop-env.sh找到 JAVA_HOME 配置项修改成你的 JDK 实际安装目录exportJAVA_HOME/usr/local/jdk3.2.2 修改core-site.xml核心全局配置用来配置 HDFS 的默认文件系统、NameNode 的地址还有 Hadoop 临时数据存放目录。vimcore-site.xml在configuration标签里面添加下面配置propertynamefs.defaultFS/namevaluehdfs://localhost:9000/value/propertypropertynamehadoop.tmp.dir/namevalue/usr/local/hadoop/tmp/value/property3.2.3 修改hdfs-site.xmlHDFS 的相关配置伪分布式下副本数量设置为 1因为只有一台机器不能保存多份副本。vimhdfs-site.xmlpropertynamedfs.replication/namevalue1/value/propertypropertynamedfs.http.address/namevaluelocalhost:50070/value/property3.2.4 修改mapred-site.xml文件MapReduce 运行框架配置指定使用 YARN 作为资源调度。vimmapred-site.xmlpropertynamemapreduce.framework.name/namevalueyarn/value/property3.2.5 修改yarn-site.xml文件YARN 资源管理器配置vimyarn-site.xmlpropertynameyarn.resourcemanager.hostname/namevaluelocalhost/value/propertypropertynameyarn.nodemanager.aux-services/namevaluemapreduce_shuffle/value/property3.3 格式化 HDFS 文件系统HDFS 格式化就像新硬盘格式化用来初始化 NameNode 的元数据生成集群唯一 ID创建 HDFS 根目录。不格式化的话NameNode 缺少底层目录结构集群无法启动。⚠️重要提醒格式化操作只需要执行一次反复多次格式化会造成集群数据损坏hdfs namenode-format看到提示successfully formatted就代表格式化成功。4. 启动伪分布式Hadoop4.1 启动执行如下命令启动start-all.sh4.2 验证是否启动成功使用 jps 命令查看 Java 进程验证是否全部启动成功jps伪分布式正常启动后能看到这 5 个进程NameNodeDataNodeSecondaryNameNodeResourceManagerNodeManager少任何一个进程就代表启动失败需要查看日志排查错误。如图4.3 访问 Web UI 页面集群启动成功后可以在 Windows 浏览器访问 Hadoop 网页管理界面。HDFS 页面http://localhost:50070查看 HDFS 文件系统YARN 页面http://localhost:8088查看任务调度、运行的 MapReduce 程序5. 关闭集群练习完毕关闭集群的命令stop-all.sh6. 小结Hadoop 伪分布式是单机器模拟集群非常适合新手入门学习。学习的时候不要死记配置每一步弄明白参数含义。搭建过程大概率会遇到各种报错遇到问题优先查看日志。亲手把伪分布式搭建成功你才算真正踏入 Hadoop 大数据的大门后面再学习完全分布式就轻松很多。

相关新闻

智慧校园大数据治理平台:从架构到场景落地

智慧校园大数据治理平台:从架构到场景落地

简介:这是一份面向教育信息化规划者、售前工程师及学校信息化管理人员的数字化智慧校园大数据治理平台建设及场景应用建设技术解决方案。方案从国家教育信息化政策背景出发,系统阐述智慧校园建设目标与总体架构设计,涵盖信息标准、共享数据中…

2026/9/21 10:42:26 阅读更多 →
Origin图表自动更新全攻略:让数据变化实时同步

Origin图表自动更新全攻略:让数据变化实时同步

在科研和工程数据分析的日常里,Origin 几乎是绕不开的工具。但很多人用它的方式还停留在"画完一张图,导出,完事"的阶段——数据一改,图就得重画,图例要重排,坐标轴要重设,配色要重调。…

2026/9/21 6:55:49 阅读更多 →
Ray Data 文本数据处理实战指南:从读取、转换到推理与保存

Ray Data 文本数据处理实战指南:从读取、转换到推理与保存

Ray Data 文本数据处理实战指南:从读取、转换到推理与保存 【免费下载链接】ray Ray is an AI compute engine. Ray consists of a core distributed runtime and a set of AI Libraries for accelerating ML workloads. 项目地址: https://gitcode.com/gh_mirror…

2026/9/21 12:28:44 阅读更多 →

最新新闻

3招搞定策划文案怎么写,面试必问实战解析

3招搞定策划文案怎么写,面试必问实战解析

3招搞定策划文案怎么写,面试必问实战解析 学会语法却不知怎么搭项目,这是很多转行技术岗或刚入行的朋友最大的痛点。在技术面试中, 面试必问…

2026/9/22 4:28:54 阅读更多 →
国债327事件复盘:3个维度拆解风控最佳实践

国债327事件复盘:3个维度拆解风控最佳实践

国债327事件复盘:3个维度拆解风控最佳实践 很多刚入行的朋友,手里攥着Python或者Java的语法书,背熟了 for 循环和 class…

2026/9/22 4:28:54 阅读更多 →
深度xp精简版6.2实战:从语法到架构的面试必问拆解

深度xp精简版6.2实战:从语法到架构的面试必问拆解

深度xp精简版6.2实战:从语法到架构的面试必问拆解 刚把Python的for循环写熟,转头就要设计高并发接口?这大概是很多开发者最崩溃的时刻。你背下了语法,却在面对真实项目时手足无措,不知道模块怎么拆,数据流怎么通。这种“只会写片段,不会…

2026/9/22 4:28:54 阅读更多 →
告别代码报错,陈列馆保姆级教程带你从零搭建

告别代码报错,陈列馆保姆级教程带你从零搭建

告别代码报错,陈列馆保姆级教程带你从零搭建 刚接手一个项目,把网上扒来的“陈列馆”展示模块代码复制进来,直接报错 Module not found…

2026/9/22 4:28:53 阅读更多 →
华为c8813解锁工具性能优化:告别卡顿,掌握最佳实践

华为c8813解锁工具性能优化:告别卡顿,掌握最佳实践

华为c8813解锁工具性能优化:告别卡顿,掌握最佳实践 官方文档堆成山,代码跑起来像蜗牛?别慌。面对华为C8813这类硬件设备的解锁与底层调试场景,很多开发者第一反应是查阅冗长的官方手册,结果半小时过去了,还没找到关键API的调用顺序。更糟…

2026/9/22 4:28:53 阅读更多 →
地球在线高清卫星地图API升级避坑速查手册

地球在线高清卫星地图API升级避坑速查手册

地球在线高清卫星地图API升级避坑速查手册 版本升级后 API 全变了,以前能跑的代码现在全报 404,抓头发也没用。别慌,这份 速查手册 专治各种“API 迁移疑难杂症”,帮你把地球在线高清卫星地图的底层逻辑吃透。 很多开发老哥在对接…

2026/9/22 4:27:53 阅读更多 →

日新闻

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天 配置环境就卡半天?别怪机器慢,多半是你没选对工具链。在Java、Go或Python的项目现场, 手写实现…

2026/9/22 0:00:41 阅读更多 →
剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑 面试被问原理答不上来,是不是常态?别慌。很多开发者对着 GitHub 开源仓库里的代码发呆,看似简单实则暗藏玄机。今天这份【剑帝加点】速查手册,直接带你拆解核心实现,把面试必考的原理讲透。…

2026/9/22 0:00:41 阅读更多 →
手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优 复制来的代码跑不通不知道怎么调?别慌,这种“复制粘贴地狱”在开发圈太常见了。尤其是做 图片压缩网站…

2026/9/22 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/21 3:13:20 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/21 15:36:51 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/21 15:36:51 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/22 2:43:42 阅读更多 →