Hadoop 3.1.3 伪分布式环境搭建:Ubuntu 18.04 下 5 步完成配置与验证 Hadoop 3.1.3 伪分布式环境搭建Ubuntu 18.04 实战指南1. 环境准备与基础配置在开始Hadoop伪分布式环境搭建前需要确保系统环境满足基本要求。Ubuntu 18.04 LTS作为长期支持版本提供了稳定的基础运行环境。以下是详细的准备工作系统要求Ubuntu 18.04 LTS 64位系统至少4GB内存推荐8GB20GB可用磁盘空间稳定的网络连接首先更新系统软件包并安装必要工具sudo apt-get update sudo apt-get upgrade -y sudo apt-get install -y ssh pdsh vim git curl wgetJava环境配置 Hadoop 3.1.3需要Java 8运行环境执行以下命令安装OpenJDKsudo apt-get install -y openjdk-8-jdk验证Java安装是否成功java -version提示如果系统已安装其他Java版本可通过update-alternatives --config java切换默认版本创建专用Hadoop用户能提高系统安全性sudo adduser hadoop sudo usermod -aG sudo hadoop su - hadoop2. SSH免密登录配置Hadoop集群管理需要SSH免密登录支持即使单节点伪分布式环境也需要此配置。生成SSH密钥对ssh-keygen -t rsa -P -f ~/.ssh/id_rsa cat ~/.ssh/id_rsa.pub ~/.ssh/authorized_keys chmod 0600 ~/.ssh/authorized_keys测试SSH连接ssh localhost若仍需输入密码检查权限设置chmod 0700 ~/.ssh chmod 0600 ~/.ssh/*3. Hadoop安装与核心配置从Apache官网下载Hadoop 3.1.3二进制包wget https://archive.apache.org/dist/hadoop/core/hadoop-3.1.3/hadoop-3.1.3.tar.gz tar -xzvf hadoop-3.1.3.tar.gz sudo mv hadoop-3.1.3 /usr/local/hadoop设置环境变量添加到~/.bashrc末尾export HADOOP_HOME/usr/local/hadoop export PATH$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin export HADOOP_CONF_DIR$HADOOP_HOME/etc/hadoop export JAVA_HOME/usr/lib/jvm/java-8-openjdk-amd64使配置立即生效source ~/.bashrc核心配置文件修改hadoop-env.shecho export JAVA_HOME/usr/lib/jvm/java-8-openjdk-amd64 $HADOOP_HOME/etc/hadoop/hadoop-env.shcore-site.xmlconfiguration property namefs.defaultFS/name valuehdfs://localhost:9000/value /property property namehadoop.tmp.dir/name value/tmp/hadoop-tmp/value /property /configurationhdfs-site.xmlconfiguration property namedfs.replication/name value1/value /property property namedfs.namenode.name.dir/name value/tmp/hadoop/dfs/name/value /property property namedfs.datanode.data.dir/name value/tmp/hadoop/dfs/data/value /property /configurationmapred-site.xmlconfiguration property namemapreduce.framework.name/name valueyarn/value /property /configurationyarn-site.xmlconfiguration property nameyarn.nodemanager.aux-services/name valuemapreduce_shuffle/value /property property nameyarn.nodemanager.env-whitelist/name valueJAVA_HOME,HADOOP_COMMON_HOME,HADOOP_HDFS_HOME,HADOOP_CONF_DIR,CLASSPATH_PREPEND_DISTCACHE,HADOOP_YARN_HOME,HADOOP_MAPRED_HOME/value /property /configuration4. HDFS初始化与集群启动格式化HDFS文件系统仅首次需要hdfs namenode -format启动HDFS和YARN服务start-dfs.sh start-yarn.sh验证服务是否正常启动jps正常应看到以下进程NameNodeDataNodeResourceManagerNodeManagerSecondaryNameNodeWeb管理界面访问NameNode: http://localhost:9870ResourceManager: http://localhost:80885. 运行WordCount验证环境创建测试目录并上传文件hdfs dfs -mkdir -p /user/hadoop/input hdfs dfs -put $HADOOP_HOME/etc/hadoop/*.xml /user/hadoop/input运行WordCount示例hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.3.jar wordcount /user/hadoop/input /user/hadoop/output查看结果hdfs dfs -cat /user/hadoop/output/*常见问题排查问题现象可能原因解决方案无法访问Web界面防火墙阻止sudo ufw disable临时关闭防火墙DataNode未启动多次格式化导致UUID不一致删除/tmp/hadoop*目录后重新格式化内存不足默认配置过高修改yarn-site.xml中的内存参数6. 日常管理与维护服务启停命令# 启动所有服务 start-all.sh # 停止所有服务 stop-all.sh # 单独启停组件 hadoop-daemon.sh start|stop namenode hadoop-daemon.sh start|stop datanode yarn-daemon.sh start|stop resourcemanager日志文件位置NameNode日志: $HADOOP_HOME/logs/hadoop-hadoop-namenode-*.logDataNode日志: $HADOOP_HOME/logs/hadoop-hadoop-datanode-*.logYARN日志: $HADOOP_HOME/logs/yarn-hadoop-*.log性能优化建议调整JVM堆内存大小hadoop-env.sh合理设置HDFS块大小dfs.blocksize配置MapReduce任务内存参数mapred-site.xml启用压缩减少IO开销7. 进阶配置与扩展启用历史服务器 在mapred-site.xml中添加property namemapreduce.jobhistory.address/name valuelocalhost:10020/value /property property namemapreduce.jobhistory.webapp.address/name valuelocalhost:19888/value /property启动历史服务器mr-jobhistory-daemon.sh start historyserverHDFS快照功能hdfs dfsadmin -allowSnapshot /user hdfs dfs -createSnapshot /user my_snapshot安全模式操作# 进入安全模式 hdfs dfsadmin -safemode enter # 离开安全模式 hdfs dfsadmin -safemode leave # 检查状态 hdfs dfsadmin -safemode get在实际项目中伪分布式环境适合开发测试阶段使用。当需要处理更大规模数据时可以考虑迁移到完全分布式集群环境。

相关新闻

最新新闻

用最强AI写开题报告反而容易被打回?2026AI工具实测:分阶段选直接抄作业

用最强AI写开题报告反而容易被打回?2026AI工具实测:分阶段选直接抄作业

又到开题季,后台被问爆了:“ChatGPT写的开题报告导师说文献是假的”“DeepSeek写出来的东西全是口水话”“格式改了八遍还是不对”…… 说实话,2026年了,AI工具早就不是"一家通吃"的局面。通用大模型、垂直学术工具、校…

2026/8/28 0:44:06
本科论文查重率和ai率多少合格?万方AIGC检测要求怎样按学校通知判断

本科论文查重率和ai率多少合格?万方AIGC检测要求怎样按学校通知判断

本科论文查重率和ai率多少合格?万方AIGC检测要求怎样按学校通知判断 本科论文进入提交阶段,最常见的误区是从网上抄一组“查重率和AI率合格数字”,再去找符合数字的万方结果。不同学校、学院、专业和届次可能采用不同要求,检测范…

2026/8/28 0:44:06
数学建模竞赛数据处理全流程:从Pandas清洗到特征工程实战

数学建模竞赛数据处理全流程:从Pandas清洗到特征工程实战

1. 项目概述:为什么说数据处理是数学建模的“胜负手”?干了这么多年数学建模,带过不少队伍,也评过不少竞赛论文,我最大的感触就是:数据处理这一步,直接决定了你模型的上限,也决定了你…

2026/8/28 0:44:06
从全量微调模型中提取增量参数:原理、实践与工具指南

从全量微调模型中提取增量参数:原理、实践与工具指南

1. 项目概述:从“全量”到“增量”的参数管理艺术在大型语言模型(LLM)微调的实践中,我们常常面临一个看似简单却至关重要的需求:如何将我们辛辛苦苦训练得到的“增量知识”与庞大的“基座知识”进行有效分离与独立发布…

2026/8/28 0:44:06
蓝桥杯Python国赛备战指南:从环境搭建到题型解析的实战经验

蓝桥杯Python国赛备战指南:从环境搭建到题型解析的实战经验

1. 项目概述:一次真实的国赛实战复盘去年,我作为指导老师,带着几个学生完整经历了第十四届蓝桥杯大赛青少组Python中级组的国赛在线考试。这不仅仅是一次比赛,更像是一个系统工程,从赛前准备、环境调试到临场策略&…

2026/8/28 0:44:06
从避坑到定稿:2026文献综述AI工具选型与分阶段组合工作流全攻略

从避坑到定稿:2026文献综述AI工具选型与分阶段组合工作流全攻略

又到开题季。后台最近被问得最多的一个问题是:“学长,文献综述到底用哪个AI写才不翻车?” 这个问题我太有发言权了。去年我自己写硕论综述的时候,曾把某通用大模型生成的一段话直接放进初稿,导师随手翻了翻参考文献列表…

2026/8/28 0:39:05