www.qpyq.net > hADoop 获取集群

hADoop 获取集群

hadoop集群指的是一群机器在一起提供一个hadoop的集群的服务。 hadoop分布式指的是hadoop支持任务分布式运行,因为有hadoop集群提供服务,所以hadoop将任务分发到集群的多台机器运行,所以叫做分布式。 一个是服务器架构,一个是任务运行架构。

单机(本地)模式:这种模式在一台单机上运行,没有分布式文件系统,而是直接读写本地操作系统的文件系统。在单机模式(standalone)中不会存在守护进程,所有东西都运行在一个JVM上。这里同样没有DFS,使用的是本地文件系统。单机模式适用于开...

计算能力调度器介绍 Capacity Scheduler支持以下特性: (1)计算能力保证。支持多个队列,某个作业可被提交到某一个队列中。每个队列会配置一定比例的计算资源,且所有提交到队列中的作业共享该队列中的资源。 (2)灵活性。空闲资源会被分配给那些...

前期准备 l 两台linux虚拟机(本文使用redhat5,IP分别为 IP1、IP2) l JDK环境(本文使用jdk1.6,网上很多配置方法,本文省略) l Hadoop安装包(本文使用Hadoop1.0.4) 搭建目标 210作为主机和节点机,211作为节点机。 搭建步骤 1修改hosts文...

使用ssh工具连接hadoop集群中的任意一台机器执行 hadoop version 命令查看

数据存储可以用webhdfs查看,也就是hdfs的web界面。如果是查看计算部分的,yarn应该是有管理的

在hadoop安装目录bin里:运行./start-all.sh启动集群,jps查看启动状态,会看到namenode..等已启动信息

可以看localhost:50030,里面有每个任务的执行情况 50070是HDFS的存储情况,看不了执行效率

导入数据可以直接用put命令将本地数据上传到HDFS。 如果是数据库里的数据可以使用sqoop将数据导入HDFS。 查询数据可以使用hive,也可以写一些MapReduce程序来处理数据

最好是两个做成HA 关于硬盘: 6T的数据容量,看你副本数量设置是多少,一般默认为3,那么仅这些就需要18T硬盘,稍微大一点20T吧;这仅仅是HDFS存储;(这里我说的是一个月的,你数据保存几个月,就乘几倍) 如果你集群上面要跑计算,MR计算出来的数据要保存H...

网站地图

All rights reserved Powered by www.qpyq.net

copyright ©right 2010-2021。
www.qpyq.net内容来自网络,如有侵犯请联系客服。zhit325@qq.com