b2科目四模拟试题多少题驾考考爆了怎么补救
b2科目四模拟试题多少题 驾考考爆了怎么补救

分布式存储和分布式计算

电脑杂谈  发布时间:2020-04-27 09:20:34  来源:网络整理

云计算分布式_分布式云计算_网络与分布式计算方向

(1)Apache Hadoop

Hadoop是一个大数据处理框架,可用于从单个服务器到数千个服务器群集的存储和计算服务. Hadoop分布式文件系统(HDFS)提供了可跨越多台计算机的大数据存储服务,而MapReduce提供了并行处理框架. 他们的想法来自Google的MapReduce和Google文件系统(GFS)论文. 详细查看:

(2)Apache Ambari

Ambari是一个基于Web的系统,用于监视和管理Hadoop集群. 当前,支持HDFS,MapReduce,Hive,HCatalog,HBase,ZooKeeper,Oozie,Pig和Sqoop. 详细查看:

(3)Apache Cassandra

Cassandra是一个分布式NoSQL. 它基于多主机模式,没有单点故障,并且具有可伸缩性. 它最初是由Facebook开发的,用于存储简单格式的数据(如收件箱),后来又开放了源代码,它被用于Twitter等知名网站. 详细查看:

(4)Apache Hive

Hive是一个数据仓库工具网络与分布式计算方向,可以将结构化数据文件映射到表中,并提供像HiveQL这样的查询语言(如SQL)来管理这些数据. 详细查看:

(5)Apache Pig

Pig是基于Hadoop的大数据分析平台,它提供了一种称为PigLatin的高级语言来表达大数据分析程序. 详细查看:

(6)Apache Avro

Avro是一个数据序列化系统. 它提供了丰富的数据结构类型,快速读取的可压缩二进制数据格式,用于存储持久性数据的文件容器网络与分布式计算方向,远程过程调用等. 详细信息:

(7)Apache Chukwa

Chukwa是用于监视大型分布式系统的数据采集系统. 它建立在Hadoop的HDFS和Map / Reduce框架的基础上,并包含一系列灵活而强大的工具集,用于数据监视,分析和显示. 它为日志系统提供了一套完整的解决方案. 详细查看:

(8)Apache Drill

Drill是一个用于数据集交互分析的分布式系统. 它是Google Gremel的开源实现. 详细查看:

(9)Apache Flume

分布式云计算_网络与分布式计算方向_云计算分布式

Flume是高度可靠的分布式日志收集,聚合和传输系统. 它来自Cloudera开发的日志收集系统. 详细查看:

(10)Apache HBase

HBase是一个分布式的,面向列的. 它提供了基于Hadoop的类似BigTable的功能. 详细查看:

(11)Apache HCatalog

HCatalog是基于Hadoop的数据表和存储管理服务,可提供更好的数据存储抽象和元数据服务. 详细查看:

(12)ApacheMahout

Mahout是机器学习领域中的经典算法库,提供聚类,分类,推荐过滤,频繁的子项挖掘等. 详细信息:

(13)ApacheOozie

Oozie是一个工作流调度系统,用于管理Hadoop中的作业. 它可以将多个Map / Reduce作业组合成一个逻辑工作单元,以实现指定的目标. 详细查看:

(14)Apache Sqoop

Sqoop是Hadoop与关系之间的数据传输工具. 关系中的数据可以导入到Hadoop的HDFS中,HDFS中的数据也可以导入到关系中. 详细查看:

(15)Apache ZooKeeper

ZooKeeper是用于大型分布式系统的可靠协调系统,提供的功能包括配置维护,名称服务,分布式同步和组服务. ZooKeeper用于Hadoop管理. 详细查看:

(16)Apache Giraph

Giraph是高度可扩展的迭代图处理系统. 现在,它用于分析Facebook中用户的社交关系. Giraph等同于Google图形处理架构Pregel的开源版本. 详细查看:

(17)ApacheAccumulo

Accumulo是一种可靠的,可扩展的,高性能的分类分布式Key-Value存储解决方案. 它基于Google的BigTable设计思想. 详细查看:

云计算分布式_分布式云计算_网络与分布式计算方向

(18)Apache S4

S4是用于流数据的可扩展的分布式实时处理框架. 它最初是由Yahoo开发和开源的. 类似于Twitter的Storm. 详细查看:

(19)Apache Thrift

Thrift是跨语言服务开发框架. 使用它可以使您的服务支持多种语言的开发,并使用代码为其定义的IDL定义文件自动生成服务代码框架. 它最初由Facebook开发并开源. 详细查看:

(20)黑斑羚

Impala使用与Hive相同的元数据,SQL语法,ODBC驱动程序和用户界面(Hue Beeswax),因此在使用CDH产品时,批处理和实时查询的平台是统一的. 当前支持的文件格式是文本文件和序列文件(可以将它们压缩为性能最佳的Snappy,GZIP和BZIP). 正式版本将支持其他格式,例如Avro,RCFile,LZO文本和Doug Cutting的Trevni. 官方测试速度是Hive的3〜90倍. 详细查看:

(21)Nutch

最后,我不得不提到Apache Nutch开源Web搜寻器系统. Hadoop最初诞生于Nutch服务,该服务为大型Web搜寻器系统提供分布式存储和计算服务. 详细查看:

说明:

开源搜索引擎工具: Lucene,Nutch,Solr.

3. Hadoop应用场景

美国著名技术博客GigaOM的专栏作家德里克·哈里斯(Derrick Harris)多年来一直跟踪云计算和Hadoop技术. 他还在最近的文章中总结了10种Hadoop应用场景,如下所示:

(1)旅行

您知道吗,目前全球80%的旅游网站都在使用Cloudera提供的Hadoop发行版,其中包括Expedia,后者之前由SearchBI报告.

(2)移动数据

Cloudera运营总监表示,美国70%的智能手机数据服务均受Hadoop支持,也就是说,包括无线运营商的数据存储和数据处理,全部都使用Hadoop技术.

(3)电子商务

网络与分布式计算方向_云计算分布式_分布式云计算

这种情况应该可以肯定,eBay是最大的从业者之一. 国内电子商务公司在Hadoop技术上也有大量储备.

(4)能源开采

美国雪佛龙公司是​​美国第二大石油公司. 他们的IT部门主管介绍了雪佛龙在使用Hadoop方面的经验. 他们使用Hadoop收集和处理数据. 这些数据是海洋的地震数据,因此他们可以找到它们. 石油矿的位置.

(5)节能

另一家能源服务提供商Opower也正在使用Hadoop为消费者提供节电服务,包括对用户电费的预测分析.

(6)基础架构管理

这是一个非常基本的应用方案. 用户可以使用Hadoop收集和分析来自服务器,交换机和其他设备的数据.

(7)图像处理

启动公司Skybox Imaging使用Hadoop来存储和处理图像数据,并检测从卫星拍摄的高清图像中的地理变化.

(8)欺诈检测

在这种情况下,用户联系较少,这是金融服务或政府机构通常使用的. 使用Hadoop存储所有客户交易数据(包括一些非结构化数据)可以帮助组织发现异常的客户活动并防止欺诈.

(9)IT安全性

除了管理企业IT基础架构之外,Hadoop还可以用于处理机器生成的数据,以识别来自恶意软件或网络的攻击. <​​/ p>

(10)医疗保健

Hadoop也用于医疗行业. 与IBM一样的Watson将使用Hadoop集群作为其服务的基础,包括诸如语义分析之类的高级分析技术. 医疗机构可​​以使用语义分析为患者提供医护人员,并协助医生更好地诊断患者.

三,纱

我记得1.5年前第一次接触Hadoop的时候. 当时,Hadoop 2.X版本尚未发布,Spark并不像现在这样炙手可热. 现在Hadoop 2.X已经使用了将近一年,开源软件的开发速度非常惊人. 过去,Hadoop学习相对分散且不够系统化. 现在,我们决定系统且深入地学习Hadoop. 掌握软件的本质,即软件的工作原理和设计理念,不要紧跟潮流,必须深入研究开发,运行和维护,而不是一味地追逐新产品,进行重复的安装,安装等工作. 卸载. 简而言之,为HDFS和MapReduce奠定坚实的基础,并根据需要逐步学习整个Hadoop生态系统.

网络与分布式计算方向_云计算分布式_分布式云计算

Hadoop 2.X中最大的变化当然是资源管理器YARN或Hadoop操作系统. YARN是适用于Hadoop 2.0及更高版本的下一代群集资源管理和调度平台. 它支持多种计算框架,不仅支持MapReduce计算框架,还支持流计算框架,图形计算框架,实时/内存计算框架等. 扩展了Hadoop的使用场景,提高了Hadoop集群的利用率.

说明:

除了YARN,群集资源管理和调度平台还包括Corona和Mesos.

四个DRCP(分布式推荐计算平台)

1. 简介

DRCP是基于Mahout的分布式机器学习平台,其功能为分布式存储和分布式计算,用于科学研究和学习.

2. 拓扑

3. 软件

(1)jdk-1.7.0

(2)hadoop-0.20.2

(3)mahout-0.5.0

(4)ubuntu-12.04

五,开发与维护

最近,在实验室中建立了一个4 Hadoop集群,并在其上部署了分布式机器学习Mahout软件. 我们的目的主要是制定一个大数据推荐算法并提供一个生产平台. 当然,仅4个Hadoop群集是不够的,将来会考虑进行升级. 通过这个真实的生产平台,可以改善MapReduce应用程序开发功能,Hadoop和Mahout辅助开发功能以及Hadoop操作和维护功能(调整). 我们计划在DRCP上开发我们的大数据推荐算法类库-Conquer. 我们将集成一些经典的推荐算法,机器学习算法等,并将我们的研究结果整合到MapReduce中,然后将其开源.

1. DRCP升级

2. DRCP的运营与维护

参考文献:


本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-190567-1.html

    相关阅读
      发表评论  请自觉遵守互联网相关的政策法规,严禁发布、暴力、反动的言论

      热点图片
      拼命载入中...