b2科目四模拟试题多少题驾考考爆了怎么补救
b2科目四模拟试题多少题 驾考考爆了怎么补救

几种常用的元数据管理解决方案

电脑杂谈  发布时间:2020-05-25 21:18:39  来源:网络整理

缔元信大数据_缔元信数据沙龙_元数据

元数据的定义为: 描述数据的数据,有关数据的描述性信息和信息资源.

元数据是描述其他数据(有关其他数据的数据)或用于提供有关资源的信息的结构化数据的数据. 元数据是描述诸如信息资源或数据之类的对象的数据. 其目的是: 确定资源;评估资源;跟踪资源使用的变化;实现对大量网络数据的简单高效管理;实现信息资源的有效发现,查找,整合组织并有效管理资源的使用.

当前有几种常见的元数据管理解决方案: 中央节点管理元数据,分布式管理元数据和无元数据设计;本文讨论了三种方案的特点:

1.jpg

1. 中央节点管理元数据

在设计分布式(存储)系统时,使用中央节点是一个非常简洁明了的解决方案. 中心节点通常具有元数据存储和查询,集群节点状态管理,决策和任务分配的功能. ;

元数据_缔元信大数据_缔元信数据沙龙

好处:

A. 由于其元数据集中管理的特性,它可以轻松处理集群运维管理的统计分析需求;

B. 中央节点记录用户数据(即元数据)的状态信息. 在扩展过程中,您可以选择不执行重新平衡操作(由重新平衡引起的数据迁移可能会带来巨大的性能开销),并且您仍然可以正常搜索. 地址;

缺点和解决方案:

a. 单点故障是设计分布式系统中最忌讳的问题之一. 中央节点的简单设计也带来了这个问题. 如何实施医管局? 解决方案: (1)使用主从模型,使用同步或异步方法在主和备用(例如TFS,mfs,HDFS2.0等)之间同步增量或完整数据. 在主备共享存储之间(例如HDFS2.0,远程存储需要高可用性);

b. 性能和容量扩展有上限,而集中式中央节点的硬件设施中的扩展和查询寻址也有上限,这会导致此问题. 即使客户端缓存元数据或使用缓存集群,它也基本上不能消除上限. 在某些情况下(例如海量的小文件),此问题仍然存在. 解决方案: (1)优化和升级硬件,例如使用SSD,大内存等; (2)遇到此问题时,请考虑使用分布式管理元数据解决方案.

元数据_缔元信数据沙龙_缔元信大数据

2. 分布式管理元数据

类似于中央节点方案,除了元数据被分片并且使用分布式节点来管理和存储. 在保留中央节点方案的优点的同时,解决了性能和容量扩展上限的问题. 同时,多个节点提供元数据查询服务,系统性能得到提高;

缺点

这类系统相对较少,系统本身结构复杂,也难以实现;

a. 该系统包含两个相对独立的分布式节点: 元数据节点和数据节点,它们都是状态节点. 由每种类型的节点组成的分布式模块必须面对分布式CAP原则的权衡. 可扩展,尤其是元数据对一致性有更高的要求;

b. 元数据节点需要共同维护数据节点的状态,并在状态变化时做出一致的决定;这些都给系统的设计和实现带来了巨大挑战;

缔元信数据沙龙_元数据_缔元信大数据

c. 另外,大量元数据所需的存储设备也是不可忽视的成本;

以上两种方案有一个共同的想法: 记录并维护数据(即元数据)的状态,在对数据进行寻址之前查询元数据服务器,然后访问实际数据;

3. 没有元数据的设计

主要以ceph为例,这与以上两个思想不同. 这种系统的主要思想是: 使用一种算法来计算寻址. 寻址算法的输入参数之一是集群状态(例如数据节点分布拓扑,权重,过程状态等),此类常见算法是一致哈希,Ceph RADOS CRUSH算法,这种类型的算法通常不直接管理用户数据,但引入了逻辑分片结构的中间层(例如一致的哈希环段,ceph的放置组),它具有较大的粒度,数量有限且相对固定,并且用户访问的数据属于唯一一个的碎片. 系统通过管理和维护这些分片来管理和维护用户数据;某些系统还具有中央配置管理节点(例如ceph rados监视器),该节点仅提供对重要状态(例如集群和碎片)的管理和维护元数据,而不提供元数据存储查询;

好处:

A. 如上所述,系统仅需要管理和维护诸如逻辑分片和集群状态之类的信息,而无需存储用于管理用户数据的元数据. 系统的可伸缩性得到了极大的增强,这在大量元数据场景中尤为明显. ;

缔元信数据沙龙_元数据_缔元信大数据

B. 寻址算法所需的参数数据量很小且相对固定. 客户端可以通过缓存达到并行寻址多个客户端的目的,避免了寻址性能的瓶颈;

缺点分析:

a. 当集群扩展时(即使权重发生变化),也需要进行重新平衡,尤其是对于具有大数据规模(PB级以上)的集群. 随之而来的大量数据迁移使群集处于高负载状态. 反过来,诸如正常业务请求的延迟和iops之类的绩效指标也降低了;但是,在某些情况下,执行群集扩展时,不希望重新平衡(例如群集容量不足);为此元数据,通用策略是为每个集群预先执行性能和容量评估,当需要扩容时,直接创建一个新集群;如果必须重新平衡单个群集,请通过手动干预限流来降低群集负载;至于重新平衡的根本原因,我认为扩展会导致集群状态发生变化,进而导致寻址算法的结果发生变化,最终的数据分配也需要相应地发生变化;

b. 数据的副本分发的位置由寻址算法计算. 该位置是相对固定的,几乎不能由人来调整;但是,通常可以通过更改权重来更改数据的总体分布;

c. 中央配置管理节点仅管理分片信息,不知道各个用户数据的信息. 需要通过定期收集数据节点信息等并进行存储和维护来实现统计分析的需求.

总结: 通过以上比较分析,三种类型的系统的寻址策略使系统本身具有自己的优点和缺点. 它们不是完美的,但是它们都有适合的方案和服务. 在系统设计和选择中,当您键入内容时,您需要做全面的考虑.


本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/tongxinshuyu/article-222077-1.html

    相关阅读
      发表评论  请自觉遵守互联网相关的政策法规,严禁发布、暴力、反动的言论

      热点图片
      拼命载入中...