
数据存储
是数据结构所在的位置,还是数据流的源和目的地. 它可以是手动文档或计算机文档.
数据存储描述= {数据存储名称,描述,编号,输入源,输出目的地,组成: {数据结构},数据量,存储频率,访问方法}
访问方式: 批处理或联机处理系统概论系统概论,检索或更新,顺序检索或随机检索
处理过程
通常通过决策表或决策树描述流程的特定处理逻辑. 数据字典只需要描述过程的描述性信息.
流程说明= {流程名称,说明,输入: {数据流},输入: {数据流},处理过程: {简要说明}}
简单描述: 主要说明过程的功能和处理要求.
功能: 该过程的作用是什么?
加工要求: 加工频率要求. 例如每单位时间有多少笔交易,多少数据,响应时间要求等.
任务
将在需求分析阶段获得的应用程序信息抽象到信息世界的结构中
概念模型的特征:
真实且能充分反映现实世界
易于理解
易于更改
易于转换为各种数据模型,例如关系,网格,层次结构等.
机器独立于数据模型
方法
E-R模型(实体关系模型)
实体类型: 学生(学生人数,姓名,年龄等)
实体集: 所有学生
实体之间的联系:
单个实体内部连接: ,一对多,多对多.
两种物理类型之间的联系: ,一对多和多对多.
两种以上物理类型之间的联系: ,一对多和多对多.
E-R图片
实心矩形
属性-椭圆
联系人-
ISA联系人-三角形
类别-在三角形的右侧添加文本
根据分类属性将父实体类型的实体分配给子实体类型
不相交的约束-除三角形之外

父类中的实体不能同时属于多个子类中设置的实体
重叠约束-默认
父类中的实体可以同时属于多个子类中设置的实体
完整度约束-完全化-双行
父类中的实体必须是子类中的实体
完整性约束-部分化-单行
父类中的实体不必是子类中的实体
基数约束-最小..最大
是,一对多,多对多的改进. 0 <=最小值<=最大值
min = 1,这意味着强制参与限制
min = 0,表示非强制性参与约束

部分联系人
指示实体类型是另一种实体类型的一部分.
非排他的部分连接-通过整个实体的基数约束min = 0,这意味着部分实体可以在没有整个实体的情况下参与
如果整个实体被销毁,某些实体仍然可以独立存在.

专有的部分连接-由弱实体表示并标识连接
强大的实体类型-不依赖于其他实体类型的存在
实体类型弱-取决于其他存在的实体类型
确定连接-以双菱形表示

UML(略)
步骤
1. 根据划分实体和属性的原则,对需求分析阶段收集的数据进行分类和组织,确定实体,实体的属性以及实体之间的连接类型,从而形成划分后的E-R图
划分实体和属性的原理:
属性不再具有要描述的属性
该属性不能与其他实体联系
2. 划分E-R图以解决冲突以获得初步E-R图;初步的E-R图通过消除冗余来获得基本的E-R图
解决冲突(sub-E-R图->初步E-R图)
财产冲突
冲突类型
属性域冲突(属性值范围或值集不同)
属性值单位(kg和kg)之间的冲突

解决方案: 各部门协商解决
命名冲突
冲突类型
名称相同的同义词(含义不同的对象在不同的本地应用程序中具有相同的名称)
同义词和同义词(具有相同含义的对象在不同的本地应用程序中具有不同的名称)
解决方案: 各部门协商解决
结构冲突
冲突类型
①同一对象在不同的应用程序中具有不同的抽象(有些员工被视为属性,有些则被视为实体)
②不同子系统的E-R图中同一实体的属性数量和属性顺序不同
③不同E-R图中实体之间的连接类型不同

已解决
①遵循划分实体和属性的原则,将属性转换为实体,或将实体转换为属性
②结合所有属性并调整顺序
③

消除冗余(初步E-R图->基本E-R图)
冗余类型
冗余数据: 可以从基本表中导出的数据
冗余联系人: 可以从其他联系人导出的联系人
方法
①①基于数据字典和数据流图,分析数据项之间的逻辑关系以消除冗余

②并非必须消除所有冗余数据和冗余连接. 如果要人为保留一些冗余数据,则应使用数据字典中数据关联的描述作为完整性约束.
③确定E-R图实体之间的数据依赖关系,逐一检查功能依赖关系,确定它是否为冗余连接,如果是,则将其删除
任务
将由概念结构设计的E-R图转换为与所选DBMS支持的数据模型一致的逻辑结构.
步骤
1. 将E-R转换为关系模型
固体类型
实体类型转换为关系模式
1: 1个联系人
可以转换为独立的关系模式(每个实体的代码为候选代码)

它也可以与任一端对应的关系模式组合
1: n个联系人
可以转换为独立的关系模式(代码为n端关系代码)
它也可以与n端的对应关系模型合并
m: n个联系人
转换为关系模式(每个实体的代码构成一个关系代码或部分关系代码)
m: n: p个联系人
转换为关系模式(每个实体的代码构成一个关系代码或部分关系代码)
注意: 具有相同代码的关系模式可以合并
2. 数据模型优化
①识别数据依存关系,消除冗余依存关系,方法与概念模型相同(初步E-R图->基本E-R图)
②确定每个关系模型都属于第一个范式. 标准化程度越高,关系就越好. 需要权衡响应时间和潜在问题的利弊.
③水平分解关系模式: 该关系分为几个子集合. 根据“ 80/20原理”,将经常使用的数据(通常为20%)分解为子关系. 按事务划分,以便每个事务访问的数据对应一个关系
④垂直分解关系模式: 将经常一起使用的属性分解为子关系模式,但必须确保无损连通性并保持功能依赖性.
3. 设计用户子模式
使用视图的注意事项
使用更符合用户习惯的命名方式(视图名称,属性名称等)
为不同级别的用户定义不同的视图
简化用户使用
目的
通过对要运行的事务进行详细分析(获得物理设计所需的参数),充分了解所使用的RDBMS的内部特征(尤其是RDBMS提供的访问方法和存储结构),以及选择关系模式适当的存储方式,同时设计文件的物理存储结构,如关系和索引.
访问方式选择
常用的访问方法是索引方法和聚类方法.
索引方法
B +树索引
查询条件中经常出现一个(组)属性
或(组)属性通常用作聚合函数的参数,例如最大(最小)值
或(组)属性条目出现在连接操作的连接条件中
哈希索引
属性经常出现在等效连接条件中或主要出现在等效比较选择条件中,并且满足以下两个条件之一:
关系的大小是可以预测的,并且没有变化
关系的大小动态变化,但是DBMS提供了一种动态的哈希访问方法
集群方法
概念

集群是指将一些相关数据存储在同一物理块上.
通过集群,一个块可以包含来自多个表的数据
原理
一个可以创建多个集群,并且只能将一个集群添加到关系中.
功能
对现有关系进行聚类将导致该关系中的元组移动其物理存储位置并使所有最初在二级关系上建立的索引失效,并且必须对其进行重建
示例
员工表和部门表. 这两个表存在于不同的段中,甚至可能存储在不同的表空间中,因此它们各自的数据肯定不在同一块中. 同时,我们经常查询employee表. 部门编号=部门表. 部门号,因为查询主要在块上进行,查询的块越多,系统IO越大,效率越低. 将数据收集在少量物理上相邻的块中,查询效率将大大提高.
候选簇选择原则
经常联系在一起的关系
经常出现在平等比较条件中
该属性(组)上的值重复率很高
候选簇的逆向选择原理
全表扫描频繁的关系
删除的连接多于连接
选择多个集群时,将选择在该集群上运行各种事务的总成本最低的集群
使用聚类的原理:
当通过聚类代码进行访问是这种关系的主要应用时,与聚类代码无关的其他访问很少或是次要的,并且可以使用聚类
制定存储结构策略
根据应用,将数据的可变部分和稳定部分,频繁访问的部分和访问频率较低的部分,日志和数据分别存储;
更改系统配置变量和存储分配参数(请参阅各DBMS手册)
物理结构评估(从存储空间,访问时间和维护成本方面进行比较)
数据加载(与应用程序调试同步)
从每个本地应用程序中提取各种源数据,将其输入到计算机中,对其进行分类和转换,最后将其集成为符合新设计的结构的形式,并将其输入到中.
小批量调试数据-用于调试连接
试运行
联合调试系统以测量和评估系统性能指标. 如果测试结果与设计目标不符,则必须重新调整物理结构并修改系统参数.
调试数据-用于性能评估
日常维护
转储和恢复-即备份策略
安全性和完整性控制-即用户权限和完整性约束的更改等.
监督,分析和转换性能-即提高系统性能
的重组和重建
重组-重新安排存储位置,回收垃圾,减少指针链等.
重建-修改的内部模式(物理结构,索引等)和外部模式(逻辑结构,视图等)
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-183716-1.html
哈哈加油
1的不知道要不要升