
【IT168专题】清华大学在高性能计算领域享有很高的声誉,因为清华大学不仅拥有国内大学最大的高性能计算系统之一,而且还培养了大量并行计算能力. 计算人才. 高性能计算软件不仅有许多研究成果,还拥有国家863计划高性能计算机评估中心.
几天前,来自IT168服务器频道的记者采访了清华大学计算机系副主任,863计划高性能计算机评估中心副主任陈文光教授. 陈文光教授在访谈中介绍了清华大学在高性能计算领域的四个作用和工作内容,重点介绍了清华大学在高性能计算的测试和选择中的成就和经验.
▲清华大学计算机系副主任,863高性能计算机评估中心副主任陈文光教授
清华大学在高性能计算领域的四个角色
![]()
如您所知,清华大学在高性能计算领域扮演着许多角色. 它不仅是高性能计算系统的用户单位,还是国家HPC系统评估机构. 当然,它也是高性能计算的教育机构和研究机构. . 那么,在陈文光看来,这四个角色是如何定位和平衡的?
作为教育机构,清华大学是中国顶尖工程师的摇篮. 为了帮助非计算机的学生使用HPC进行研究和创新,清华大学多年来为理科和工程的学生开设了“并行计算”课程,以教授物理,生物学,地球科学和大气科学的学生编写并行应用程序以奠定基础. 将来在工作中使用HPC的基础.
“在科学研究方面,我们主要将自己定位为高性能计算系统软件的研究单位. ”陈文光说,虽然清华早在1990年代就已经开始研究和开发集群架构并行计算机硬件系统,但是2000年以后,随着系统的规模越来越大,大学无法承担如此的工程任务. ,因此他们开始将研究重点放在关键的前瞻性技术上,例如HPC所需的系统软件. 帮助用户和行业解决高可用性机制,并行程序调试和性能分析等难题.
但是,作者这次最关心的不是HPC研究,而是作为用户和国家863计划高性能计算机评估中心的清华大学积累的HPC测试和选择经验.
“作为用户,清华大学本身对高性能计算有强烈的需求. 我们已经拥有国内大学中第二大高性能计算机,仅次于国防大学. ”陈文光告诉记者,清华大学新增了1000亿次高性能计算,主要用于开展全球气候变化预测研究项目. 当中国向全球气候变化委员会(IPCC)提交跟踪研究报告时,今年的清华大学高性能计算中心将发挥重要作用. 其次,该机器还将用于生物学,计算化学,材料科学等领域,例如扫描电子显微镜在生物学中的应用,从不同角度拍摄蛋白质的多个二维照片,然后将其还原为三维蛋白质结构.

自2004年在清华大学建立863高性能计算机评估中心以来,已有7年的历史: “我们已经帮助中国30多台大中型高性能计算机进行了测试和发现, “很多软件和硬件问题. 例如驱动程序不匹配,网卡故障,内存故障等. ”陈文光说,在这些测试过程中,该中心逐渐确立了“面向应用”的评估思想,并形成了“自下而上”的思想,逐层一系列成熟和先进的评估方法系统,例如“模型”和“评估”.
由于大型计算机的软件和硬件级别特别复杂,节点数很大,并且规模也非常大,因此有必要通过的测试服务来发现一些潜在的软件和硬件问题,实现系统优化. 陈文光举例说: “在一次测试中,我们发现某个节点的外部通讯速度比其他节点的通讯速度慢了十倍以上,这是由于电缆松动造成的,这可能使它仅需花费很长时间即可. 一小时执行完成的任务运行了10个小时. 这种问题非常麻烦,只有经过长期的测试和逐层分析之后才能发现.
由于这个原因,863高性能计算机评估中心在测试过程中积累了这样的一套评估方法: 自下而上,逐层建模. 也就是说,从系统的底部开始,通过为每个层建立性能模型以预测每个层的正常运行时间,并根据比较结果将其与测量数据进行比较,以确定HPC系统是否存在问题.
陈文光说,首先,在底层,通过对等通信,CPU执行速度,内存带宽等测试,可以发现一些故障,例如节点间通信或速度较慢. CPU速度,然后与其他节点进行比较以识别问题;最重要的是,进行诸如聚合通信(MPI广播,Alltoall等)之类的测试,并将测试结果与理论推论进行比较;然后,以内核基准测试为例,例如在NPB中计算FT程序并测试流量,然后将测得的数据作为性能参数进一步输入到性能模型中,以预测正常系统的性能并将其与实际情况;最后,对包含许多算法,数据和通信的实际应用程序进行了测试.
基于上述方法,评估中心为许多用户提供了机器检查和测试服务,重点是回答两个问题: 系统是否完好以及机器配置是否与合同匹配. 在此基础上,清华大学还对几台机器进行了“评估”,即从机器设计之初就参与了整个过程,类似于房地产中的“监督”作用. 行业. 例如,有一个系统. 最初的解决方案提出内存需要8GB,CPU需要高频. 但是,评估中心的分析认为,应根据应用需求将内存增加到16GB,CPU频率不必太高. 一种调整是非常正确的决定.

评估与研究是相辅相成的. 一方面,评估需要研究来支持它. 另一方面,大量评估也将促进研究. 陈文光告诉记者: “评估不是简单的操作. 它需要大量的研究. 根据国际高性能计算学术会议的反馈,我们的评估技术是目前世界上最先进的. ”
HPC选择: 面向应用是第一原则
基于清华大学在HPC领域的多重作用,陈文光已经接触了来自不同制造商的大量高性能计算机. 在高性能计算机选择方面,他认为与评估类似,面向应用程序仍然是最重要的原则.
我们知道,无论是全球TOP500高性能计算机排名还是国内TOP100,Linpack测试值都用于评估机器的性能. 这些排名还为一些用户提供了一些HPC选择. 参考. 陈文光对此提出了不同的看法: 高性能计算机的性能不能简单地用数字来表达!
在陈文光看来,性能是此计算机上运行的一个程序或一组程序的特征. 因此,在性能方面,必须说明两个先决条件,即机器是什么和应用程序是什么. 如果要购买高性能计算机,则不能只看峰值速度或Linpack测试速度,最重要的是看这台计算机上实际应用程序的运行性能.

他告诉记者,在实际情况中,有很多用户,特别是大学的超级计算机中心,高性能计算中心,会有很多应用,可能有几十个或数百个,为此,可以按2: 8原则,在使用机器时选择最重要的应用程序高性能计算机选型,然后选择易于制作小型测试程序的代表性应用程序,然后为这些测试程序提供代表性输入,并在一两个节点或小型节点上进行测试. 最后,通过预测模型对大型系统的性能进行了分析,为选择系统提供性能和配置依据.
陈文光特别强调,对于HPC系统计算模块的选择,业界已经有比较成熟的定量分析方法,但是对于HPC存储和I / O高性能计算机选型,都相对忽略了. 在这方面,清华大学一直在这方面进行研究,对程序的I / O行为进行建模和分析,以找到最佳配置.
HPC Cloud: 还有很长的路要走
谈到如何在虚拟机和云计算平台上提供高性能计算服务时,陈文光认为,还有很长的路要走. 几天前,清华大学还在Amazon EC2上测试了CCI集群虚拟机. 最大的发现是,与本地计算机相比,使用的10 Gb以太网的延迟太大. 通常,本地Infiniband延迟只有一点点. 几微秒,基于10千兆以太网的云平台的延迟达到40-50微秒,“对于对I / O延迟敏感的应用程序,这是糟糕的体验. ”
陈文光对某些超级计算中心也正在转向云平台这一现象持谨慎态度. 他认为,亚马逊在HPC云中的表现相对不错,其他制造商尚未提出非常成熟的解决方案. 与传统的超级计算机中心的运行模式相比,HPC云需要准备一套机制,包括计费,流程,管理等,并且潜在的I / O问题将更加复杂. 因此,超级计算机中心不能简单地购买可以安装一套软件来实现向云平台的转换.
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-169103-1.html
我们家桃子
还有一点没吃过这种芝麻糊不知道的是