
GPGPU(GeneralPurposeGPU)被称为GPU通用计算. 数十年来,根据摩尔定律,计算机CPU芯片发展迅速. 每18个月,每单位芯片面积的晶体管数量就会增加一倍,性能也会提高一倍. 通过增加主频率来提高性能的途径在21世纪初结束了. CPU中有严重的内存墙和功耗墙. 长的存储延迟和低频会导致越来越大的缓存区域以及越来越复杂的逻辑控制. 高速缓存消耗了超过70%的芯片面积,并且消耗了超过70%的电能. 有效计算组件的面积很小. 芯片上晶体管密度的不断提高导致单位面积功耗的持续增加和散热问题的增加.

提高主频是不可持续的. CPU进入了多核时代,在一个封装中放置了多个低频内核. 尽管单核的性能下降了,但总体性能却得到了极大的提高. 多核CPU已从双核演变为四核,八核和十六核. 随着核心数量的增加,核心之间的通信和协作开销也会增加. 整体性能不会随核心数量线性增长,高速缓存的面积不会减少,并且内存墙仍然存在.


GPU计算是指使用图形卡执行常规计算,而不是传统的图形渲染. 如今,GPU已发展成为具有出色的计算能力和极高的内存带宽的高度并行化,多线程,多核处理器.


GPU的卓越性能来自特殊的体系结构. 为了将绝大多数晶体管用于算术单元,而不是将它们浪费在高速缓存和逻辑单元上,GPU采取了多种有效措施. 将核心频率降低到内存频率以下,以解决数据需求和供应速度不匹配的问题;使用极轻量级的线程并使用大量线程快速切换以隐藏内存延迟;简化内核高性能计算应用领域,同一逻辑单元控制多个内核,减小逻辑单元面积.


当前高性能计算应用领域,各个行业的主流软件都在争相采用通用GPU加速. 如分子动力学软件Amber,DL-POLY,Gromacs,LAMMPS,NAMD;量子化学软件GAMESS-US,TeraChem;材料科学软件VASP,PWscf;计算流体力学软件FEFLO;计算结构力学软件ANSYS;电子设计仿真软件CSTMicrowaveStudio;数值计算软件Jacket,Mathematica,MATLAB;数以百计的知名软件已经支持GPU加速,并且正在迅速增加.
GPU加速的特征是: 擅长并行数值运算,逻辑判断和分支跳转会导致性能急剧下降;适用于对相对少量数据进行大量计算,否则将抵消主机与设备之间的数据传输开销GPU加速的好处;计算规模大,并行度高,至少5000个线程;最新的GPU卡需要PCIe3.0接口,而旧的PCIe2.0将使数据传输成为瓶颈. 不同节点上的GPU通信需要高速互连网络;当前许多应用程序软件无法在一个节点上使用多个GPU加速卡,并且不同节点上的GPU无法通信;自编辑软件可以在同一节点上使用多个GPU,最大数量与CPU内核数量相同;当多个GPU通过MPI技术完成一项大型任务时,如果GPU的数量超过8个,则性能将不再显着提高.
鉴于GPU通用计算的特性,Sugon建议使用以下GPGPU高性能计算解决方案:
A: 当使用诸如CSTMicrowaveStudio之类的软件加速该节点的计算时,可以配置大型群集. 计算节点使用灵活的1U机架服务器,例如I6100-G15. 在散热良好的情况下,单个节点配置有两个TeslaM2090;该网络使用高带宽和低延迟的InfiniBandFDR56Gbps网络设备来确保并行可扩展性. 如果使用Sugon paraStore200并行文件系统,则存储可以使用经济高效的磁盘阵列解决方案(小型集群)或高性能并行文件系统;由于GPU功耗很大,因此基础架构采用了Sugon C3000机柜系统,该机柜系统具有水平空气供应和高效的冷却功能.
B: 如果GPU负责应用软件的主要计算,并且该应用软件支持单节点多GPU,则建议计算节点配备密度非常高的Dawning T600刀片,在5U空间中有8个GPU. 网络和存储系统与A相同.
C: 自制的GPU软件: 几乎所有计算都在GPU上完成,您需要在同一节点上使用尽可能多的GPU. 建议配置Sugon W580I塔式交换服务器,在4U空间中包括4个GPU;互联网使用InfiniBandFDR56Gpbs设备.
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-193936-1.html
我
毕竟是有后台的公交
这是赤裸裸的挑衅