
第34卷第12期电子工程师V01. 34 2008年12月12日,电子工程师2008年12月,高性能Radix-4 FFT蝴蝶运算单元陈美梅,朱恩(东南大学射频与光电集成电路研究所,江苏南京210096)摘要: 基于台积电(台湾集成电路制造公司)0.18“ m CMOS工艺库,设计了高性能基数4FFTr(快速傅立叶变换)蝶形运算单元,并对其结构进行了研究和改进. 结合了流水线技术和并行结构的特点,使用时序控制的循环序列处理由IEEE 754单精度浮点数组成的复数,与传统的radix-4FFTr蝶形运算单元相比4的蝶形运算,可以节省75%的乘法器逻辑资源和72.7%的加法器逻辑逻辑综合与布局综合报告显示核心面积为1.12 mm2,仿真结果表明该系统可以工作. k在200 MHz时钟下稳定,输出数据精度高. 设计的速度,准确性和面积均达到设计指标. 关键词: Radix 4 FFT蝶形运算;管道结构;并行模式循环序列. 中文数字分类号: TN911.720简介FFT(快速傅立叶变换)是数字信号处理领域的核心算法之一. 蝶形运算单元是FFT设计的核心单元. 本文研究了radix-4 FFT蝶形运算单元的芯片设计.

基于台积电(台湾集成电路制造公司)0.18 p. m CMOS标准单元库半定制ASIC(专用集成电路)设计,使用自上而下的[2]设计方法,将关键模块作为设计对象,使用Vefilog HDL描述系统,在EDA中使用Modelsim,Design Compiler和ASTRO(电子设计自动化)工具已完成. 1基4 FFT蝶形运算单元的设计蝶形运算单元是FFT处理器的核心单元. 蝶形运算单元结构的稳定性和运算的准确性直接影响FFR处理器的性能. 分析基础. 4考虑到面积,性能和功耗的所有方面,FFT的特性,设计了一种将流水线技术与并行结构相结合的蝶形运算单元. 1.1蝶形算术单元的结构设计基1 FFTr中蝶形算术单元的处理结构如图1所示. -I·1图1蝶形算术单元的信号流程图传统的base-4算法由3个复数乘法器组成和12个复数加法器'4 |,每个复数乘法器由4个实数乘法器组成. : 2008-06-30;修订日期: 2008-09-03. ·实现了40和2个实数加法,每个复数加法由2个购买效应加法器实现. 以此方式,消耗了大量逻辑资源(12个实数乘法器和22个实数加法器)以将base-4算法的计算结构直接映射到硬件. 重排如下: A'= A(后)+ B(忌)+嘴c(chu)+噼D(1j})B'= A(抽屉)-jlr sB(k)-yin c(后退) + jw He D(||))c'= A(后)-w碟B(后)+ w hip c(后)-w7等D(后)D'= A(七)+ jW'NB( Last)一个w c(I |})一个jw D(. |})其中: A,B,C,D是复数操作数; A',B',C',D'是主要基础4次蝶形运算的结果;噼,口和噼是base_4蝶形运算中涉及的旋转因子.

让A =髫+ jx,B = Y + jY,C =“ + ju,D =彳+ jz,bank = cos(2,rmk / N)-jsin(2'rrnk / N);然后A ',B 7,c',D'可以表示为: A 7 = mushroom'+ jx 7,B'= Y'+ jY',C'= M'+j∥,D'=彳'+ jz'其中: Ming = =叔叔+ b等. 大陆n等. )+(... s警报+n等. )+(一次怀孕+ zsin等. )耻辱蘑菇+(№等-ysin等. )+(‰s等一心n等)+(zcos等-zsin等)y'= X +(№等-ysin等)一(... s怀孕+跳跃n等等)一等一等一等)万方数据卷34第12期陈美梅等: 高性能base-4 Ff-r蝶形运算单元·信号处理和显示技术·Bu x-( ycos等)-(‰,单心,n等)+(一流+ zsin等)erru一个(脚s等,n等)+(... s,等(+等))一个(山s2可以在rrk3坛等)聋人一个(№等敲入等)+(‰等心n等)一个(大号Wait- zsin等)的孩子x个(№2百7rkl-ysin 2百“ a'kt)一个(... s等. + heart n等. )+(Suns.in2. Baidingrk3)Hong x +(转到s等n等)一(‰等. 一颗心n等)一颗(可用彳COS 2,trk3 + zsin等. )观察Mushroom 7和Ⅱ',X 7和U7,Y'和,',Y'和Z'公式的表达式,发现括号中对应的实部和虚部相同. 因此,可以将流水线方法和并行结构的思想巧妙地结合起来,并使用4个循环序列严格控制每个寄存器的时序,仅使用1个实数乘法器即可实现复数乘法器,对应于3个不同的复数并行进行3个实数乘法的数乘法;加法器也#行{并行循环符. C我can. 考虑到只有一个4FFT蝴蝶云计算单元仅需要3个实数乘法和6个实数加法. 与传统的base-4 FFT蝶形运算单元相比,它可以节省75%的乘法器逻辑资源和72.7%的加法器逻辑资源.

蝶形运算单元的结构如图2所示. 根据粥,一个A“ Re hn”变换,婚姻,数字,,北方国家,近处. hit :. hli)隅{』J Chuan}换小牛的刀,zxRe.Good hu)直mother太监: Zha}根据标题Wu Wuer 712一一-. _一图2将管道结构与并行模式1.2数据交换单元将流水线技术与并行结构相结合的方法可以提高设计灵活性,减小核心单元的面积,并提高芯片操作的速度. 流水线技术与并行结构的结合必须在严格的时序控制,数据切换单元由状态机组成,以蝶形运算单元的第一级数据切换单元为例,每组数据输入乘法器分为4种状态(分别为A,B,c, D). 状态A输入多数的实部iplier和旋转因子的实部;状态B输入乘数的实部和旋转因子的虚部;状态c输入乘数的实部,旋转因子的虚部和实部;状态D输入乘数的虚部和旋转因子的虚部. 根据上一级计算结构的输出,以类似方式获得其他三级数据切换单元的输出. 每个阶段的具体结果和步骤请参见表1. 完成4级操作后,将并行输出结果的实部和虚部. 表1各分类模块每次输出的结果·4l·万芳数据·信号处理与显示技术·电子工程羽毛球2008年12月1.3浮点乘数的计算本设计中的浮点乘数需要完成两个IEEE 754单精度浮点数之间的乘法,包括3个部分尾数乘法,指数加法和符号处理.

浮点乘法器的结构如图3所示. -称为Lankenwang预处理单元,一个格式化电路-恒定躺卧式水Lili bu图3浮点乘法器的框图乘法处理可分为3个步骤: a)输入数据执行预处理,即确定输入中是否为0,并将输入数据的符号位,指数部分和尾数部分分开进行处理,注册符号位,添加指数部分,并对尾数部分进行预处理: b)23位将由尾数和l位隐藏位“ l”组成的24位有效数字发送到定点乘法器进行运算,并进行预处理的其他输出数据单位已注册; c)接收定点乘法运算结果和相关的寄存器输出,并指定最终结果转换为IEEE 754标准单精度浮点格式. 24位定点乘法器将经典的数组结构与改进的Booth算法的树结构结合使用. 阵列型定点乘法器具有规则的结构,适用于流水线处理,但是流水线深度过深,初始延迟过长,硬件资源消耗过大. 改进的Booth算法将24位定点乘法运算的部分乘积从24压缩到13,从而减少了硬件开销并减少了流水线级数. 使用改进的Booth算法设计旧的Wallace树结构,如图4所示. 第一阶段的管道,第二阶段的管道,第三阶段的管道,Amao Xiao-翟景义●●●'124位快速敏感加法器S图4具有三级4: 2压缩的Wallace树结构4: 2压缩器设备71将13个部分乘积逐级压缩到2级,在级之间插入寄存器以实现完整流水线,压缩后的2快速加法器将部分乘积相加以获得最终结果.
4: 2压缩器的逻辑结构如图5所示,它由级联的4: 2压缩单元组成. “ I,pI” 231 II,肿胀的IU4加l“ lm202,” Paq Pa“ 1I,吒¨” 1Ilq¨(j〜. ('ml gas: 0≮图5 4: 2压缩机的逻辑结构可以将并行全加法器的逻辑简化为4: 2压缩单位,其逻辑表达式如下: S =口l①n20口3①口4 0 ci. C =(nl①020口3①04)·ci. 4 -(a1①a2④口3①a4)·04C.t =(口1①a2)·03 +(口1①a2)·口I改进结构设计的定点乘法器流水线深度只有7级,降低了硬件成本,降低了流水线的初始延迟提高了系统性能1.4浮点乘法器4的改进分析: 输入端口可以找到2个压缩器的逻辑表达式. 这时,输出c. 相同;当输入o. ,o :, a ,, n. 和ci. 当输入相同时,输出s和C相同,然后分析Booth算法. 展位编码是有符号数的乘积,符号位需要扩展和移位;两个24位定点数相乘得到一个48位乘积,因此所得的部分乘积具有相同的符号位,范围从2位到24位. 在Wallace树的形状结构中,添加了通过Booth算法获得的13个48位部分乘积,而只需要添加其中的25位. 其他23位可以直接分析以获得总和并进位.
每个乘法器可节省70个4: 2压缩器,减少关键路径时间,并提高乘法器的执行速度. 1.5浮点加法器设计浮点加法器包括数据预处理电路,26位加法器和浮点数格式化处理,采用流水线技术,见图6. 一黑I-Al隐藏的Yingi’L-. —. . —————. Jr ————-——————_ 1 1在±I处的6小时: 例如l仅2个!一个■Liyan I被称为-i26 h Napian Pi: | = lan = i_古墓喧i;峰值数移位电路I : : E!兰竹兰宝: l;浮点加法的处理步骤如下: a)数据预处理部分4的蝶形运算,包括零判断电路,如果加数之一为0,则加法的输出结果应与另一个加数相等. 指数对齐;尾数移位以实现尾数补码和隐藏位“ 1”扩展和符号位扩展. 万方数据卷34 No. 12 Chen Meimei等人: 高性能base-4 FFr蝶形运算单元. 信号处理和显示技术. b)使用进位保留和进位传输的组合的26位加法器. c)将最终结果重新格式化为IEEE 754标准单精度浮点格式. 26位定点加法器是浮点加法器的核心加法器[s J,此设计使用了高级位和进位保留的组合,如图7所示. 高级位加法器的特点是同时产生所有电平的进位信号,这大大减少了产生进位的时间. 通常,它不超过4位. 因此,将26位分为6 3位块和2 4位块.
其中AF-3和AF_4使用高级位加法器,而26位进位选择加法器仅通过两个流水线阶段就可以达到所需的性能要求. lAF3 AF 3 AF 3AF 3 AF 3IAF 3 AF 3 AF 3 AF 3 AF 3 AF 3 AF 3 AF 4 AF 4 AF 4 AF 41AF 41-Mux-3Mux 3 Mux 3 Mux 3Mux 3Mux 3 Mux 4Mux_4 | Sum 12Sum 14图7改进的26位进位选择加法器1.6浮点加法器的改进在满足时序的情况下,分析了26位快速加法器. 高级位加法器适用于不超过4位的数据,进位保留加法器是速度的区域. 如果使用两级流水线来完成26位加法器,则必须满足时序要求,但这将花费24个AF-3和8个A调用. 基于面积和时序的折衷优化,我们使用以下框图完成了26位加法器. 完成12位进位选择加法器仅需要12个AFj和4个AFj. 2逻辑综合蝶形运算单元结构完成后,使用Verilog HDL进行整个系统的RTL级描述,逻辑综合和功能验证. 本文基于TSMC 0.18 I. Lm CMOS标准单元库,使用Synopsys Design Compiler进行逻辑综合,使用Modsim进行仿真,并与MATLAB计算结果进行比较.
2.1逻辑综合设计目标是200 MHz时钟,设置了20%的余量,因此约束时钟为4 n8,具体约束如下: 时钟周期4 n8,时间抖动和时滞0.1 ns,线路负载型号tsmcl8_w1120 ,输入和输出延迟0.8 118,满足时序时面积最小. 合成后的结果如图8所示. 』Ll; i;◆:::: 2_. tcea-·图8蝴蝶运算单元逻辑综合结果蝴蝶运算单元逻辑综合报告显示关键路径延迟3.4 Lu
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-289347-1.html
但国家面子更重要
今天股票军工股长势喜人
把南方公司黑急了