面向硬件高效的近似平方根电路错误感知设计方法
《Integration》:An error-aware design methodology for hardware-efficient approximate square root circuits
【字体:
大
中
小
】
时间:2026年09月09日
来源:Integration 2.5
编辑推荐:
• 提出了一种面向分段线性(PWL)近似平方根电路的两阶段、误差感知设计方法。
• 构建了闭式晶体管级成本函数,与分段策略和位宽进行协同优化。
• 在最大相对误差距离(maxRED)目标从10%到0.001%的范围内,实现了五个PASR电路。
• 在硬件和能耗指标方面,与精确
• 提出了一种面向分段线性(PWL)近似平方根电路的两阶段、误差感知设计方法。
• 构建了闭式晶体管级成本函数,与分段策略和位宽进行协同优化。
• 在最大相对误差距离(maxRED)目标从10%到0.001%的范围内,实现了五个PASR电路。
• 在硬件和能耗指标方面,与精确电路及最先进的近似设计进行了对比。
• 通过在灰度基准图像上进行Sobel边缘检测来验证实际保真度。
引言
云计算的迅速扩张引发了对其日益增长的财务成本和能源密集型运营的担忧。边缘计算通过将计算任务分布在本地和远程设备中,提供了一种有说服力的替代方案。因此,人工智能、图像处理和通信应用中的信号处理操作正逐步迁移到边缘端[1]、[2]、[3]。关键应用领域包括工业物联网(IIoT)[4]、医疗物联网(IoMT)[5]和人工智能物联网(AIoT)[6]。然而,纳米级数字集成电路的规模化扩展急剧增加了功率密度和漏电电流,对电池供电的边缘设备的能效构成了挑战[7]。近似计算作为一种有前景的设计范式,被提出以应对这些挑战。它利用了包括图像和视频处理、深度学习、模式识别、科学计算以及物联网应用在内的许多数据密集型工作负载固有的误差容忍特性[7]、[8]、[9]。这种容忍使得设计者能够通过接受有界的计算不精确性来实现功耗、电路面积和延迟的大幅降低。关键在于,这些折中不会导致应用级别输出质量的明显下降[10]。
算术电路构成了误差容忍领域中高效计算的骨干。近似加法器[11]、[12]、[13],乘法器[14]、[15]和除法器[16]、[17]因其简化电路、降低功耗和加速计算的潜力而被广泛研究。平方根计算虽然不如加法或乘法频繁执行,但在各种科学应用中是关键操作。其计算密集型的特性表现为高延迟和需要大量硬件资源。在各种将平方根用作关键操作的应用中,例如图像处理中的边缘检测[18]和Z分数标准化[19],它通常决定了电路的关键路径。因此,它可能消耗总执行时间和能耗的很大一部分。在计算密集型科学模拟中,多达25%的总执行时间被归因于包括平方根和除法在内的基本函数的求值[20],而在基于硬件的边缘检测流水线中,梯度幅值计算的平方根操作决定了关键路径并主导了电路的延迟和功耗预算[21]。因此,其高效计算对于各种信号处理和机器学习应用至关重要。此外,在资源受限的边缘设备上运行这些应用需要针对最低延迟和功耗进行优化的解决方案。精确平方根计算资源密集,使其不适合边缘设备。而且,许多此类应用,如图像处理、人工智能和通信,本质上可以容忍近似误差,从而消除了精确计算的必要性。因此,这些应用需要能够执行实时平方根计算且误差在可接受范围内的低功耗硬件。
文献中已提出多种近似平方根设计。在现有方法中,恢复型阵列平方根计算电路是研究最深入的家族。这些设计使用按行排列的精确恢复减法器单元(ERSC)的二维阵列来实现纸笔平方根算法,处理2n位被开方数产生n位平方根结果[22]。尽管恢复型阵列架构提供了高精度和优越的错误处理能力,但其硬件成本随操作数宽度呈二次增长。这导致大面积开销、高功耗和关键路径上长的借位传播延迟[18]、[23]。已提出若干近似策略以缓解这些成本。文献[23]中提出的近似平方根电路(AXSR3)以三角形替换模式将精确减法器单元替换为近似减法器单元,而基于自适应近似的平方根(AASR)电路使用最高有效位检测器裁剪操作数并计算位宽缩减的被开方数的平方根。截断平方根(TSQR)通过截断最低有效位来减少有效操作数宽度[24],而可重构近似平方根电路(ASQR)根据位显著性调节可配置减法器单元[25]。近似改进恢复型阵列平方根电路(AMRAS)通过战略性消除、优化和减少恢复型减法器单元实现了改进[26]。
另一种设计家族利用对数和级数展开技术实现更低的面积和更快的操作。对数平方根计算器(LESQ)使用最高有效位检测器找出与被开方数最接近的2的幂次,然后应用二项式级数展开来精化估计[27]。其增强变体LESQ-EC纳入了误差补偿机制,以提高对最高有效位位置为偶数和奇数值时的精度。尽管这些对数设计相较于阵列型对应物具有显著的速度和面积优势,但它们存在分段单调性和连续性问题、较大被开方数的输出饱和以及误差补偿器的有限有效性。Goyal等人[28]提出了优化的对数平方根计算器(OLSR),解决了文献[27]中存在的非平滑近似和饱和问题。为了结合两种范式的优势,已提出混合架构。近似混合平方根计算器(AHSQR)将被开方数划分为最高有效段和最低有效段,通过位宽缩减的精确恢复型阵列计算前者,通过对数和二项式展开的近似计算后者[18]。其改进变体MAHSQR将该思想扩展到处理被开方数最高有效位为零的边界情况,但当最低有效部分超过最高有效部分时,精度急剧下降。最近,文献[29]提出了一种基于泰勒级数的最优平方根计算器(TSOSQR),其组合图形分析和解析优化表明两项级数截断引发了相互补偿的误差,实现了比高阶展开更低的总体近似误差,同时降低了硬件复杂度。
基于坐标旋转数字计算(CORDIC)的系统也已被用于计算任意数的N次方根,但计算延迟较大,如文献[30]、[31]、[32]所述。为了最小化CORDIC实现中的计算延迟,已探索了若干技术。这些包括文献[33]中详述的归一化预处理和抛物线综合,以及Mahdavi等人[34]证明的数据门控和二进制符号位(BSD)编码优化。Tian等人[19]开发了一种用于除法和平方根的低延迟幂级数近似数字计算(PSADIC)架构。该架构比多级CORDIC方法的平均相对误差距离(MRED)降低了67%。
分段线性(PWL)近似是一种广泛使用的技术,它将非线性函数划分为线性区域,在计算效率和硬件复杂度之间提供了一种实用的折中方案。Lyu等人[35]证明了其在浮点平方根计算中的优势,报告了更低的延迟和减少的硬件开销。针对高阶计算,Xie等人[36]引入了一种超低延迟架构,将PWL近似与CORDIC方法耦合,用于计算复数的N次方根和幂次。在此混合方案中,CORDIC处理坐标转换,PWL执行对数和指数函数,避免了传统双曲迭代的延迟和收敛限制。
在上述所有工作中,近似电路架构首先被设计,误差指标随后才被计算。因此,误差特性是设计过程的结果而非指导约束。这种事后评估方法既不能保证符合目标误差规格,也无法提供系统性地探索精度-硬件权衡空间的手段。满足规定的误差阈值因此需要反复的设计迭代,这既耗时又次优。
Wang等人[37]提出了一种在预定义误差约束下基于PWL近似的低延迟复数平方根计算的硬件架构。在PWL近似中,更多的分段数量提高了精度但膨胀了系数存储所需的面积。计算单元的位宽同样决定了可达到的数值精度。他们的工作引入了一个基于软件的分割器,在分数位宽和最大绝对误差(MAE)约束下最小化分段数量。后续工作[38]通过利用平方器部分积的对称性并在乘加数据通路中应用基数为4的Booth编码,扩展了该架构。然而,当输出量级在输入域上变化时,MAE是不充分的精度判据。相对误差是更合适的评估指标,因为它与精确值成比例缩放,并在全输出范围内保持有意义的[39]。与此一致,众多近期工作已将平均相对误差作为评估近似计算设计的标准基准[18]、[19]、[23]、[27]、[28]、[29]。此外,文献[37]、[38]通过不同且局部化的方法降低硬件成本。文献[37]的工作选择性地量化斜率系数的位宽,而[38]截断了部分积的最低有效位。在这两种情况下,位宽、分段数量和截断深度都是通过启发式仿真和参数扫描确定的,而非针对误差预算进行联合优化。因此,一种在定义的相对误差约束下系统性地协同优化硬件成本的过程,而不是依赖孤立的、试错的位宽截断,仍有待探索。
本工作提出了一种系统设计方法,用于设计硬件高效的平方根电路,通过估计达到期望的最大相对误差距离(maxRED)所需的PWL段的最小数量。本工作的主要贡献如下:
1. 提出了一种两阶段、误差感知的设计方法。设计者指定一个目标maxRED,该方法返回满足该目标的低成本PWL近似平方根电路。这用设计时指定取代了先前工作中的事后误差评估,通过构造方式限制尾数级别的误差。奇指数缩放路径添加了有界的扰动,使电路级误差保持在设计控制的目标倍数以内。
2. 构建了闭式晶体管级成本函数,捕获了比较器、多路复用器、乘法器和加法器的硬件贡献。该成本函数通过误差余量缩放扫描与分段数量和参数位宽协同优化。因此,分段粒度与操作数精度之间的权衡被系统地而非启发式地探索。
3. 在maxRED目标从10%到0.001%的范围内,实现了五个近似平方根电路,即PASR1、PASR4、PASR8、PASR21和PASR62。该设计家族证实,单一方法可以在单周期延迟下在整个精度谱中均匀扩展。
4. 所提电路在面积、延迟、功耗、ADP(面积-延迟乘积)、PDP(功耗-延迟乘积)和EDP(能耗-延迟乘积)方面与精确及最先进的近似平方根设计进行了基准对比。通过在六张标准灰度基准图像上的Sobel边缘检测应用进一步验证了其实际保真度。
本文其余部分组织如下。第2节讨论所提设计方法。第3节详述所提近似平方根电路。第4节讨论误差分析和综合结果。第5节讨论使用Sobel边缘检测对所提平方根电路的评估。第6节总结全文。
章节片段
所提设计方法
一个16位二进制浮点数可以按照IEEE 754标准表示为2^(E+15)×(1+f),其中E和f分别是该数的指数和尾数,15是指数偏移。为了简化计算,近似平方根使用2^E×(1+f)进行计算,随后添加偏移以符合IEEE 754标准。
正数2^E×(1+f)的平方根可以计算为2^(E/2)×(1+f)^(1/2)。项(1+f)^(1/2)可以使用N个分段线性段进行近似,第i段
所提平方根电路
本工作使用所提设计方法实现了五个近似平方根电路,目标maxRED约束分别为10%、1%、0.1%、0.01%和0.001%。这些约束跨越五个数量级的误差容忍范围,证明了所提设计方法在广泛精度需求范围内的可扩展性,同时也与最先进的设计的误差水平一致,以实现直接和公平的对比。
误差分析
通过评估所有所提PASR电路的计算结果与精确平方根值,在所有正正规16位浮点数集上进行了误差分析。图6以对数刻度显示了每个电路的maxRED和MRED。结果证实,随着设计索引增加,两个误差指标均呈现一致且单调的降低。
PASR1记录了最高的误差,maxRED为14.55%,MRED为5.26%,而PASR62达到了最低值。**应用分析** 为了评估所提出设计的实际意义,单周期近似平方根电路被集成到Sobel边缘检测应用中。选择边缘检测作为目标应用,是因为它在实时嵌入式视觉系统中的广泛应用,在这些系统中计算精度和硬件效率都至关重要。图像处理特别适合于近似计算,因为人类视觉感知的固有局限性允许一定程度的误差存在。**结论** 本研究提出了一种面向硬件高效近似平方根电路的误差感知设计方法。该方法接受用户指定的maxRED,并返回满足该条件的低成本分段线性平方根近似。N_Segmentor阶段确定满足尾数级误差目标的最小分段数量,Bit_Truncator阶段在相同的误差约束下减少分段参数的位宽。而应用于奇数无偏的缩放……**利益冲突声明** 作者声明他们没有已知的竞争性经济利益或个人关系,这些可能被认为会影响本文所报道的工作。Merin Loukrakpam | Ruskin Potsangbam | Priyanka Thingom
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号