《Advanced Electronic Materials》:Stochastic-MTJ Sampler Arrays for In-Array Monte–Carlo Estimation
编辑推荐:
摘要专业翻译
具有低能量势垒的随机磁隧道结(stochastic magnetic tunnel junctions,sMTJs)在两个电阻状态之间随机波动,无需伪随机数生成器即可在室温下提供熵源。本研究开发了一种器件保真的sMTJ概率比特(probabili
摘要专业翻译
具有低能量势垒的随机磁隧道结(stochastic magnetic tunnel junctions,sMTJs)在两个电阻状态之间随机波动,无需伪随机数生成器即可在室温下提供熵源。本研究开发了一种器件保真的sMTJ概率比特(probabilistic bit,p-bit)模型——包括电报切换、电流可调的S形响应以及泊松分布的驻留时间——并采用基于文献的垂直各向异性参数。将p-bit集成到可编程交叉阵列中,其逐列累加实现概率域期望估计器:乘累加(multiply–accumulate)运算? = Σ? x?p? 作为平均输出保留,而估计器方差(在T样本窗口内按1/T缩放)则提供校准的、不可约的测量不确定性。闭环漂移自校准方案通过共享数模转换器(digital-to-analog converter,DAC)对每个单元重新偏置,将器件波动性从负担转化为可控量。基于22 nm CMOS的电路级分析表明,在明确定义的读相操作下,能量效率可达869 TOPS/W;阵列内蒙特卡洛与贝叶斯不确定性基准测试量化了利用自由热熵替代CMOS随机数生成器所节省的能量。该架构定位为采样加速器,区别于随机计算算术和耦合伊辛机。
论文主体内容解读
一、研究背景与问题
随着摩尔定律逐渐逼近物理极限,传统半导体缩放策略在性能、功耗和成本方面面临收益递减。与此同时,现代人工智能和机器学习工作负载持续增长,加剧了冯·诺依曼架构在能量和数据搬运方面的瓶颈。值得注意的是,这些工作负载中日益增长的部分并非确定性算术,而是统计估计任务,包括蒙特卡洛积分、不确定性条件下的贝叶斯推断,以及高维分布的采样探索。这类任务的核心成本不在于乘累加精度,而在于生成并平均大量独立随机样本。
概率计算范式将可控随机性提升为一等资源,其核心构建模块是概率比特(p-bit),一种输出在逻辑0和1之间以可控概率波动的可调二进制单元。单个p-bit重复采样即为伯努利源;阵列中多个偏置p-bit并行读取并平均,则构成物理期望估计器。传统CMOS实现通过伪随机数生成器和辅助逻辑模拟这一行为,在向纳米尺度大规模并行采样扩展时产生显著的能量和面积开销。因此,能够内在产生高质量可调随机比特的器件,可消除硬件采样的主要开销。
低能量势垒的随机磁隧道结(sMTJ)因热涨落而自发频繁翻转,发射内在随机比特流,其输出概率可通过自旋转移矩(STT)或自旋轨道矩(SOT)电流连续偏置。这种可调、室温、CMOS兼容的随机性使sMTJ成为p-bit的理想物理载体。然而,sMTJ的波动性也是其核心工程缺陷:状态不保留导致工作点对热漂移、器件老化和偏置波动敏感,实际概率随时间偏离目标,且器件间变异性使阵列中点的条件分散。任何基于sMTJ的估计器其可信度取决于在平均窗口内保持每列采样概率的能力。
二、研究内容与结论
本研究开发了器件保真的sMTJ p-bit模型,基于随机朗道-利夫希茨-吉尔伯特(s-LLG)动力学,再现了电报切换、S形概率-电流特性和指数分布(泊松型)驻留时间,所有物理参数和器件尺寸均明确给出。模型器件为直径约20 nm、自由层厚度约1.2 nm的圆形结,饱和磁化强度约1.1×10? A/m,阻尼系数约0.01,与已报道的超顺磁隧道结一致。自旋转移矩采用物理效率,无人工增强。在偏置电流下两势垒不对称,P态长时概率遵循S形函数,调谐窗口特征尺度为2k_BT/I_c0,独立于势垒高度,因此p-bit由亚微安电流调谐。
研究人员将p-bit集成到可编程交叉阵列中,每列为1T1MTJ随机p-bit单元。字线(WL)门控访问晶体管并施加逐单元输入激励,位线(BL)收集累积列电流,由列外围的电流模式感测放大器(SA)数字化。共享DAC通过多路复用器(MUX)编程逐单元切换概率,定义列权重。阵列执行并行概率域乘累加(MAC)操作,作为阵列内蒙特卡洛期望估计器。列输出为MAC的无偏蒙特卡洛估计器,其期望精确等于MAC,方差为所传递的统计量。估计收敛遵循中心极限定律,T次读取产生约5-6有效位精度。
为应对器件波动性,研究人员设计了闭环漂移自校准方案。同一SA读出提供阵列上经验概率检查,轻量控制回路将测量时间平均值与目标比较,通过调整DAC码重新偏置单元,使概率在S形曲线上重新居中。由于DAC共享并与读相时分复用,该校准复用现有外围电路,不增加额外读出硬件。回路容忍静态DAC偏置误差,因为被调节的是经验概率而非开环DAC码。
电路级分析在22 nm技术、0.8 V电源电压下进行。采样操作定义为一次电流模式SA评估,即一次抽取加累加,按通用CIM惯例计为2次操作(一次乘法、一次累加)。代表性64×256阵列中,256个SA以50 MHz并行工作,提供25.6 GOPS吞吐量,功耗约28.8 μW,得出SA受限峰值约889.7 TOPS/W,计入外围列驱动器、互连、地址解码和电平移位器后,系统峰值降至最高869 TOPS/W,即约2.3 fJ/采样操作。
三、关键技术方法
本研究采用的主要技术方法包括:基于s-LLG方程的器件保真宏自旋模型,用于生成物理一致的p-bit比特流;概率域期望估计器架构,将列MAC解释为蒙特卡洛估计器;闭环漂移自校准回路,通过共享DAC逐单元重新偏置;电流模式锁存感测放大器用于列读出;两阶段二极管串DAC(6位分辨率,INL在±0.5 LSB内,DNL峰值约0.8 LSB);以及22 nm CMOS电路级仿真与行为级器件/电路协同仿真。
四、研究结果
估计器与不确定性:列估计无偏,误差按1/√T下降,在T≈1024时达到5-6有效位,与解析预测一致。同一比特流产生的预测方差在约2%内匹配解析值,阵列以零额外硬件成本返回校准不确定性。读取快于驻留时间引入有色噪声,使方差按预期因子增大,但仅降低有效样本量而非偏置均值。
漂移自校准:注入标准差为0.05的逐单元概率漂移后,未校正估计偏置超出统计底限约0.4,证实未校准波动性对存储权重是致命的。激活闭环后,漂移诱导偏置降低两个数量级以上(约40倍改善),残差由DAC最低有效位和校准节奏决定而非漂移幅度。
应用:在二元贝叶斯线性分类任务中,阵列在约1024样本内达到精确权重准确率上限(0.94对0.95),并从同一比特流返回校准的逐点不确定性:按阵列置信度排序,最低置信度三分之一的测试点比最高置信度三分之一错误率高约2.6倍。
能量基准:与CMOS LFSR加比较器随机数生成器基线相比,sMTJ阵列节省约70%-90%的每次推断能量,优势随所需精度(样本数)增长。
五、讨论与结论
本研究将sMTJ采样器阵列明确定位为采样加速器,区别于随机计算(SC)算术和耦合伊辛机。在经典SC中,数字编码为伯努利比特流均值,随机性是数字表示的人为产物,移除不影响结果;而本阵列的交付物是估计器及其方差,随机性不可约。与SPINBIS等MTJ-SC加速器相比,本工作在三方面不同:逐单元切换概率通过共享DAC独立编程;闭环漂移自校准明确解决器件漂移;交付物为估计器及其方差而非近似确定性算术。与耦合p-bit伊辛/玻尔兹曼机不同,本阵列是非耦合的独立可编程源集合,这种独立性对期望/边际估计是特征而非局限。
研究结论指出,本工作呈现了随机MTJ p-bit采样器阵列,其中逐列乘累加被解释为概率域期望估计器:均值复现点积,估计器方差在有限采样窗口内传递校准的、不可约的不确定性。器件保真宏自旋模型将p-bit参数固定为物理一致、基于文献的值,闭环漂移自校准将低势垒结的波动性转化为受控量而非失效模式。22 nm电路级分析在明确定义的读相操作下记录了能量效率,阵列内蒙特卡洛与贝叶斯不确定性基准量化了利用自由热熵相对CMOS随机数生成的优势。结果是与随机计算算术和耦合伊辛机不同的采样加速器;在实测sMTJ阵列上对自校准回路进行实验验证是自然的下一步。