SLM-Arch:小型语言模型的权衡分析与优化硬件设计
《ACM Transactions on Design Automation of Electronic Systems》:SLM-Arch: Trade-off Analysis and Optimized Hardware Design for Small Language Models
【字体:
大
中
小
】
时间:2026年09月09日
来源:ACM Transactions on Design Automation of Electronic Systems 2.8
编辑推荐:
摘要AI 摘要要查看此AI生成的摘要,您需要高级访问权限。了解更多登录摘要摘要小型语言模型(SLMs)越来越多地被部署在资源受限的环境中,这推动了专用加速器的开发。然而,由于多样化的应用需求以及架构参数与工作负载特征之间复杂的交互作用,设计高效的SLM加速器仍然充满挑战。本文
摘要
摘要
小型语言模型(SLMs)越来越多地被部署在资源受限的环境中,这推动了专用加速器的开发。然而,由于多样化的应用需求以及架构参数与工作负载特征之间复杂的交互作用,设计高效的SLM加速器仍然充满挑战。本文提出了一种闭合形式的解析模型,可精确评估SLM加速器在不同数据流和技术节点(例如28nm CMOS和7nm FinFET)下的延迟和能耗。该模型考虑了重复数据访问、处理单元(PE)之间的互连以及不同DRAM操作的能耗,从而实现了高仿真精度。验证结果表明,该模型在延迟方面的平均精度为96.0%,在处理单元阵列能耗方面为96.8%,在DRAM能耗方面为97.1%。利用该模型,我们进行了大量的设计空间探索(DSE),并推导了优化处理单元阵列规模的经验公式,以及最小化冗余内存访问的内存容量解析方法。我们还将优化后的处理单元阵列规模、内存容量、带宽和数据流的组合方案进行了考察。此外,我们还研究了面积受限场景(2 mm2、7 mm2、30 mm2),并提供了计算与内存资源分配的指导方针。结果表明,IS和OS的优化PE阵列规模约为240×240,而WS至少需要300×300,但其内存需求较低。在宽松的面积约束下,至少需要30 GB/s的带宽才能实现完全的面积利用,而在严格的面积限制下,则倾向于最大化处理单元阵列。总体而言,本研究为硬件参数选择提供了实用指南,使优化后的SLM加速器能够在多样化的应用中有效部署。
AI 摘要
AI生成摘要(实验性)
本摘要由自动化工具生成,未经文章作者撰写或审阅。其目的是支持文献发现、帮助读者评估相关性,并协助相邻研究领域的读者理解该工作。它旨在补充作者提供的摘要,后者仍为论文的主要摘要。全文仍是权威的正式版本。点击此处了解更多。
点击此处对本摘要的准确性、清晰度和实用性发表评论。这将有助于改进和生成未来版本。
要查看此AI生成的通俗摘要,您需要高级访问权限。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号