面向多任务MCM-GPU的结构衍生型瓶颈感知调度
《ACM Transactions on Design Automation of Electronic Systems》:Structure-Derived Bottleneck-Aware Scheduling for Multitasking MCM-GPUs
【字体:
大
中
小
】
时间:2026年09月09日
来源:ACM Transactions on Design Automation of Electronic Systems 2.8
编辑推荐:
摘要AI 摘要查看此 AI 生成的摘要,您必须拥有高级访问权限。了解更多登录摘要摘要多芯片封装(MCM)GPU 通过集成多个 GPU 小芯片来改善可扩展性,但空间多任务处理由于非统一内存访问和不对称的芯片间带宽,引入了严重的性能干扰。现有的 GPU 多任务调度器依赖于运行时性
查看此 AI 生成的摘要,您必须拥有高级访问权限。
摘要
摘要
多芯片封装(MCM)GPU 通过集成多个 GPU 小芯片来改善可扩展性,但空间多任务处理由于非统一内存访问和不对称的芯片间带宽,引入了严重的性能干扰。现有的 GPU 多任务调度器依赖于运行时性能剖析指标来指导放置决策。这些响应式方法观察的是干扰的后果而非其结构性成因,在不同输入和共运行工作负载之间表现各异,并且会产生不可忽视的开销。
本文提出了SA-Scheduler,一种面向多任务 MCM-GPU 的基于结构推导的瓶颈感知调度框架。与剖析执行行为不同,SA-Scheduler 在执行之前直接从内核结构推导硬件瓶颈状态。通过离线架构感知建模,我们提取迭代归一化特征,例如 warp 级别的工作集足迹和全局内存强度(GMI)。一个微调后的轻量级代码模型(Qwen-2.5-Coder-1.5B)辅助 CUDA 内核的语义结构提取。这些特征通过解析瓶颈模型被转化为不同的干扰状态(C、M1、M2 和 M3),表征内核在共执行时如何与层次化和不对称的内存资源交互。
基于推断的状态,SA-Scheduler 无需硬件修改或运行时瓶颈剖析即可确定芯片放置。对于流多处理器(SM)分配和可选的电源门控决策,SA-Scheduler 进一步采用轻量级基于计数器的反馈来在有限开销下调优资源使用。在 105 个双程序工作负载中,SA-Scheduler 相较于片内调度和片间调度分别提升了 17.63% 和 10.48% 的系统吞吐率(STP),同时将公平性提高了最多 33.27%。具有能耗感知能力的电源模式在有限吞吐率退化的前提下,进一步将平均功耗降低了最多 25.39%。这些结果表明,基于结构推导的瓶颈推断为未来 MCM-GPU 上的多任务处理提供了原则性和可扩展性的基础。
AI 摘要
AI 生成的摘要(实验性)
本摘要由自动化工具生成,未经文章作者撰写或审核。本摘要旨在支持文献发现、帮助读者评估相关性,并协助邻近研究领域的读者理解本文工作。本摘要旨在补充作者提供的摘要,后者仍为论文的权威总结。全文仍然是权威版本记录。点击此处了解更多。
点击此处评论本摘要的准确性、清晰度和有用性。点击此处以评论本摘要的准确性、清晰度和有用性。这样做将有助于改进未来重新生成的版本。
查看此 AI 生成的简明摘要,您必须拥有高级访问权限。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号