面向多任务MCM-GPU的结构衍生型瓶颈感知调度

《ACM Transactions on Design Automation of Electronic Systems》:Structure-Derived Bottleneck-Aware Scheduling for Multitasking MCM-GPUs

【字体: 时间:2026年09月09日 来源:ACM Transactions on Design Automation of Electronic Systems 2.8

编辑推荐:

   摘要AI 摘要查看此 AI 生成的摘要,您必须拥有高级访问权限。了解更多登录摘要摘要多芯片封装(MCM)GPU 通过集成多个 GPU 小芯片来改善可扩展性,但空间多任务处理由于非统一内存访问和不对称的芯片间带宽,引入了严重的性能干扰。现有的 GPU 多任务调度器依赖于运行时性

  

摘要

摘要

多芯片封装(MCM)GPU 通过集成多个 GPU 小芯片来改善可扩展性,但空间多任务处理由于非统一内存访问和不对称的芯片间带宽,引入了严重的性能干扰。现有的 GPU 多任务调度器依赖于运行时性能剖析指标来指导放置决策。这些响应式方法观察的是干扰的后果而非其结构性成因,在不同输入和共运行工作负载之间表现各异,并且会产生不可忽视的开销。
本文提出了SA-Scheduler,一种面向多任务 MCM-GPU 的基于结构推导的瓶颈感知调度框架。与剖析执行行为不同,SA-Scheduler 在执行之前直接从内核结构推导硬件瓶颈状态。通过离线架构感知建模,我们提取迭代归一化特征,例如 warp 级别的工作集足迹和全局内存强度(GMI)。一个微调后的轻量级代码模型(Qwen-2.5-Coder-1.5B)辅助 CUDA 内核的语义结构提取。这些特征通过解析瓶颈模型被转化为不同的干扰状态(C、M1、M2 和 M3),表征内核在共执行时如何与层次化和不对称的内存资源交互。
基于推断的状态,SA-Scheduler 无需硬件修改或运行时瓶颈剖析即可确定芯片放置。对于流多处理器(SM)分配和可选的电源门控决策,SA-Scheduler 进一步采用轻量级基于计数器的反馈来在有限开销下调优资源使用。在 105 个双程序工作负载中,SA-Scheduler 相较于片内调度和片间调度分别提升了 17.63% 和 10.48% 的系统吞吐率(STP),同时将公平性提高了最多 33.27%。具有能耗感知能力的电源模式在有限吞吐率退化的前提下,进一步将平均功耗降低了最多 25.39%。这些结果表明,基于结构推导的瓶颈推断为未来 MCM-GPU 上的多任务处理提供了原则性和可扩展性的基础。

AI 摘要

AI 生成的摘要(实验性)

本摘要由自动化工具生成,未经文章作者撰写或审核。本摘要旨在支持文献发现、帮助读者评估相关性,并协助邻近研究领域的读者理解本文工作。本摘要旨在补充作者提供的摘要,后者仍为论文的权威总结。全文仍然是权威版本记录。点击此处了解更多

点击此处评论本摘要的准确性、清晰度和有用性。点击此处以评论本摘要的准确性、清晰度和有用性。这样做将有助于改进未来重新生成的版本。

查看此 AI 生成的简明摘要,您必须拥有高级访问权限。

相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号