PCR:一种预取增强的缓存复用系统,用于低延迟的 RAG 服务

《ACM Transactions on Architecture and Code Optimization》:PCR: A Prefetch-Enhanced Cache Reuse System for Low-Latency RAG Serving

【字体: 大 中 小 】 时间:2026年10月10日 来源:ACM Transactions on Architecture and Code Optimization 2.9

编辑推荐:

   摘要AI 摘要要查看此 AI 生成的摘要,您必须拥有高级访问权限。了解更多登录摘要摘要检索增强生成(RAG)显著提升了大语言模型(LLM)的性能,但引入了庞大的输入序列,严重制约了预填充(prefill)阶段的效率。虽然 KV 缓存复用可减少共享文档前缀的冗余计算,但在 RA

摘要

摘要

检索增强生成(RAG)显著提升了大语言模型(LLM)的性能,但引入了庞大的输入序列,严重制约了预填充(prefill)阶段的效率。虽然 KV 缓存复用可减少共享文档前缀的冗余计算,但在 RAG 服务中,可复用的 KV 工作集可能超出 GPU 显存容量,需要跨主机 DRAM 和 SSD 保留 KV 数据块。然而,朴素的多级存储扩展方案面临严重的 I/O 瓶颈、次优的驱逐策略以及高昂的 CPU-GPU 数据传输开销,往往抵消了缓存复用带来的延迟收益。本文提出了一种名为 PCR 的预取增强缓存复用系统(Prefetch-enhanced Cache Reuse),用于低延迟 RAG 服务。PCR 通过三个核心模块将被动的 SSD 存储转变为主动的延迟隐藏内存层次:(1) 多级前缀树缓存管理器,统一管理和跟踪 GPU、主机 DRAM 及 SSD 整个内存层次中可复用的 KV 数据块;(2) 队列引导的运行时调度器,利用检索后的等待队列作为前瞻信号,主动保护热点数据块并在执行前将 SSD 上的数据预取到主机 DRAM 中;(3) 延迟隐藏的 KV 传输流水线,将细粒度的 PCIe 数据搬移和异步 SSD 操作与模型计算重叠执行。在多种模型和 RAG 工作负载上的广泛评估表明,PCR 在大多数场景下相比已评估的 KV 缓存复用系统降低了 TTFT(首 token 时间),在 Workload 1、请求速率为 1.0 req/s 的条件下,使用 A6000 显卡运行 Llama3.1-8B 时相比 vLLM 实现了 2.45 倍的加速,同时在高负载下保持了更低的尾部延迟。

AI 摘要

AI 生成的摘要(实验性)

本摘要由自动化工具生成,未由本文作者撰写或审核。其目的是辅助信息发现、帮助读者评估相关性,并协助来自相关研究领域的读者理解本文内容。该摘要旨在补充作者提供的摘要,后者仍然是论文的主要概述。完整论文仍为权威版本。点击此处了解更多。

点击此处对此摘要的准确性、清晰度和实用性进行评论。这样做将有助于改进和未来的重新生成版本。

要查看此 AI 生成的简明摘要,您必须拥有高级访问权限。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号