PIDS-Bench:在过度防御、混淆和分布偏移条件下评估提示注入检测器
《IEEE Aerospace and Electronic Systems Magazine》:PIDS-Bench: Evaluating Prompt-Injection Detectors Under Over-Defense, Obfuscation, and Distribution Shift
【字体:
大
中
小
】
时间:2026年09月04日
来源:IEEE Aerospace and Electronic Systems Magazine 5.1
编辑推荐:
摘要:提示注入检测器通常使用分布内测试数据上的聚合 F1 进行评估,这对于了解分布偏移下的行为提供的见解有限,特别是在决策边界的良性一侧,假阳性会带来直接的操作成本,却很少被衡量。我们提出了 PIDS-Bench,这是一个冻结的多轴基准,在固定阈值下联合评估攻击检测和良性假
摘要:
提示注入检测器通常使用分布内测试数据上的聚合 F1 进行评估,这对于了解分布偏移下的行为提供的见解有限,特别是在决策边界的良性一侧,假阳性会带来直接的操作成本,却很少被衡量。我们提出了 PIDS-Bench,这是一个冻结的多轴基准,在固定阈值下联合评估攻击检测和良性假阳性行为,涵盖分布内输入、模仿注入结构但无恶意意图的困难良性提示、混淆攻击以及领域和结构分布偏移。我们评估了七个检测器(学习基线、外部提示注入分类器和广泛安全比较器),并与一个基于规则的下限参考进行了对比。多轴评估揭示了一种聚合 F1 分数所掩盖的失效模式。一个在留出分割集上超过 F1=0.98 的检测器,仍然错误分类了从公共语料库中提取并限制在安全相邻内容的外部来源良性子集的大约三分之一。在完整的阈值扫描和五个训练种子下,没有内部检测器能达到在该压力分布上同时满足 F1≥0.95 和困难良性 FPR≤0.10 的操作点。按来源分解,我们发现困难负例增强几乎消除了对精选压力输入的过度防御,但在外部来源提示上却使其基本保持完整,我们将此模式称为来源敏感的过度防御。这种不对称性在两种微调架构中均成立,并且随着增强池的增长而不会减弱,外部来源的 FPR 仍远高于 0.10 的目标。与外部来源分布匹配的增强是否会缩小这一差距尚未经过测试;仅靠阈值校准和精选风格增强并不能做到这一点。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号