《Machine Learning and Knowledge Extraction》:Adaptive Process Mining and Selective Monitoring for Algorithmic Auditing: A Survey of Representations, Learning Policies, Decision Strategies, and Open Problems
编辑推荐:
选择性算法审计需要解决在无法进行全面审查时,如何分配审计资源以关注关键过程证据的问题。本综述提出一个四层框架,将过程表征、学习、检查分配与治理整合为事件流上的单一预算约束序贯决策问题。与以往聚焦于预测性过程监控、可解释性、成本分析或文献计量结构的综述不同,该框
选择性算法审计需要解决在无法进行全面审查时,如何分配审计资源以关注关键过程证据的问题。本综述提出一个四层框架,将过程表征、学习、检查分配与治理整合为事件流上的单一预算约束序贯决策问题。与以往聚焦于预测性过程监控、可解释性、成本分析或文献计量结构的综述不同,该框架考察了在人力资源、计算资源、延迟及文档记录能力受限时上述功能的相互作用。研究人员通过对89个独特文献族开展结构化定向调研,系统梳理了事件日志、Petri网、图模型、对象中心模型、神经网络、不确定性感知方法、序贯决策、Bandit、强化学习(RL)及审计架构等方向。现有证据表明,各层均有大量研究积累,但跨层评估仍呈碎片化,且依赖异构数据集、目标函数与验证协议。本综述提炼出五大优先方向:审计就绪基准测试、显式检查预算协议、校准不确定性、跨组织上下文迁移及可复现治理接口。核心贡献在于构建了一个计算框架与基于语料库的研究议程,将表征、学习、检查分配与治理连接为选择性算法审计的统一体系。
1 引言
1.1 问题背景
自动化决策日益嵌入由事件、交接、延迟、异常及人工干预构成的运营流程中,审计需超越模型静态评估,转向持续审计模式,即在部署阶段持续生成证据,追踪鲁棒性、可追溯性、问责制、概念漂移与合规性。高吞吐量环境下,受限于审查能力、计算资源、延迟及文档容量,穷尽式检查所有案例或轨迹不可行。选择性监控通过依据风险、不确定性、新颖性、预期信息增益或干预价值分配检查资源,解决该约束。现有研究虽已覆盖事件日志采样、主动异常检测、预测性过程监控(PPM)、可解释监控及持续AI审计等组件,但各组件分别回答不同问题:预测关注“可能发生什么”,选择关注“哪些案例应消耗稀缺审计资源”,治理则需确保选择过程可复现、可质疑、可审查。
1.2 研究缺口与综述创新性
现有综述多聚焦预测性过程监控的任务分类、模型族与评估实践,或可解释性方法的解释质量,或成本维度的分析,亦或领域层面的文献计量图谱。本研究的核心缺口在于表征、风险与不确定性估计、预算约束下检查动作分配及结果治理这四类计算功能的相互作用未被系统研究。本综述的创新性体现为四层分析框架,将选择性算法审计建模为预算约束序贯决策问题,明确了预测质量与检查效用的区分,将选择性监控确立为独立决策层,并要求审计策略本身具备可审计性。
1.3 目标与综述问题
本综述旨在将自适应过程挖掘与选择性监控构建为算法审计的计算基础,具体目标包括:形式化事件流上的选择性审计问题;按表征、学习、决策与治理角色对证据进行分类;比较假设、验证实践、权衡与跨层依赖;定义可通过共享基准与预算感知评估验证的研究优先级。围绕四个核心问题展开:SQ1表征层关注何种过程表征能保留审计推理所需的事件、对象、时序关系、资源与来源信息;SQ2学习层关注何种模型能估计异常风险、干预价值或不确定性,并适应稀疏标签、迁移、漂移与可解释性需求;SQ3决策层关注如何通过采样、过滤、主动选择、序贯检验、Bandit、RL或多目标优化分配检查能力;SQ4治理层关注如何将前述层整合为具备人工监督的可复现、可质疑审计架构。
1.4 范围与论文结构
本综述聚焦可支撑事件驱动流程选择性检查的方法,属于结构化概念性综述而非元分析,因纳入研究在任务、数据集、预算与结果度量上存在异质性。全文结构为:第2节定义概念抽象与术语;第3节阐述综述协议与评价框架;第4节按主题轴分析证据;第5节构建跨层综合与依赖模型;第6节讨论权衡、部署成熟度与优先研究方向。
2 基本概念与问题形式化
2.1 事件日志、轨迹与过程行为
事件日志定义为有限轨迹集合,单条轨迹对应一个案例的执行历史,由有序事件序列构成。单个事件包含活动标签、时间戳、资源、对象标识符及附加属性。从计算机科学视角,事件日志是结构化序列数据集;从审计视角,它是推断偏差、风险与问责主张的证据基础。
2.2 作为持续监控的算法审计
算法审计指对自动化决策系统在问责制、鲁棒性、公平性、可追溯性、合规性与运行行为方面的系统评估。静态审计在单一时间点评估系统,持续审计则在事件、决策或流程执行发生时进行流式监控,形成流式决策问题:审计机制需决定新案例应被忽略、记录、标记、升级或由人工审查。
2.3 选择性监控
选择性监控旨在解决穷尽检查不可行的问题。设t时刻可用信息(含事件日志特征、模型得分、既往审计结果与资源约束)为It,选择性监控策略π将It映射为检查动作at∈A,动作空间涵盖案例检查、决策延迟、升级、标签请求或无操作。策略受限于有限检查预算B,即∑tc(at)≤B,其中c(at)为动作成本。通用目标是在满足运行与治理约束下最大化审计效用U,U可融合异常检测、风险降低、预期信息增益、公平性保持、延迟降低或合规价值。
2.4 选择性算法审计的四层视图
第一层定义过程行为表征,包括Petri网、事件日志编码、图模型与对象中心模型;第二层通过学习模型估计风险、不确定性或干预价值;第三层通过采样、过滤、序贯检验、Bandit或RL分配有限审计资源;第四层将上述机制嵌入审计架构,暴露来源、解释、不确定性与治理控制。该分层视图支持跨社区文献比较,这些社区通常独立研究上述问题。
2.5 综述问题的计算机科学抽象
通过术语映射表,将过程挖掘术语转化为通用计算机科学抽象,表明选择性监控问题在网络安全告警、内容审核、欺诈检测、医疗分诊及自动化决策人工审查等领域具有普适性。
2.6 已知算法原则
表征决定可观测性:监控策略仅能检测上游表征暴露的偏差,表征并非中性预处理步骤,而是定义了审计问题的可观测状态空间。预测与选择是不同问题:高预测精度模型未必是有效的检查策略,评估需纳入检查成本、延迟、假发现负担、不确定性及未检查案例的分布。预算监控引发分布偏移:选择子集检查后,审计员观察到的标注数据不再代表完整过程分布,可能放大盲点,需通过主动学习、上下文Bandit、保守RL与保形预测(conformal prediction)缓解,但目前缺乏过程挖掘中评估该反馈效应的标准协议。审计策略本身需可审计:选择性监控策略作为算法决策系统,若决定哪些案例进入人工审查、哪些告警被抑制或触发干预,则必须暴露其假设、不确定性、来源与动作历史,形成递归要求。
3 综述方法学
3.1 综述协议与主题轴
采用结构化定向综述,围绕四个主题轴组织文献:轴1为搜索空间表征(Petri网、图、事件模型),覆盖过程发现、Petri网结构、图模型及事件日志质量;轴2为结构学习与自适应决策策略(神经网络、RL),覆盖循环模型、图神经网络(GNN)、注意力机制、图预训练及RL决策机制;轴3为启发式决策策略(贪心、批过滤、序贯检验),覆盖贪心算法、优先级排序、批过滤及序贯检验;轴4为算法审计中的选择性监控(用例与混合系统),覆盖融合神经风险评分与规则控制的混合管道、事件流在线异常检测及可解释性。
3.2 检索策略与数据源
于2026年4月19日通过Scopus、Google Scholar与IEEE Xplore开展检索,以四个概念组合作为检索式,优先纳入高引用、平台排名靠前、全文可获取且与主题轴相关的文献,最终通过文献族调和构建证据库。
3.3 纳入与排除标准
纳入标准:以过程挖掘、事件日志分析、PPM或算法审计为核心主题;贡献于至少一个主题轴;发表于同行评审期刊、会议或知名研讨会,或为引入重要方法进展的高质量预印本;2018年后发表,经典基础文献除外。排除标准:仅关注通用机器学习且无过程事件关联;纯理论无事件日志实证评估;重复或非存档版本;非英西语发表;与算法审计、自适应搜索、异常检测、成本感知监控或决策支持无关的监控研究。
3.4 研究筛选流程
按平台排名顺序筛选候选文献,通过全文相关性评估与文献族调和完成去重与整合,构建研究级矩阵,记录纳入状态、主题分配、技术族编码与描述性评价,支持定性综合。
3.5 描述性评价、编码与数据提取
采用C1-C10操作化 rubric 对纳入文献进行0-3级序数量化评价,涵盖主题对齐、方法严谨性、事件日志基础、选择性监控适配性与可复现性等维度。最终调和语料包含89个独特文献族,编码支持多标签分类,以反映技术跨层特性。
4 主题轴结果
4.1 轴1:搜索空间表征
该层为选择性监控的基础,决定偏差可见性、模型迁移性与审计可解释性。子主题包括:经典Petri网与过程感知形式化方法,提供透明且可追踪的过程逻辑;过程发现算法及其稳定性,强调发现模型需对噪声与重采样鲁棒,避免向下游传播不稳定性;事件日志构建与数据质量基础,涵盖虚拟知识图谱(VKG)与多版本过程合并方法,保障日志一致性与可追溯性;轨迹编码方法,对比独热编码、嵌入与图编码对下游模型的影响,表明编码选择需与审计视角匹配;轨迹聚类与子变体发现,通过多视角距离度量与上下文子变体识别,为检查预算分配提供自然分层;生成式AI与自然语言处理方法,利用大语言模型(LLM)从文本生成过程模型,提升非技术干系人参与度并生成可审查的提示与修订轨迹;对象中心与图表征,以对象中心事件日志(OCEL)为标准,结合图特征提取与图基础模型(如ProcessGFM),通过层次化图编码器提升预测性能,同时扩展审计可观测的状态空间。
4.2 轴2:学习模型与自适应策略
该层聚焦从过程轨迹中学习表征并自适应分配检查注意力。子主题包括:序贯与注意力模型,从LSTM、GRU发展到分层注意力机制(HAM-Net)与稀疏混合专家Transformer,降低推理延迟并学习历史事件权重;图神经网络与图预训练,通过图对比学习、时间感知注意力与图基础模型(ProcessGFM)捕捉控制流、时序与语义依赖,支持跨日志迁移;概念漂移及其与检查分配的相互作用,强调漂移检测器需同时报告误报率、检测延迟、预算偏移与效用损失,而非仅关注检测精度;强化学习(RL)用于过程监控,涵盖在线RL(Q-learning、DQN用于瓶颈识别与资源分配)、离线安全RL(VOCE框架通过变分推断与保守Q值估计满足约束马尔可夫决策过程(CMDP)的安全约束)及深度RL用于弱监督异常检测;不确定性估计,对比贝叶斯神经网络、蒙特卡洛 dropout、深度集成与保形预测在识别不可靠预测与调节探索-利用中的作用,强调需通过校准误差、风险-覆盖曲线而非仅区分度指标评估;RL策略的实践限制,包括交互成本高、奖励工程隐含偏好冲突、非平稳环境下的收敛保障缺失及治理需求;迁移学习与跨组织适配,通过预训练模型(如ProcessGFM)实现知识跨域迁移,缓解数据稀缺组织的部署瓶颈;神经过程监控的可解释性,通过量化框架评估解释质量,确保审计员能理解案例被标记的原因。
4.3 轴3:选择性监控的决策与搜索策略
该层关注在获得风险信号后如何分配有限检查预算。子主题包括:性能保持采样与实例选择,通过过程感知采样(如LogRank)保留活动、变体与轨迹长度分布,避免随机采样丢失稀有异常;自适应过滤与变化感知窗口,通过滑动窗口、自适应窗口及交互式过滤工具聚焦过程不稳定片段,减少稳定段的分析开销;约束与保守优化,将检查分配建模为CMDP,通过VOCE等框架在不确定性下选择最坏情况有界的动作,或通过边界近似降低对齐计算复杂度;主动与处方性选择,通过主动异常检测查询高不确定性案例,结合因果推断估计干预的反事实效应,利用保形预测量化不确定性以优化干预时机与资源分配;来自相邻领域的经典启发式,包括序贯假设检验(如结构自适应序贯检验SAST)控制流式误发现率,多臂Bandit与上下文Bandit通过探索-利用权衡动态选择最优检测器或评分规则;分配策略的技术比较,明确各策略在理想假设下的理论保证(如序贯概率比检验的错误控制、UCB的遗憾界)及其在稀有异常场景下的理论预期;多目标检查分配,通过帕累托最优集同时优化检测效用、证据覆盖、成本、延迟与公平性,避免单一加权分数掩盖权衡结构。
4.4 轴4:面向审计的应用与混合架构
该层整合前三层为可运行系统,满足治理、可解释性与部署需求。子主题包括:算法问责与持续审计基础,明确算法问责的操作构件,提出持续AI审计(CAAI)框架以实现近实时合规监控;成本感知运行支持,强调成本维度在过程挖掘中的核心地位,指出当前成本推理的不成熟是审计就绪管道稀缺的原因之一;可解释性与人在回路审计实践,通过量化框架评估解释质量,将解释作为审计员的核心输入而非附加输出;生成式AI在过程与审计任务中的应用,利用LLM生成过程模型与摘要,但需结合结构化表征验证输出可靠性;混合与处方性审计架构,融合自适应分类器、规则预过滤、优化器与模拟引擎,结合保形预测与白盒策略规范,构建可审查的决策支持系统;ML管道自身的审计,通过离线深度RL数据集审计、过程挖掘技术审计实践及差分隐私事件日志生成,确保学习审计策略的数据完整性与隐私合规性,形成元审计能力。
5 跨轴综合
5.1 语料内技术分布
通过多标签编码展示技术族在主题轴中的分布,反映表征、学习、决策与治理功能的跨层重叠特性,该分布仅描述语料构成,不用于推断技术成熟度。
5.2 四层比较解读
通过对比各层的核心能力、失效模式与审计影响,表明单层评估的局限性:可解释表征可能预测能力弱,高精度神经模型可能难以治理,成本优化策略可能扭曲观测分布,治理接口可能未改善资源分配效率。
5.3 为何暂无法构建统一数值基准
因纳入研究在事件日志、异常定义、预测范围、预算约束、验证拆分等方面存在异质性,直接合并指标会误导可比性。未来基准需统一日志拆分、异常流行率、检查预算、延迟反馈、漂移场景,并共享精度、召回率、F1、校准度、检测延迟、单问题检测成本、检查效用、子群覆盖与未检查风险等指标,区分回顾性模拟与前瞻性部署。
5.4 统一概念框架
将四层建模为闭环管道:表征层输出结构特征,学习层输出风险与不确定性估计,决策层输出检查动作,治理层输出约束与策略版本,最终生成包含证据、解释、不确定性、动作与结果的审计记录。人工反馈更新标注证据并可能调整学习或决策模块,形成跨层双向依赖。
5.5 语料模式解释性解读
各层证据差异源于验证环境不同:表征层受益于公开日志与一致性度量;学习层依赖任务特定预处理与私有实现,复现性弱;决策层面临延迟、稀疏且组织特定的奖励;治理层需处理难以在实验室复现的法律与组织流程。跨层交互表现为:丰富表征可能提升预测但增加计算与解释成本,激进过滤可能降低运行时开销但丢失稀有模式,自适应策略可能改善短期收益但改变未来标注分布,强治理约束可能限制模型灵活性但提升可质疑性,需通过多维度操作与问责标准评估整体管道。
6 讨论与开放挑战
当前研究在四层均有积累,但跨层整合不足。开放挑战包括:构建审计就绪基准测试以支撑公平比较;设计显式检查预算协议以量化资源约束影响;实现校准不确定性估计以应对稀有异常与漂移;发展跨组织上下文迁移方法以降低部署门槛;构建可复现治理接口以满足监管与问责需求。未来工作需超越组件级优化,转向端到端审计管道的联合评估与部署验证。