《ARCHIVES OF COMPUTATIONAL METHODS IN ENGINEERING》:Soft Computing Techniques for Biometric Personal Authentication: Fundamentals, Challenges, and Open Issues
生物特征认证系统因其能够利用永久且不可伪造的生理或行为特征来验证身份,正越来越多地部署于安全关键领域。然而,单模态(unimodal)生物特征方法仍易受噪声、类内变异、欺骗攻击和注册失败等问题的影响。软计算技术——涵盖模糊逻辑、人工神经网络、进化算法、群体智能和深度学习——提供了自适应、容忍不确定性的解决方案,特别适合生物特征数据复杂、高维的特性。本综述系统性地审视了软计算方法在生物特征个人认证中的应用,重点关注通过传感器级、特征级、分数级、排序级和决策级融合策略整合多个生物特征源的多模态系统。在遵循PRISMA 2020筛选流程对Scopus和Web of Science(2010–2024)进行检索后,共综合了153项同行评审研究。本综述提供了跨四个操作相关维度(识别精度、计算成本、可扩展性和对噪声的鲁棒性)的结构化比较分析,并引入了一个原创分类法,按方法在生物特征流水线中的架构角色进行归类。识别出六个开放挑战:跨传感器泛化、对抗鲁棒性、隐私与伦理问题、物联网(IoT)与边缘部署约束、模型可解释性以及人口统计偏差。概述了五个具体未来研究方向,包括可解释人工智能(Explainable AI)集成、用于隐私保护多模态训练的联邦学习(Federated Learning),以及用于实时物联网部署的轻量级混合架构。
**1 Introduction**
由于对安全和身份识别解决方案的需求日益增长,生物特征系统变得越来越普遍。多生物特征系统(Multibiometric systems)的开发出于多种原因,其中之一是个人可能隐藏或不具备系统所依赖的生物特征。“生物特征”指利用个体生理或行为特征(如面部特征、语音、虹膜模式、步态或签名)进行自动识别。这些特征常被称为生物特征线索或生物特征模态。许多生物特征模态已在各种应用中得到研究。生物特征认证正越来越多地被采用于安全应用中以确认个人身份。依赖用户生理特征的系统最近变得既更可靠又更简单,有助于防止使用密码或凭证的系统可能出现的问题,如凭证丢失、转移或被盗。由于具有特定生物特征的个人必须认证系统访问,生物特征的采用大大减少了这些担忧。软计算技术使用近似解来解决没有已知精确解算法的问题。由于生物特征数据固有地模糊且不精确,导致错误拒绝率(FRR)和错误接受率(FAR)升高,软计算成为处理模糊和不精确数据的有效方法。
**1.1 Biometric Domain**
生物特征涉及通过个体生理或行为特征进行识别。近年来,其在认证系统中的应用显著增长,因为生物特征(如指纹、面部和虹膜)是永久且难以猜测、遗忘或丢失的。它已在安全、监控、访问控制和认证等多个领域取得进展。与传统认证形式(如令牌或密码)不同,生物特征难以伪造且不易遗忘。图1总结了典型生物特征识别系统的通用架构。标准生物特征识别系统通常始于分割或检测阶段,将相关生物特征模态从原始输入中分离出来;随后是预处理阶段,涉及数据对齐、去噪或增强;分类器使用从预处理数据中提取的特征进行识别。识别过程包括确定与给定输入对应的身份(生物特征识别)或评估两个输入样本是否对应同一人(生物特征验证)。单模态生物特征系统存在类内变异、欺骗攻击漏洞和注册失败率高等固有局限性。多生物特征(Multibiometrics)通过同时使用多个模态来提高系统准确性和性能,其中融合技术至关重要。融合可在传感器级、特征级、分数级、排序级和决策级进行。多模态生物特征系统根据数据源可分为六类:多模态、多算法、多样本、混合、多传感器和多实例。多传感器系统整合来自不同传感器对单一模态的数据;多算法系统使用多种算法处理输入样本;多实例系统捕获同一生物特征的多个实例;多样本系统使用同一模态的多个样本(如视频);多模态系统整合来自不同生物特征线索的信息。此外,还有结合软生物特征(如性别、身高)的系统。融合可在不同阶段进行,其中分数级融合因易于合并匹配分数而最常用。传感器级融合在特征提取前进行;特征级融合整合特征向量;分数级融合采用均值、最大值、最小值等方法,以及概率方法(如似然比)和证据方法(如Dempster-Shafer理论);排序级融合使用Borda计数等方法。并行融合和顺序融合是两种主要框架。
**1.2 Soft Computing Overview**
软计算是一系列计算范式的集合,旨在构建在不精确、不确定和部分真值条件下模拟人类推理的智能系统,包括神经网络、模糊逻辑和进化计算等。这些模型协同工作,为系统提供智能信息处理。整合多种软计算范式的系统特别适合生物特征识别,因其能处理模糊、高维和含噪的生物特征数据。软计算技术对生物特征变异具有适应性,增强系统鲁棒性。在多模态生物特征中,融合多个模态的特征以产生最终决策;软计算有助于管理模糊和不相容的数据,降低融合复杂性。特征提取是生物特征识别系统的关键组成部分,软计算能有效处理变异数据。图3展示了软计算在生物特征中的多种应用。软计算严重依赖机器学习,机器学习使系统能够通过经验学习而无需显式编程。深度学习是机器学习的一个分支,利用多层人工神经网络学习数据的层次表示,能自动从原始输入中提取复杂特征。软计算涵盖神经网络、模糊逻辑、概率推理和进化算法等方法。深度学习与软计算原则紧密相关,因其基于神经网络的架构和从大规模数据中学习的能力。深度学习在自然语言处理、语音识别和计算机视觉等领域展现出变革潜力。软计算技术通过利用深度神经网络,为困难的数据处理、模式识别和决策问题提供复杂解决方案。
1. 模糊逻辑:一种多值逻辑,基于近似推理,由隶属函数、模糊集和规则集组成。模糊推理系统用于处理生物特征不确定性,并在多模态生物特征中用于提高识别率和执行融合。
2. 人工神经网络(ANN):由相互连接的神经元组成,具有学习和适应能力,用于生物特征识别、特征提取、预处理和解释。可通过集成神经网络或模块化神经网络进一步提升效率。
3. 进化算法:基于自然选择的元启发式优化技术,利用交叉、变异和特定领域算子。在生物特征中用于选择最佳特征集、优化数据库和减少模糊性,也可用于匹配。与模糊逻辑和神经网络结合时表现更优。
**1.3 Motivation**
数字系统的快速普及和对安全、可靠、用户友好认证方法的需求推动了生物特征系统的广泛采用。然而,传统单模态生物特征方法常受噪声、类内变异、欺骗漏洞和注册失败等问题困扰。软计算技术(如模糊逻辑、神经网络、进化算法和群体智能)能够处理不精确、部分真值和不确定性,特别适合复杂、高维和含噪的生物特征数据。与需要刚性规则逻辑的传统算法不同,软计算方法能学习、适应并提供灵活决策。此外,软计算与生物特征系统的集成使得开发先进的多模态认证方案成为可能,结合多个生物特征来源,提高准确性、降低错误率并增强抗欺骗能力。软计算技术还促进有效的特征选择、降维、分类和融合策略,从而实现更智能、上下文感知的生物特征认证系统。
**1.4 Contribution**
本综述对生物特征个人认证中的软计算方法进行了结构化且批判性的审视,整合了方法论覆盖、比较分析、应用背景和挑战识别。主要贡献包括:
1. 对生物特征中软计算谱系的整合综述:统一审视了应用于生物特征认证的软计算范式(模糊逻辑、ANN、进化算法、群体智能和深度学习架构),针对每个范式分析其在生物特征流水线中的功能角色(特征提取、分类、融合或优化)。
2. 结构化比较分析与批判性综合:对九种软计算方法及混合架构在四个操作维度(识别精度、计算成本、可扩展性和鲁棒性)进行结构化比较,并识别出一致的性能模式。
3. 提出软计算角色分类法:根据架构集成将软计算技术分为独立方法、混合架构和深度集成框架,并进一步按流水线功能区分。
4. 多模态融合策略的系统分析:审视所有融合级别(传感器、特征、分数、排序、决策),强调软计算如何解决各级别的挑战(如特征不兼容、分数归一化不确定性、决策冲突)。
5. 跨部署领域的应用驱动综合:回顾了六个实际部署场景(智能手机认证、监控与安全系统、在线访问控制、金融与政府服务、物联网安全、混合密码生物特征框架)。
6. 开放挑战与未来研究优先级的结构化识别:将挑战分为六类,并为每类识别候选软计算解决方案,提出具体研究方向。
本综述与现有调查的区别在于整合了完整软计算技术谱系,采用PRISMA方法,并提供结构化比较和分类法视角。
**1.5 Review Structure**
本综述的其余部分组织如下:第2节提供方法论概述;第3节介绍软计算技术、多模态生物特征数据库和评估指标的背景与基本概念;第4节聚焦软计算应用(特别是机器学习);第5节整合发现并进行比较评估;第6节讨论未来方向和挑战;第7节提供总结。
**2 Review Methodology**
本综述采用PRISMA 2020框架进行结构化、透明的文献筛选。在Scopus(2010-2024)和Web of Science(WoS)(2014-2024)中执行检索,结合生物特征认证与软计算关键词。Scopus返回436条记录,经年份和文献类型过滤后得264条;WoS返回370条,过滤后得327条。合并去重后得591条唯一记录,经标题/摘要筛选排除227条,剩余364篇全文评估,再排除211条(原因:不在范围、方法不足、重复),最终纳入153项研究。纳入标准包括:同行评审期刊或会议论文,主要关注软计算技术应用于生物特征认证,并报告至少一个定量性能指标。排除综述、社论、非英文、无实验结果的论文。时间分布显示2018年后发文量显著增长,群体优化算法和机器学习占比最大,计算机科学、工程和数学是主要学科领域。本研究提出七个研究问题(RQ1-RQ7),涵盖准确性-效率权衡、融合策略比较、基准数据库、元启发式优化、深度学习架构、混合框架和评估指标。
**3 Fundamentals and Background**
本节探讨调查的核心焦点,并详细讨论生物特征系统分析中常用的概念和方法。
**3.1 Soft Computing Techniques**
软计算涵盖广泛的计算技术,包括人工智能(AI)、群体优化算法(SOA)、机器学习(ML)、进化计算、深度学习、模糊逻辑和人工神经网络(ANN)。本综述将深入探讨ML和SOA的细节。
**3.2 Machine Learning Techniques**
机器学习已成为现代生物特征认证系统的核心组件,能够从生理和行为生物特征中自动提取判别模式,应用于特征提取、分类、身份验证、多模态融合和自适应决策。ML通常分为监督、无监督和半监督范式。在生物特征系统中,每种范式解决不同的操作约束。无监督预训练在标记数据有限时特别有价值;半监督学习适合跨会话验证;监督学习主导最终分类阶段。
无监督学习:用于分析未标记数据集,自主发现隐藏模式或数据簇。在生物特征认证中,用于聚类、表示学习和降维。常用算法包括期望最大化、k-means、高斯混合模型、Hebbian学习、卷积神经网络(CNN)。无监督算法主要集中于生物特征数据加密、特征级融合、行为模式识别等。例如,MIT林肯实验室的说话人验证系统使用2048个高斯分量的通用背景模型(UBM);Vlachos和Dermatas引入最近邻聚类算法(NNCA)用于视网膜血管分割。聚类算法如k-means和k-median用于模式识别和数据分割;关联规则挖掘用于发现特征间相关性。
强化学习:在生物特征认证中较少采用,但已用于自适应决策、特征选择、动态阈值优化和持续学习。通过基于奖励的反馈机制,使系统适应变化而不需完全重新训练。传统强化学习在高维数据上困难,深度强化学习(DRL)部分解决了此限制。但总体上强化学习在生物特征认证中仍相对未被充分探索。
监督学习:使用标记数据集训练算法以预测结果或分类数据。在生物特征认证中,用于将生物特征样本分类为已知身份或验证声称的身份。主要分为回归和分类。监督学习在生物特征模态融合、数据分类和回归中有效。支持向量机(SVM)利用核函数将输入映射到高维空间,形成非线性决策边界,但训练复杂度为O(n
2)到O(n
3),可扩展性受限。k近邻(k-NN)基于样本与k个最近邻的相似性进行分类,简单但计算成本随数据库大小增加。朴素贝叶斯分类器基于贝叶斯定理,假设特征间条件独立,适用于轻量级生理生物特征应用。回归方法(如线性回归、逻辑回归)用于分类和分数级融合,但建模非线性关系能力有限。表3总结了监督学习技术在生物特征中的应用,包括热可见光人脸识别、ECG认证和多模态系统。CNN(卷积神经网络)在图像和信号处理任务中表现出强判别能力。例如,[108]提出浅层CNN用于ECG信号分类,在PTB数据库上达到84.54%准确率。
**3.3 The Swarm Optimization Algorithms**
群体智能(SI)算法解决生物特征系统中传统梯度方法无法有效处理的高维特征选择、多模态融合权重分配和分类器超参数调优等优化问题。SI算法探索大搜索空间而不陷入局部最优,适合生物特征特征空间的非凸景观。三个主要贡献:1) 特征子集选择:基于粒子群优化(PSO)的方法在指纹、虹膜和脑电图(EEG)模态上比全特征基线提高3-8%准确率;2) 分数级融合权重优化:混合PSO-蚁群优化(ACO)方法在多模态系统(人脸、指纹、虹膜)中优于均匀加权;3) CNN和SVM超参数调优:群体方法减少人工网格搜索成本,如蝙蝠算法优化的深度置信网络(DBN)在三个模态基准上取得更高识别率。SI方法主要作为优化层与分类器集成,而非独立识别系统。
**3.4 Biometric and MultiBiometric Datasets Analysis**
可靠的生物特征认证系统依赖于多样且高质量的数据集。本节介绍常用数据集:
- 人脸识别:LFW(超过13,000张真实世界图像)、CASIA-WebFace(近50万张图像)、VGGFace2(超过300万张图像,涵盖姿态、年龄和种族多样性)。
- 指纹:FVC2002/FVC2004(来自不同传感器和合成图像)、NIST SD4和SD14(高分辨率滚动指纹)。
- 虹膜:CASIA-IrisV3(不同环境条件)、UBIRIS.v2(可见光图像,含噪声)。
- 语音和步态:TIMIT(语音语料库)、CASIA Gait Dataset(步态视频)。
- 多模态:MULB(人脸、虹膜、手形)、WVU Multimodal Dataset(人脸、语音、指纹、虹膜、掌纹)、BioSecure DS2(欧洲数据集,含700多名参与者)。
数据集存在人口统计多样性有限、样本量小、受控环境等问题,隐私和伦理关注增加,近期趋势包括隐私保护机器学习、合成数据集生成和去中心化学习。
**3.5 Evaluation Metrics**
性能评估依赖通用分类指标和生物特征特定错误率。准确率、敏感性、精确率和F-score定义如公式(2)-(5)。汉明距离用于测量二进制特征向量相似性。错误接受率(FAR)、错误拒绝率(FRR)和等错误率(EER)是常用性能指标。FAR和FRR之间存在权衡,EER是两者相等时的点,越低表示系统性能越好。表4总结了这些指标及其安全-可用性含义。