《Biosensors》:Detection of Polysaccharide Markers of Fungal Infections by Surface-Enhanced Raman Scattering and Machine Learning Methods
编辑推荐:
在这项研究中,研究人员首次采用表面增强拉曼散射(SERS)方法测量了四种真菌感染多糖标志物的光谱:线性β-(1→3)-和β-(1→6)-连接的D-葡聚糖(D-glucans)、白色念珠菌(Candida albicans)的分支甘露聚糖(mannan)和烟曲霉
在这项研究中,研究人员首次采用表面增强拉曼散射(SERS)方法测量了四种真菌感染多糖标志物的光谱:线性β-(1→3)-和β-(1→6)-连接的D-葡聚糖(D-glucans)、白色念珠菌(Candida albicans)的分支甘露聚糖(mannan)和烟曲霉(Aspergillus fumigatus)的半乳甘露聚糖(galactomannan)。研究了浓度范围为10 pg/mL至100 μg/mL的多糖水溶液。光谱采用机器学习方法分析:主成分分析(principal component analysis, PCA)用于数据可视化,带岭正则化的偏最小二乘(partial least squares, PLS)用于构建反映物质间相互识别准确度的指标。观察到了随分析物浓度变化的光谱变化,并实现了稳定的校准。随后,在用于模拟血清的人血清白蛋白(human serum albumin, HSA)生理浓度(45 mg/mL)存在下对真菌多糖进行测量,使得在10 pg/mL至100 ng/mL的临床相关浓度范围内能够准确检测分析物。在这种情况下,校准依赖关系使用带有L1正则化的偏最小二乘法计算。盲测采用基于模型预测与独立浓度估计之间不一致性的训练衍生适用域标准进行评估。
### 基于SERS与机器学习的真菌感染多糖标志物检测研究解读
全球范围内,侵袭性真菌感染每年导致超过650万病例和380万死亡,曲霉病和念珠菌病是最主要的致死病因。真菌细胞壁的主要成分——β-葡聚糖、甘露聚糖和半乳甘露聚糖——是重要的诊断标志物。然而,现有检测方法如鲎阿米巴样细胞裂解物(LAL)试验、酶联免疫吸附试验(ELISA)、聚合酶链式反应(PCR)和基质辅助激光解吸电离飞行时间质谱(MALDI-TOF MS)等存在特异性不足、依赖纯培养、操作复杂或对低浓度多糖不敏感等局限。表面增强拉曼散射(SERS)具有高灵敏度、水干扰小和提供分子指纹信息的优势,结合机器学习可实现定性识别和定量校准。因此,研究人员首次将SERS应用于四种真菌多糖标志物的光谱检测,并利用机器学习方法分析数据,探索其在临床诊断中的应用潜力。
研究人员制备了纳米结构银薄膜SERS基底,利用电子束蒸镀法沉积于玻璃片上。β-1,3-葡聚糖从酿酒酵母(Saccharomyces cerevisiae)中提取,β-1,6-葡聚糖和甘露聚糖从白色念珠菌培养物中提取,半乳甘露聚糖从烟曲霉培养物中提取。所有多糖的结构经核磁共振(NMR)确认。测量了多糖水溶液(10 pg/mL至100 μg/mL)以及含HSA(45 mg/mL)的模型血清加标溶液(10 pg/mL至100 ng/mL)的SERS光谱。光谱预处理包括截取260–1750 cm
-1范围、基线校正(asPLS)、标准正态变量(SNV)归一化和Isolation Forest异常光谱剔除。数据分析采用主成分分析(PCA)可视化,偏最小二乘(PLS)回归用于分类,带L1正则化的PLS(PLS-L1)用于构建浓度校准曲线。盲测样本为150和500 pg/mL的加标HSA溶液,共8个独立制备样本,每个样本测量50个光谱。模型适用域通过训练集导出的光谱轨迹准则确定,以模型预测与独立浓度估计的一致性为评分依据。
#### SERS基底表征
原子力显微镜(AFM)显示基底为多晶自组织纳米结构,均方根粗糙度Rq=2.2±0.5 nm,峰谷高度R3z=9.8±0.9 nm,偏度Rsk=0.21±0.05,自相关长度λa=180±15 nm。增强因子(EF)约9.6×10
3,与文献值一致。三个独立批次基底的特征峰强度相对标准偏差(RSD)均低于25%,表明形貌和光谱重现性良好。
#### 固定浓度分析物集的SERS光谱比较
在10 pg/mL至100 μg/mL的每个固定浓度下,PCA得分图显示四种多糖的谱点云呈分离趋势,其中半乳甘露聚糖分离最明显。线性分类模型的混淆矩阵表明,各浓度下分类准确率为0.91–1.00;最低准确率出现在100 ng/mL时,模型混淆了半乳甘露聚糖与β-1,3-葡聚糖。载荷分析识别出大量贡献于分类的拉曼位移,但具体振动归属需进一步研究。
#### 固定分析物浓度系列的SERS光谱比较
对同一分析物不同浓度的光谱进行PCA分析,发现所有多糖在浓度高于1 μg/mL时谱点云有分离趋势,自1 μg/mL以下随浓度降低光谱特征发生渐变,1 μg/mL为过渡浓度。分类准确率矩阵显示各分析物浓度系列的区分准确率为0.84–0.96,半乳甘露聚糖和甘露聚糖准确率最高(0.95和0.96),仅相邻浓度(如10与100 ng/mL)存在轻微混淆。载荷表明大量谱带参与浓度区分。
#### HSA模型矩阵中的分析物校准
将浓度校准构建为回归问题,以y=log
10(C+ε)为目标变量,采用PLS-L1模型。训练集交叉验证的校准图显示预测值与真值近乎完美一致(R
2≈1.00)。训练集适用域得分的第95百分位数作为接受阈值,分别为β-1,3-葡聚糖0.095、β-1,6-葡聚糖0.119、半乳甘露聚糖0.087、甘露聚糖0.112 log
10单位。盲测光谱经适用域筛选后,谱级R
2为0.684–0.876,MSE为0.008–0.022 log
102单位;样本级(中位数)盲测R
2=0.834,MSE=0.011 log
102单位。载荷分析发现大量拉曼谱带参与判别,且部分与纯多糖浓度实验中的载荷位置重叠,表明基质效应导致整体光谱的整合变化。
讨论部分指出,该HSA模型不能完全代表真实临床基质,但白蛋白是血清中小于100 kDa分子量范围的主要蛋白成分,可视为最主要的检测背景。未来研究将转移到真实临床样本,同时考虑患者和健康供体的基质变异性。研究结论为:SERS结合机器学习可实现对致病真菌细胞壁多糖组分——β-1,3-和β-1,6-葡聚糖、白色念珠菌甘露聚糖以及烟曲霉半乳甘露聚糖——的定性定量检测。研究覆盖10 pg/mL至100 μg/mL的水溶液浓度范围,并证实了浓度依赖性光谱动态变化。在45 mg/mL HSA模拟血清中,100 ng/mL至10 pg/mL浓度范围内可实现准确检测。校准模型正确恢复了光谱特征与浓度的关系,训练集R
2≈1.00。盲测中,结合正则化PLS回归与稳健z-score过滤,获得了R
2=0.85–0.87、MSE≈0.01的校准指标。该方法有望扩展至其他病原体多糖标志物,并发展为临床多糖定量检测方法。