IGA-POLLM:用于材料文献信息提取中提示优化的改进遗传算法

《Materials Genome Engineering Advances》:IGA-POLLM: An Improved Genetic Algorithm for Prompt Optimization in Materials Literature Information Extraction

【字体: 时间:2026年09月09日 来源:Materials Genome Engineering Advances 13.9

编辑推荐:

  基于大语言模型(LLM)的材料文献结构化知识提取受到异构报告、模式敏感性和提示依赖性的阻碍。在本研究中,研究人员提出了IGA-POLLM,一种无梯度的提示优化框架,该框架利用六个模式对齐的语义基因组件和一种具有动态交叉/变异调度、锦标赛选择和精英保留的改进遗传

  
基于大语言模型(LLM)的材料文献结构化知识提取受到异构报告、模式敏感性和提示依赖性的阻碍。在本研究中,研究人员提出了IGA-POLLM,一种无梯度的提示优化框架,该框架利用六个模式对齐的语义基因组件和一种具有动态交叉/变异调度、锦标赛选择和精英保留的改进遗传算法,将提示工程重构为离散组合搜索。以缓蚀剂文献作为材料文献模型系统,IGA-POLLM针对从解析后的PDF中严格基于JSON提取五个字段优化提示。一种基于分层F1的适应度函数结合混合匹配,使优化与实际数据库构建对齐。在包含130篇论文的数据集上,IGA-POLLM优于标准遗传优化(F1为0.8571对比0.8208),同时减少了运行时间(5.6小时对比8.2小时),在五个出版商间泛化(平均F1 > 0.85),并在五个主流LLM间持续迁移。该框架是模式驱动的,并可扩展到其他材料子领域。
材料科学文献的快速膨胀带来了海量非结构化信息,这些信息涉及材料成分、加工参数、服役条件与性能指标等。高效准确的结构化数据提取是加速材料发现、优化和设计的先决条件。然而,文献中的关键信息常分散在不同章节且表达方式高度异质,期刊风格差异进一步加剧了术语和表述的多样性,给大规模系统化复用带来挑战。早期的人工标注效率低且主观性强;基于规则或传统机器学习(NLP)的方法依赖专家定义和大量标注,泛化能力有限。大语言模型(LLM)展现出深度语义建模潜力,但其输出对提示设计高度敏感,在严格模式约束(如JSON输出)下,字段覆盖、数值规范化或格式的细微偏差即可破坏下游解析。现有提示优化策略,包括专家经验调优、白盒梯度方法、黑盒离散搜索及启发式组合优化,在自动化程度、领域迁移性、评估成本、收敛稳定性与可解释性方面存在不足。为此,研究人员提出了面向材料文献信息提取的专用提示优化框架IGA-POLLM,以缓蚀剂文献为模型系统进行验证。该论文发表于《Materials Genome Engineering Advances》。

研究人员从Elsevier、Springer、美国化学会(ACS)、Wiley和MDPI五个主流出版商收集近5年缓蚀剂研究论文,经三位标注者独立标注并由第四位交叉验证,构建了含130篇文献的金标准数据集,其中30篇为优化训练集,100篇为测试集。技术方法包括:将提示分解为角色定义、缓蚀剂名称、金属基底、实验环境、缓蚀效率、测试方法六个模式对齐的语义基因组件,每个组件四种表达风格,编码为整数染色体,形成46(4096)种组合;采用改进遗传算法(IGA),包括动态指数衰减的交叉/变异概率(K=3)、锦标赛选择(竞赛规模3)、单点交叉、随机等位基因突变和精英保留;适应度函数采用分层F1分数,结合精确匹配、关键片段匹配和序列相似度(阈值0.7)的混合匹配策略;使用pdfplumber提取带坐标的文本并重建断字,最终以严格JSON模式输出五个字段。

3.1 IGA性能验证实验
3.1.1 IGA与GA对比实验:在30篇文献上、相同种群和迭代预算下,IGA达到F1=0.8571,优于标准遗传算法(GA)的0.8208;运行时间从8.2小时降至5.6小时。10次独立重复实验表明IGA平均最佳F1为0.8496±0.0067,GA为0.8155±0.0154,证明IGA收敛更快且更稳定。
3.1.2 基于不同数据集规模的IGA验证实验:分别使用10、20、30篇文献进行优化,三种规模下适应度曲线均在第11代收敛且最终F1均高于0.8,表明IGA对评估集规模不敏感。字段级分析显示,缓蚀效率初始F1最低(0.604),但优化后提升最大(+0.157);测试方法次之(+0.132)。提示风格统计表明,最终代中元素组合风格比例增至41.6%,说明算法偏好显式分解并重组实验要素的提示。10次运行中有6次收敛到同一最优染色体[2,3,1,3,1,1],显示搜索具有可重复性。
3.2 IGA-POLLM泛化性评估实验:对100篇来自五个出版商的文献进行端到端提取,所有来源的平均F1均大于0.85。其中MDPI表现最好且分布最集中,Wiley离散度较大。简单单栏版式比复杂双栏版式更少出现阅读顺序错误,但整体性能稳定,证明其对不同出版商和版式的鲁棒性。
3.3 提示设计方法对比实验:在相同数据上,IGA优化提示的F1=0.857,高于专家设计(0.815)和随机采样(0.816)。IGA的精确率(0.871)显著高于专家(
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号