大语言模型分子表示依赖性研究:基于Qwen3.6与ChemBERTa-2的多表示系统一致性与机制分析
《Digital Discovery》:Notation matters: cross-representation inconsistency in chemistry language models and its mechanistic originsOpen Access
【字体:
大
中
小
】
时间:2026年09月25日
来源:Digital Discovery 7.1
编辑推荐:
大语言模型(LLMs)越来越多地应用于分子性质预测,但它们究竟是编码了不依赖于表示法的分子表征,还是仅利用表面层的字符串模式,这一点尚未得到检验。我们提出了一项双阶段研究:对Qwen3.6(350亿参数的混合专家模型)在四种表示系统(SMILES、IUPAC、InChI、SE
大语言模型(LLMs)越来越多地应用于分子性质预测,但它们究竟是编码了不依赖于表示法的分子表征,还是仅利用表面层的字符串模式,这一点尚未得到检验。我们提出了一项双阶段研究:对Qwen3.6(350亿参数的混合专家模型)在四种表示系统(SMILES、IUPAC、InChI、SELFIES)下对1072个ESOL分子进行查询;并通过表示层隐藏状态替换,将ChemBERTa-2编码器中的表示法差异进行定位。从行为层面看,在1072个ESOL分子中,88.0%表现出跨表示法不一致性(平均跨度1.69 log S;中位数1.30 log S)。SELFIES在四种表示法中实现了最低的正负翻转率(1.7%,而SMILES为5.4%;Fisher精确检验:OR=3.34,p=6.2×10??);InChI实现了最低的平均绝对误差(MAE,0.887 log S),表明表示法选择对灾难性预测误差与平均预测误差的影响方式截然不同。羧酸/酯类化合物是最不一致的结构类别(平均跨度2.15 log S;Kruskal–Wallis检验p=1.5×10??)。从机制层面看,对ESOL中全部1051对有效的增强SMILES进行表示层隐藏状态替换,结果显示76.6%的配对在最优层替换后得到改善;没有任何配对出现退化(平均改善0.62 log S [95%置信区间:0.57, 0.66];Wilcoxon检验p=1.06×10?133)。表示法差异分布在编码器的低至中层(L0–L4)。在该规模下,不一致性与不准确仍保持正交(Spearman ρ=?0.059;p=0.055;n=1051),证实表示法是一种以准确性为核心的基准测试无法检测到的隐性混杂因素。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号