基于PTTB-600的长尾植物分类学知识大型语言模型基准测试

《Diversity》:Benchmarking Large Language Models on Long-Tail Plant Taxonomic Knowledge with PTTB-600

【字体: 时间:2026年09月04日 来源:Diversity 2.1

编辑推荐:

  植物分类学知识包含一个由不常遇到的名称、诊断性状和命名决策组成的长尾(long tail),然而模型在这一分布上的可靠性仍不清楚。研究人员开发了中文版PTTB-600,包含200道普通题、300道普通专业题和100道长尾填空题,并在无检索增强的闭卷条件下评估了

  
植物分类学知识包含一个由不常遇到的名称、诊断性状和命名决策组成的长尾(long tail),然而模型在这一分布上的可靠性仍不清楚。研究人员开发了中文版PTTB-600,包含200道普通题、300道普通专业题和100道长尾填空题,并在无检索增强的闭卷条件下评估了31个大语言模型(large language models, LLMs)或运行模式。第一作者起草了题库和答案;三位拥有植物分类学博士学位的共同作者独立审查了这些内容。所有模型在普通题上至少获得197/200分,21个模型获得满分。得分最高的六个模型回答了291–297/300道普通专业题(97.0–99.0%),但在长尾填空题上仅达到63.0–90.0%的准确率。Gemini 3.1 Pro Preview以587/600位列第一;第二至第六名形成紧密聚集的簇,经Holm校正后相邻差异不显著。在11个族内比较中,思考模式(thinking mode)的运行多答对20–65道题,主要出现在专业题和填空题上。事实性错误在常规本科内容中不常见,且集中于罕见属名生成、精细诊断区分和替代命名处理。表现最佳的大语言模型可在教师监督下为常规教学提供可靠支持,而长尾鉴定和命名决策需对照权威来源进行验证。
植物分类学是生物多样性描述、鉴定、监测和保护的基础,其知识体系融合了系统发育关系、形态学术语、检索表、命名规则以及不断修订的分类处理。与由少量高频概念主导的领域不同,植物分类学包含一个常见的教学核心和一个大得多的长尾(long tail,即低频遇到的科属名称、稀有性状组合、同义词和依赖来源的限定描述)。这种结构在生物多样性实践和本科教学中都至关重要,但学生和教师对植物意识、分类概念和类群识别存在持续困难。虽然大型语言模型(large language model, LLM)已被用于备课、讲解生成、出题、课堂互动和自主学习,但总体性能无法揭示残余错误是影响常规课程内容还是集中在需要专家验证的低频任务。通用基准如MMLU、OpenCompass、MT-Bench和Chatbot Arena比较广泛知识,但对单一分类学领域内的低频事实分辨率有限。因此,研究人员开发了植物分类学教学基准PTTB-600,以区分常规分类学能力与长尾任务上的错误。该研究发表于《Diversity》。

研究人员开发了包含600道题的PTTB-600,分为200道普通题(PTB-G)、300道普通专业题(PTB-D)和100道长尾填空题(PTB-L),并在无检索增强的闭卷条件下评估了31个LLM或运行模式。结果显示,所有模型在普通题上至少获得197/200分,21个模型满分;六个最高分模型在普通专业题上答对291–297/300,但在长尾填空题上仅达到63.0–90.0%。Gemini 3.1 Pro Preview以587/600排名第一;第二至第六名形成紧密簇,经Holm校正后相邻差异不显著。思考模式在11个族内比较中均优于非思考模式,多答对20–65题。事实性错误在常规本科内容中不常见,集中于罕见属名生成、精细诊断区分和替代命名处理。这项研究划定了当前LLM在植物分类学教学中的支持边界:常规教学可在教师监督下使用,而长尾鉴定和命名决策需对照权威来源验证。

在技术方法上,研究人员设计了PTTB-600,题目由第一作者起草,三位植物分类学博士共同作者独立审查。内容框架以Michael G. Simpson的《Plant Systematics》第3版为主要课程支架,并参考Judd等和Singh的教材,以及APG IV、国际藻类、真菌和植物命名法规、Angiosperm Phylogeny Website、Flora of China、Plants of the World Online、World Flora Online和International Plant Names Index等权威资源作为答案核查依据。所有问题为中文,拉丁学名按要求保留。评估采用文本输入、闭卷、无检索增强。统计上,使用项自助法(bootstrap)估计95%置信区间,配对McNemar检验和Holm校正比较相邻排名,Spearman秩相关分析参数规模与准确率的关系,并记录API价格。研究未涉及临床或人群样本队列。

3.1 总体表现与相邻排名差异。通过31个配置的完整评分,总体分数范围为410–587。Gemini 3.1 Pro Preview以587/600(97.83%)居首,Grok 4-20 reasoning、GPT-5.5、DeepSeek V4 Pro(思考模式)、Qwen3.6 Max Preview(思考模式)和Seed 2.0 Pro(思考模式)得556–566。第一与第二的差异经Holm校正后显著(校正后p=0.0056),而第二至第六之间相邻差异均不显著。在公开参数量的9个模型中,总参数量与PTTB-600准确率呈正相关(Spearman rho=0.69,精确置换p=0.044)。

3.2 知识层、答案格式与重复错误。普通题接近天花板,21个模型满分,其余至少197/200。六个最高分模型在普通专业题上准确率97.0–99.0%,但在长尾填空题上仅63.0–90.0%。选择题区分度小,全部模型选择部分得分299–310/310;填空题得分111–277/290,差异166题。20个最常错题均为填空题,涉及Apiaceae、Lamiaceae、Orchidaceae和Lauraceae等科中需要直接生成罕见属名或整合多个诊断性状的问题。

3.3 与思考模式相关的性能差异。在11个族内配对中,思考模式运行均优于非思考/默认模式,多答对20–65题(3.33–10.83个百分点)。差异在普通题上不超过1个百分点,而在普通专业题与长尾题组合上为4.75–16.25个百分点;填空题差异5.86–22.07点。说明思考模式主要改善需要整合多条线索和直接名称生成的任务。

3.4 准确率与已发布API价格。价格指数与准确率无单调关系。Gemini 3.1 Pro Preview得分587,价格指数14美元;DeepSeek V4 Pro(思考)得分556,价格指数5.22美元;有的高价模型得分低于低价模型。一次完整基准运行的估算成本因输出长度、缓存输入和推理令牌计费而异,价格排名与准确率排名不一致。

讨论部分指出,中心结果是常规本科植物分类学内容与长尾之间的清晰分离。领先模型在普通概念、科属识别和标准诊断判断上高度准确,残余差异主要来自低频开放式生成题。这支持在教师监督下使用顶级LLM进行概念讲解、备课、教学材料组织和课堂互动。事实错误在常规内容中少见,但在罕见名生成、精细性状区分和依赖来源的命名处理中风险升高。参数规模与总体准确率正相关,但
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号