《Canadian Journal of Chemical Engineering》:On the defence of responsible human judgement in peer review
编辑推荐:
同行评议对科学进步至关重要。当它运作良好时,它结合了专业知识、公平性、适度性、怀疑精神、慷慨和谨慎。当它失败时,它就成了自我展示、懒惰、胁迫以及最近依赖人工智能工具的舞台。编辑、审稿人和作者必须联合起来,确保同行评议仍然是评判科学出版物质量的可靠工具。本文旨在
同行评议对科学进步至关重要。当它运作良好时,它结合了专业知识、公平性、适度性、怀疑精神、慷慨和谨慎。当它失败时,它就成了自我展示、懒惰、胁迫以及最近依赖人工智能工具的舞台。编辑、审稿人和作者必须联合起来,确保同行评议仍然是评判科学出版物质量的可靠工具。本文旨在澄清审稿人的职责:由人类专家对科学工作进行严谨和公平的评估,这些专家理解,他们的角色不是重新设计作者的研究计划、操纵引用以谋取私利、将判断外包给大型语言模型(Large Language Models, LLMs),或者违反同行评议原则所依赖的信任。
# 论文解读:论同行评议中负责任的人类判断的辩护
## 研究背景与问题
同行评议是科学出版质量保障的核心机制,但当前面临严重危机。尽管已有大量关于如何审阅科学文章的出版指南,但这些文献大多关注发表伦理,却很少聚焦审稿人角色的边界以及权力和工具的滥用问题。随着大型语言模型(Large Language Models, LLMs)等生成式人工智能工具的兴起,审稿人可能将评估职责外包给算法,导致评审质量下降、学术伦理受损。此外,同行评议体系本身存在悖论:它依赖未经正规培训的志愿者,且审稿人常出现注意力不集中、判断失误、认知偏差等问题。更严重的是,已观察到多种不良趋势,包括:审稿人将生成式AI作为替代审稿人、评审过于肤浅或纠缠于细节、无正当理由推荐拒稿或大修、超越评估范畴而试图重新设计作者的研究方案、以及操纵引用以牟私利。这些问题源于许多审稿人对自己承担的伦理任务认识不清,违背了同行评议所依赖的信任。
## 研究内容与结论
研究人员(Jo?o B. P. Soares 和 Thomas A. Adams II)在《Canadian Journal of Chemical Engineering》上发表了这篇观点文章,旨在阐明审稿人的职责边界,批判滥用权力的行为,并倡导回归负责任的人类判断。论文首先界定了审稿人的核心任务:评估论文的新颖性(或至少非平凡性)、科学合理性、方法与数据的透明度、以及清晰度与可读性。如果四项标准均满足,审稿人应建议发表(或提出适度修改)。论文随后系统分析了四种常见的角色扭曲:研究主管谬误(Research Director Fallacy)、矛盾性建议(Incoherent Recommendations)、引用胁迫(Citation Coercion)和算法越界(Algorithmic Overreach)。针对每种扭曲,研究人员指出了其表现形式、危害及纠正方法。最后,论文提出了改进审稿文化的具体措施,包括为审稿人、作者和编辑分别设计的检查清单,并强调“审稿人建议,编辑决定”的原则。结论指出,同行评议需要严谨但谦逊的态度,人类判断不可被算法取代。
## 关键技术与方法
本文为观点性论文,不涉及实验或数据采集,因此没有实验技术或样本队列。其主要方法包括:对同行评议伦理原则的文献分析,对大量观察案例(主要来自《Canadian Journal of Chemical Engineering》及其他期刊投稿中的审稿意见)的模式归纳,以及基于 Rapoport Rules 等经典准则的评审框架重构。文中提出了四个核心评估问题、四种角色扭曲的定义、以及面向不同参与者的检查清单(Checklist)。
## 研究结果
### 1 审稿人的职责边界
研究人员界定审稿人应回答四个基本问题:贡献是否新颖或非平凡?工作是否科学合理?方法和数据是否透明可重复?稿件是否连贯清晰?若均肯定,应建议发表。审稿人不应基于稿件不时尚、范围不够广或可能引用少而推荐拒稿。
### 2 研究主管谬误
审稿人常错误地假设自己有权重新设计研究方案,要求作者进行额外实验、分析、模拟等,超出评估有效性所必需的范围。这种“范围蔓延”(scope creep)鼓励保守主义,惩罚聚焦性的贡献,浪费作者和编辑时间。合法的额外工作需求应仅限于支撑主要结论所必需。
### 3 矛盾性建议
分为两类:肤浅审稿人(Superficial Reviewer)给出无细节的模糊意见;吹毛求疵型完美主义者(Hypercritical Perfectionist)堆砌大量次要意见制造严重缺陷假象。两者均损害评审,编辑应忽视肤浅意见,并区分夸大批评与真实缺陷。
### 4 引用胁迫
审稿人要求作者引用其自己或同行的论文,仅略相关或不相关。这是一种对审稿人特权的滥用。合法引用请求应基于学术必要性,而非个人利益。编辑应剔除或提醒作者忽略自私的引用要求。
### 5 算法越界
生成式AI工具在同行评议中的滥用日益严重。审稿人将稿件上传至外部AI系统,违反保密性;即使环境安全,AI也无法提供真正的人类科学判断(人类专业知识、怀疑精神、适度性、经验和问责)。AI生成的评审可能流畅但肤浅或错误,且无法被问责。AI最多只能润色审稿人自己的文字,不能替代判断。
### 6 有缺陷的评审本身
编辑应关注评审是否足够具体、专业、公平且有用,而非纠结于是否由AI生成。有缺陷的评审特征包括:无证据的大胆主张、不引用具体内容、自信但错误的陈述、要求模糊或无关的修改。作者有权以尊重和证据为基础进行反驳,编辑应拒绝无用评审并剔除不良审稿人。
### 7 迈向更好的审稿文化
同行评议是一种文化,需要期待、激励、示范和后果的塑造。编辑应给予审稿人反馈,认可高质量评审而非数量。早期职业研究者需要培训。审稿人应遵守:评估科学合理性、区分必要与可选修订、证明引用请求、保密、避免外包判断。编辑应有权否决不当建议,独立做出最终决定。
## 讨论与结论
论文的讨论部分强调了改进同行评议文化的系统性需求:不仅需要约束个别审稿人,更需要编辑作为“文化策展人”(curators)引导行为,给予作者反驳不公正评审的空间,以及建立培训、反馈和认可机制。研究结论部分翻译如下:
### 结论:严谨而无自我
同行评议是科学所依赖的制度之一。它不支付报酬,通常匿名,很少被赞扬,但其影响力巨大。评审塑造了稿件的质量和职业的进展。审阅稿件是一种学术管理行为。这种管理需要严谨:审稿人必须识别不合理的论点、无支持的结论、缺失的对照、弱分析、夸大主张和不清的写作。但严谨而不谦逊会迅速变为傲慢。审稿人必须记住稿件不属于他们,他们的任务不是重新设计研究项目、强加他们偏好的方法、收割引用、试图胜过作者或将判断外包给算法。最佳审稿人将怀疑精神与慷慨结合起来,既不陶醉于临时权力,也不被动阅读。他们必须避免引用操纵、苛刻批评或无界的范围蔓延。他们是技术文献的谨慎管理者。他们明白批评容易,评判困难,负责任的判断是费时但不可或缺的任务。同行评议仍将不完美,因为它依赖忙碌、有偏见、易犯错的人类。但用打磨过的算法输出取代人类判断不会改善同行评议,只会掏空它。对不完美人类判断的答案不是放弃判断,而是对其进行规范训练。审稿人的职责简单但不易:评估稿件的科学性、新颖性、清晰性和意义;帮助作者尽可能诚实有效地呈现工作;用适度与谨慎建议编辑;记住匿名不是不负责任的许可证。同行评议是一种管理行为,而非支配。