人工智能标记了超过25万份可疑的癌症研究论文

【字体: 时间:2026年07月21日 来源:Queensland University of Technology

编辑推荐:

  一种强大的新型人工智能工具揭示了现代科学中最大的诚信问题之一。在分析了1999年至2024年间发表的260万篇癌症研究论文后,研究人员发现,超过25万篇论文的写作模式类似于疑似由欺诈“造纸厂”撰写的论文。

  

一个新的机器学习系统已经标记出超过25万篇癌症研究论文,这些论文可能与所谓的“造纸厂”有关。

这项发表在《英国医学杂志》上的研究调查了1999年至2024年间发表的260万篇癌症研究论文。该研究由昆士兰科技大学公共卫生与社会工作学院和澳大利亚卫生服务与创新中心(AusHSI)的研究员阿德里安·巴内特教授与一个国际合作小组共同领导。

研究人员发现,超过25万篇论文的写作模式与那些因涉嫌造假而被撤回的研究相似。

造纸厂是出售虚假或低质量科学研究成果的公司。“他们正在以工业规模进行‘研究’,我们的发现表明,癌症研究中的问题比大多数人意识到的要大得多,”巴内特教授说。

造纸厂如何制造虚假研究

造纸厂出售作者身份,在某些情况下,还出售完整的现成科学论文。这些研究可能包含重复使用的文本,不寻常或尴尬的语言,以及捏造的数据或图像。

巴尼特教授说:“最有可能的是,他们依赖于样板模板,这些模板可以被分析文本模式的大型语言模型检测到。”

为了寻找这些模式,Barnett和他的同事们训练了一个叫做BERT的语言模型。该系统旨在识别在已知造纸厂产品中反复出现的细微文本“指纹”。

当使用经过验证的例子进行评估时,该模型在91%的时间内正确检测到可疑论文。

“我们基本上建立了一个科学的垃圾邮件过滤器,”巴内特教授说。

“就像你的电子邮件系统可以发现不需要的信息一样,我们的工具会标记出与我们在撤稿、欺诈作品中看到的写作风格和结构相匹配的论文。”

可疑的癌症论文激增

大规模分析揭示了几个主要趋势:

在过去20年里,被标记论文的比例大幅上升,从21世纪初的约1%上升到2022年的逾16%的峰值。

这个可疑的问题出现在大公司出版的数千种期刊中,包括那些声誉很高、影响力很大的期刊。

可疑论文在分子癌症生物学和早期实验室研究等领域尤其常见。

某些类型的癌症,包括胃癌、肝癌、骨癌和肺癌,标记研究的比例特别高。

期刊开始测试AI工具

三家科学期刊已经在测试该系统,作为其编辑评审过程的一部分。目的是帮助编辑在稿件被送到外部专家进行同行评议之前,识别出可能是伪造的稿件。

研究人员还计划将该工具应用于其他科学领域。他们预计,随着更多造纸厂活动的确凿例子的出现,其准确性将得到提高。

然而,研究小组强调,该系统识别出的论文不应自动被视为欺诈。这些结果是警告信号,而不是被证实的不当行为,每个案例仍需要由人类专家进行审查。

为什么虚假研究会伤害患者

巴尼特教授说:“癌症研究影响着临床试验、药物开发和病人护理。”

如果捏造的研究进入了证据库,它们可能会误导真正的科学家,并最终减缓患者的治疗进展。这就是为什么我们必须提前解决这个问题。”

相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号