词汇扩散:Ophthalmology Science期刊中披露人工智能辅助写作文章的语言特征

《Ophthalmology Science》:Lexical Diffusion: Linguistic Characteristics of Ophthalmology Science Articles with Disclosed Artificial Intelligence-Assisted Writing

【字体: 大 中 小 】 时间:2026年09月24日 来源:Ophthalmology Science 5.0

编辑推荐:

  目的:描述在披露了生成式人工智能(Generative Artificial Intelligence, AI)辅助写作的眼科学研究文章中讨论部分(discussion-section)的语言特征,并检查未披露文章中的时间性词汇模式。设计:横断面观察性研究。研

  
目的:描述在披露了生成式人工智能(Generative Artificial Intelligence, AI)辅助写作的眼科学研究文章中讨论部分(discussion-section)的语言特征,并检查未披露文章中的时间性词汇模式。设计:横断面观察性研究。研究对象:2024年1月至2026年5月发表在Ophthalmology Science上的原始研究文章。方法:根据生成式AI辅助写作的披露情况对文章进行分类。对讨论部分文本进行了Flesch阅读易读性(Flesch Reading Ease, FRE)、Flesch–Kincaid年级水平(Flesch–Kincaid Grade Level, FKGL)、Gobbledygook简易测量(Simple Measure of Gobbledygook, SMOG)、预定义的生成式AI相关术语、对照学术术语及其比率的分析。采用按出版年份和第一作者英语主导机构隶属状态的分层1:5重复重抽样(1,000次迭代),将披露AI辅助写作的文章与未披露文章进行比较。评估了未披露文章中的时间趋势。主要结局指标:FRE、FKGL、SMOG、术语密度以及AI相关与对照术语比值。结果:在633篇文章中,28篇(4.4%)披露了生成式AI辅助写作。在AI披露文章中,第一作者和通讯作者的英语主导机构隶属比例较低(分别为P = 0.008和0.012)。AI披露文章的FRE较低(11.97对21.59),FKGL较高(17.15对16.00),SMOG评分较高(17.82对17.12;P值分别<0.001、0.013和0.027)。重抽样产生的FRE平均Hodges–Lehmann位移为–7.35(95%重抽样区间,–8.90至–5.83),FKGL为1.06(0.80至1.32),SMOG为0.66(0.47至0.86)。AI披露文章中的AI相关术语密度和AI相关与对照术语比值较高(每1,000词22.38对15.71个术语,0.91对0.63;P分别为0.003和0.004),而对照学术术语密度无差异(P = 0.844);重抽样证实了这些词汇学发现。在未披露文章中,AI相关术语密度和比值随出版年份增加(所有P值均<0.001),而对照术语密度未增加(所有P值均>0.05)。结论:披露的生成式AI辅助写作并不常见,但与较低的基于公式的可读性、较高的估计阅读年级水平以及讨论部分中预定义的生成式AI相关词汇密度较高相关。未披露文章中的时间模式也提示AI相关词汇模式可能存在语料库水平的扩散,尽管披露状态并不能验证实际AI使用情况。
近年来,大型语言模型(Large Language Models, LLMs)的快速发展推动了眼科学在临床和教学领域的应用,同时生成式人工智能(Generative Artificial Intelligence, AI)工具也被引入科学写作过程,包括稿件起草、语言编辑和翻译。随着这类工具的普及,学术期刊逐渐要求作者透明披露LLM辅助写作情况,但在本研究开展前,披露的生成式AI写作辅助是否与已发表文章中存在可测量的语言差异相关,仍缺乏直接证据。已有研究多采用间接方法,如分析ChatGPT出现后的词汇时间变化或使用AI文本检测算法,但这些方法通常依赖时间代理或算法分类,而非文章层面的披露信息。此外,以往工作大多聚焦于摘要或总体发文特征,较少深入分析全文尤其是讨论部分的语言特征。因此,本研究旨在以正式披露声明作为锚点,比较同一期刊中披露和未披露AI辅助写作文章的讨论部分语言,并评估相关作者特征和时间趋势,从而为理解AI辅助写作在眼科科学写作中的语言影响提供实证依据。

研究人员开展了一项横断面观察性研究,纳入Ophthalmology Science期刊自2024年1月至2026年5月发表的633篇原始研究文章。研究以文章是否披露生成式AI写作辅助为依据进行分组,提取讨论部分文本,计算Flesch阅读易读性(Flesch Reading Ease, FRE)、Flesch–Kincaid年级水平(Flesch–Kincaid Grade Level, FKGL)和Gobbledygook简易测量(Simple Measure of Gobbledygook, SMOG)等可读性指标,同时利用预定义词典量化生成式AI相关术语和对照学术术语的密度及比值。为了控制混杂因素,研究使用分层1:5重抽样、Hodges–Lehmann位移估计、Mann–Whitney U检验以及回归分析等方法,并对未披露文章进行了时间趋势分析和留一法敏感性分析。

在讨论部分可读性方面,研究发现:与未披露AI辅助写作的文章相比,披露文章的中位FRE更低(11.97对21.59),FKGL和SMOG评分更高(17.15对16.00;17.82对17.12),差异均具有统计学意义(P值分别<0.001、0.013和0.027)。1,000次分层重抽样后,FRE平均位移为–7.35(95%重抽样区间,–8.90至–5.83),FKGL为1.06(0.80至1.32),SMOG为0.66(0.47至0.86),效应方向稳定。进一步分析底层成分显示,披露文章的平均每词音节数和每100词多音节词数更高,而讨论字数及平均句长无显著差异,提示可读性差异主要由词汇复杂性而非句子长度驱动。留一法分析中,FRE和FKGL在所有迭代中均保持显著差异,SMOG在22/28次迭代中保持显著。

在词典词汇分析方面,披露AI辅助写作的文章中预定义的生成式AI相关术语密度更高(每1,000词22.38对15.71,P = 0.003),AI相关与对照术语比值也更高(0.91对0.63,P = 0.004),而对照学术术语密度无显著差异(P = 0.844)。重抽样分析确认了这些词汇学发现,留一法分析显示AI相关术语密度和比值在所有迭代中均保持效应方向一致,而对照术语密度从未达到显著水平。

在未披露文章的时间趋势分析中,随着出版年份增加,未披露AI辅助写作文章的AI相关术语密度和比值均呈上升趋势(所有P值均<0.001),而对照学术术语密度未出现相应增加(P >0.05)。在调整第一作者英语主导机构隶属状态后,这一时间趋势仍然成立。该结果提示,即使在没有披露AI辅助写作的文章中,AI相关词汇模式也可能正通过学术写作生态逐步扩散。

讨论部分指出,披露AI辅助写作在研究中仅占4.4%,较为少见,且这类文章的第一作者和通讯作者中来自英语主导国家的比例更低,可能与英语非母语研究者使用AI工具缓解语言障碍有关。可读性方面的差异表现为词汇复杂度的增加,而非句子延长,这与一般预期中AI语言支持应提升清晰度的看法不同。未披露文章中也观察到AI相关术语的时间性增加,提示学术语言可能经历语料库层面的词汇扩散,因此未披露文章不宜被视为无AI暴露的纯粹对照组。讨论同时强调了局限性:披露属于自我报告,不能等同于实际AI使用;披露文章数量有限;单一期刊限制推广性;未控制亚专业和主题因素;可读性指标仅反映表面文本特征,无法评估写作质量或科学准确性。研究结论认为:披露生成式AI辅助写作的文章在讨论部分表现出可测量的语言差异,包括较低的可读性、较高的估计阅读年级水平和较高的预定义生成式AI相关词汇密度;未披露文章中的时间趋势支持AI相关词汇模式的语料库扩散。这一结果为期刊编辑政策、作者披露规范以及学术写作中AI使用的透明性讨论提供了数据支撑。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号