《Frontiers in Research Metrics and Analytics》:Does interdisciplinary breadth shape research data sharing and citation impact? Evidence from six research fields
编辑推荐:
引言: 研究数据共享已成为开放科学的重要组成部分,然而共享收益在不同研究情境中存在差异。已有研究考察了影响数据共享的因素以及开放数据相关的引用优势,但关于跨学科广度与可观察共享实践之间的关系,以及共享的引用优势是否因学科而异,目前知之甚少。本研究探讨跨学科广度
引言: 研究数据共享已成为开放科学的重要组成部分,然而共享收益在不同研究情境中存在差异。已有研究考察了影响数据共享的因素以及开放数据相关的引用优势,但关于跨学科广度与可观察共享实践之间的关系,以及共享的引用优势是否因学科而异,目前知之甚少。本研究探讨跨学科广度、可观察共享实践与引用影响之间的关系。
方法: 本研究使用OpenAlex中索引的2020年至2025年间566,188篇期刊论文。跨学科广度以每篇论文关联的0级学科概念数量进行操作性定义。可观察共享实践通过存储库链接、补充材料链接和文本共享声明加以识别。研究人员采用回归模型考察六个研究领域中跨学科广度、数据共享与引用影响之间的关联,并在历史学和数字人文学中应用基于BERTopic的主题建模以探索主题层面的差异。
结果: 结果表明,跨学科广度与可观察共享之间呈现以负向为主但非线性的关联,共享概率通常随广度增加而下降,尽管在高水平上下降趋势有所减弱。总体而言,具有可观察共享信号的论文与更高的引用数量相关联,但该关联的幅度在不同领域间差异显著。历史学表现出最大的正向引用优势,而数字人文学呈现负向但统计上不确定的关联。主题层面分析进一步揭示,可观察共享集中于具有独特方法论和基础设施特征的具体研究主题。
讨论: 这些发现强调,开放实践及其学术回报受到学科情境的影响。因此,理解研究数据共享需要同时考虑研究人员的共享意愿以及不同研究学科中嵌入的基础设施和评价体系。
论文解读
一、研究背景与问题提出
开放科学运动日益重塑学术知识的产生、传播与评价方式。在研究数据共享这一核心实践中,研究数据既作为支撑已发表研究发现的证据,又作为促进验证、复制与再利用的宝贵学术产出。FAIR指导原则强调研究数据应具备可发现性、可访问性、可互操作性和可重用性,以最大化其科学价值。已有研究表明,公开研究数据可以提升学术可见性,并识别出影响研究人员共享意愿的多重因素,包括感知收益、误用担忧、数据管理成本、制度压力以及存储库基础设施等。然而,这些研究主要聚焦于个体层面的动机和组织条件,较少关注研究内容本身的特征如何塑造数据共享实践的可行性与可见性,也尚未充分回答研究内容特征(如跨学科广度)如何影响共享实践,以及共享的学术回报是否因研究情境而异。
跨学科广度指一篇论文从多个学科中汲取概念的程度,反映了论文研究内容的学科多样性。已有研究报道了不同研究领域在数据可用性和共享行为上的显著差异。在数据结构和存储库较为标准化的自然科学领域,数据共享已嵌入常规研究流程;而人文和社会科学研究往往涉及情境化、质性、阐释性或伦理敏感材料,需要更复杂的文档化、保存和访问方案。具有更大跨学科广度的论文可能面临额外挑战,因为其可能涉及异质的数据类型、方法论惯例和文档标准,这可能影响跨学科边界共同共享实践的形成。然而,跨学科广度与可观察共享实践之间的关系仍知之甚少。
此外,开放数据引用优势(ODCA)指与可访问研究数据相关联的论文往往比无可访问数据的可比论文获得更多引用。已有研究主要聚焦于数据基础设施相对成熟的领域,关于ODCA的幅度是否在不同出版文化、研究实践和数据特征的领域间存在差异,目前了解有限。同一领域内的研究主题在方法论取向、数据需求、伦理约束和再利用潜力方面也可能存在显著差异,因此领域层面的比较可能无法完全解释这种变异。基于上述背景,本研究提出三个研究问题:跨学科广度如何与可观察共享实践相关联;可观察共享是否与引用优势相关,且该关联如何在不同研究领域间变化;在引用优势形成对比的研究领域内,主题层面的可观察共享模式有何差异。
二、研究设计与主要技术方法
本研究采用数据驱动的研究设计,结合论文层面的文献计量分析与主题层面的语义分析。文献数据来源于OpenAlex开放学术知识图谱,该平台提供从0级到5级的层级概念分类系统,支持论文层面的跨学科广度测量。研究选取六个研究领域,分为三组:自然科学组(生物学、物理学)、人文社会科学组(历史学、社会学)和交叉学科组(生物信息学、数字人文学)。样本涵盖2020年至2025年间发表的566,188篇期刊论文。
研究采用三项关键方法:第一,数据共享实践识别采用三级程序,结合结构化元数据链接与非结构化文本挖掘,包括存储库链接匹配、补充材料URL模式识别以及基于正则表达式和语义规则的文本共享声明检测;第二,跨学科广度以OpenAlex中每篇论文关联的0级概念数量进行测量,遵循多样性理论中的种类维度;第三,统计分析采用线性概率模型(LPM)考察跨学科广度与共享之间的非线性关联,采用普通最小二乘法(OLS)回归模型估计共享的引用优势,并在历史学和数字人文学中应用BERTopic主题建模方法探索领域内部主题层面的共享模式差异。
三、研究结果
样本特征。 最终数据集包含566,188篇论文。生物学平均引用数最高(123.58),数字人文学最低(1.42)。社会学平均跨学科广度最高(4.17),生物信息学最低(2.34),表明通常被视为交叉学科的领域未必具有最高的0级概念数量。
学科与时间维度的数据共享模式。 共识别出16,811篇具有可观察共享证据的论文,其中数据共享记录15,960条,代码共享记录851条。物理学共享率最高(6.17%),其余五个领域均低于2.5%。2020至2025年间,大多数领域的共享率呈下降趋势,其中物理学下降最为显著,历史学和社会学波动明显。
跨学科广度与可观察共享的关系。 描述性分析显示,共享率随0级概念数量增加而下降。线性概率模型估计显示线性项为负(β = ?0.0184),二次项为正(β = 0.00131),转折点位于多样性得分为7.04处,表明负向关联在高广度水平上有所减弱。逻辑回归稳健性检验结果方向一致。
可观察共享引用优势的学科差异。 总体模型中,可观察共享与约9.78%更高的引用数量相关联。学科特定回归显示,历史学具有最大的正向估计(27.67%),其次为生物学(19.25%)、社会学(11.30%)、生物信息学(9.51%)和物理学(4.19%)。数字人文学是唯一呈现负向估计的领域(?19.93%),但该关联统计上不确定(p = 0.072)。
历史学与数字人文学的主题层面模式。 历史学中,共享率呈强烈右偏分布,高共享集中于涉及图像分析、定量方法和科学术语的少数计算型主题。数字人文学中,高共享集中于开放获取、可视化、工具和数据基础设施相关主题,而实质性人文阐释导向的主题共享率较低。
四、讨论与结论
研究结果揭示了跨学科广度与数据共享之间以负向为主的非线性关联,这与数据摩擦概念一致,即更广泛的学科覆盖可能涉及异质的数据格式、元数据标准、伦理惯例和文档要求,增加了为外部使用准备研究材料的协调和策展工作。总体引用优势估计与已有研究一致,但幅度在不同领域间差异显著。物理学中较小的估计可能与其领域内开放实践已相对常态化有关,共享不再具有显著的区分度;历史学中较大的估计可能与结构化可复用数据集的相对稀缺有关。数字人文学中的负向估计可能反映其共享产出通过文章引用之外的其他渠道获得认可,数据集、软件等数字学术产出在传统评价体系中尚未得到充分体现。
研究结论强调,开放实践及其学术回报受到学科情境的影响。理解研究数据共享需要同时考虑研究人员的共享意愿以及不同研究学科中嵌入的基础设施和评价体系。研究对数据共享平台、学科协会、资助机构、研究机构、出版商和评价体系提出了差异化支持建议,包括跨学科元数据映射支持、学科敏感性指导以及数据论文格式和明确数据引用实践等。研究局限性包括OpenAlex概念分类可能无法完全捕捉学科边界、抽样偏向高被引论文、规则化识别程序未经人工验证,以及观察性设计无法确立因果关系。