《Annals of Epidemiology》:Estimating nationality from personal names in a multinational cohort: Performance of NamSor across country, regional, and onomastic classifications
编辑推荐:
背景:国籍、民族和地理背景在医学研究中经常需要,但在行政或基于注册的数据集中往往不可用。基于姓名的推断工具在预测原籍国方面表现出良好性能,但其近似法律国籍的能力尚不清楚。目的:评估NamSor在大型多国队列中根据个人姓名预测国籍的性能,并评估聚合到更广泛的地理
背景:国籍、民族和地理背景在医学研究中经常需要,但在行政或基于注册的数据集中往往不可用。基于姓名的推断工具在预测原籍国方面表现出良好性能,但其近似法律国籍的能力尚不清楚。目的:评估NamSor在大型多国队列中根据个人姓名预测国籍的性能,并评估聚合到更广泛的地理或人名学(onomastic)区域是否能提高分类准确性。方法:这项横断面研究包括11,989名马拉松参与者,代表137个国籍。官方比赛结果中记录的自我报告国籍作为参考标准。NamSor预测在国家层面、精细/粗略联合国(UN)区域层面以及预先定义的人名学(onomastic)宏观区域进行评估。性能通过不同概率阈值下的分类准确性(分类观察中正确预测的比例)进行评估。结果:国家层面准确性为60.2%。聚合提高了性能:精细UN区域为69.7%,粗略UN区域为75.2%。粗略人名学(onomastic)宏观区域达到最高准确性(88.3%)。提高概率阈值提高了分类观察中的准确性(例如,国家层面≥0.9时为92.5%),但显著减少了保留用于分析的观察比例,区域和人名学(onomastic)分类观察到了类似的权衡。结论:基于姓名的推断更接近语言-文化分组,而非确切的法律国籍。虽然在高度多国环境中国家层面预测显示出大量错误分类,但聚合到更广泛的区域或人名学(onomastic)类别显著提高了性能。因此,当直接国籍数据不可用时,更广泛的区域或人名学(onomastic)分类可能代表一种实用的替代方案。
在医学研究中,国籍、民族和地理背景是重要变量,但常缺失于行政或注册数据库,这促使基于姓名的推断工具如NamSor的发展。NamSor是一种基于人工智能的姓名分析系统,可预测原籍国、民族和性别,已有研究显示其在性别推断和原籍国预测上表现良好,但法律国籍推断面临独特挑战,因为名字反映语言文化起源而非当前国籍,移民、双重国籍、殖民历史等因素使直接推断复杂。目前尚无研究专门评估NamSor在大型多国队列中预测自我报告国籍的性能,也缺乏系统研究区域聚合的影响。因此,本研究人员开展这项研究,评估NamSor在国家层面、联合国(UN)区域层面(精细和粗略)以及预先定义的人名学(onomastic)区域层面的分类性能,并假设国家层面准确性有限,聚合到更宽区域能提高准确性。研究得出国家层面准确性为60.2%,聚合到精细UN区域提高至69.7%,粗略UN区域75.2%,粗人名学(onomastic)宏观区域88.3%。提高概率阈值提高准确性但降低覆盖率。重要意义在于揭示了基于姓名的推断更接近语言文化分组而非法律国籍,聚合区域可显著提高分类稳定性,为缺乏直接国籍数据的研究提供了实用替代方案。论文发表在《Annals of Epidemiology》。
本研究人员采用的技术方法主要包括:利用2025年六大国际马拉松(纽约、柏林、巴黎、上海、东京、迪拜)的官方比赛结果,纳入前1000名男女完赛者,最终样本11,989人,来自137个国家。通过NamSor的应用程序编程接口(API)提交参与者姓名,获取主要推测原籍国及概率,以自我报告国籍为参考标准。评估在国家层面、精细/粗略联合国(UN)区域(按UN地理方案)以及预先定义的人名学(onomastic)宏观区域(基于语言文化命名系统)的分类准确性,主要指标为分类准确性(正确预测占分类观察的比例),并计算不同概率阈值(≥0.5至≥0.9)下的准确性和覆盖率,统计软件为Stata 15。
**样本特征**:最终队列包括11,989名马拉松完赛者,代表137个国籍。最常见的国籍为中国(17.1%)、美国(15.5%)、法国(13.5%)、日本(9.6%)和英国(8.0%)。参与者来自所有有人居住的大洲,欧洲、亚洲和美洲比例最大。
**国家层面性能**:使用主要推测国家,NamSor正确分类7,222人,准确性60.2%,错误率39.8%。包括替代推测时准确性提高至70.5%。国家间差异显著:日本(98.7%)、埃塞俄比亚(95.8%)、伊朗(95.8%)、泰国(93.3%)、波兰(92.3%)和中国(92.0%)表现最高;委内瑞拉(0%)、秘鲁(7.7%)、澳大利亚(8.4%)、加拿大(8.8%)、新西兰(9.7%)和美国(15.5%)表现最低。错误模式与共享命名传统或移民历史相关。
**联合国区域分类**:聚合到精细UN区域,准确性从60.2%提高至69.7%(8,350/11,989);进一步聚合到粗略UN区域,准确性提高至75.2%(9,012/11,989)。精细区域中,东亚准确性最高(98.7%),其次为东欧(90.7%)和东非(89.9%);加勒比(33.3%)、南非(30.7%)、北美(20.8%)和澳新(16.7%)较低。粗略区域中,亚洲(94.9%)和欧洲(80.9%)最高,美洲(38.3%)和大洋洲(16.4%)较低。
**人名学分类**:精细人名学(onomastic)分组(重叠类别)中,中文文化圈(99.2%)、日本(98.7%)、伊朗(95.8%)、斯拉夫和巴尔干国家(91.0%)、伊比利亚-拉丁语国家(90.8%)和东非及非洲之角(88.8%)准确性高;英语国家(68.6%)、东南亚国家(53.6%)、以色列(52.0%)和南非国家(37.4%)较低。粗略人名学(onomastic)宏观区域(互斥类别)总体准确性88.3%(10,591/11,989),其中东亚(98.7%)、东欧和中亚(93.4%)、撒哈拉以南非洲(91.9%)和伊比利亚-拉丁语圈(90.8%)最高,南亚和东南亚(64.1%)最低。
**概率阈值分析**:提高概率阈值与分类观察中准确性提高相关,但覆盖率逐渐降低。例如,国家层面:无阈值时准确性60.2%,≥0.9阈值时准确性92.5%,但仅31.0%的观察保留(3,716/11,989)。类似权衡在区域和人名学(onomastic)分类中观察到。
讨论部分总结:本研究发现基于姓名的推断更接近语言文化分组而非确切法律国籍。国家层面预测在高度多国环境中错误分类严重,聚合到更宽区域或人名学(onomastic)类别显著提高性能,粗人名学(onomastic)宏观区域准确性接近90%。这些结果强调了语言文化起源与法律国籍的概念区别,并表明聚合对提高分类稳定性的关键作用。当直接国籍数据不可用时,区域或人名学(onomastic)宏观区域推断可作为实用替代方案。研究结论:在大型多国队列中,基于姓名的推断在国家层面预测法律国籍性能有限,但聚合到更宽区域或语言文化分组显著提高准确性。粗人名学(onomastic)宏观区域准确性接近90%,为缺乏直接国籍数据的研究提供了方法论上可辩护的替代方案。