按年龄、性别和受教育程度划分的全球移民流动构成数据集

《Scientific Data》:A global dataset of immigration flow composition by age, sex and educational attainment

【字体: 时间:2026年09月08日 来源:Scientific Data 7.2

编辑推荐:

  不同年龄和不同教育背景的人具有不同的迁移模式。然而,按年龄和受教育程度划分的国际移民流动数据稀缺且并非总是可比。研究人员使用一种包含多个初始模型的超级学习算法(Super Learning, SL)来估计1990-1995年至2015-2020年六个五年期内1

  
不同年龄和不同教育背景的人具有不同的迁移模式。然而,按年龄和受教育程度划分的国际移民流动数据稀缺且并非总是可比。研究人员使用一种包含多个初始模型的超级学习算法(Super Learning, SL)来估计1990-1995年至2015-2020年六个五年期内199个国家男性和女性移民的年龄和教育构成。研究人员通过交叉验证(Cross-Validation, CV)以及使用多种评估指标将初始学习器与超级学习算法进行比较来评估其方法的性能。研究人员还将年龄构成估计值与欧洲统计局(Eurostat)的同等指标进行比较。估计结果表明,虽然所有地区的高等教育移民流动比例都在增加,但欧洲拥有最高的中等及以上教育移民流动比例。
随着人口转变的推进,生育率和死亡率降至低水平,自然人口增长趋于稳定,国际迁移因此成为人口变化的关键组成部分。迁移行为与年龄、性别和教育背景密切相关。为了评估迁移对原籍国和目的地国的影响,并制定可靠的人口预测,需要按这些人口特征划分的迁移流数据。然而,全球国际迁移流数据长期稀缺。按年龄和性别划分的数据主要集中于统计基础设施完善的高收入国家,而按教育程度划分的迁移流数据几乎在所有国家都缺失。现有研究多使用移民存量数据,但存量数据无法反映特定时期迁移模式的动态变化。此外,全球人口预测机构,如联合国经济和社会事务部(UNDESA),在人口预测中仅使用净迁移总量,不公开年龄和性别细分数据,限制了人口预测的精度。因此,开发新方法以估计全球移民流动的年龄和教育构成具有重要的科学和政策意义。

该研究发表于《Scientific Data》。研究人员利用IPUMS International数据库中的143个人口普查样本(覆盖74个国家,1990-2016年),样本总记录达4.63亿条,从中识别出253万近期移民个体,加权后相当于4000万移民。为了平滑小样本导致的年龄模式噪声,研究人员首先采用贝叶斯实施的Rogers-Castro七参数迁移年龄表进行预处理。随后,构建了一个包含12个不同超参数随机森林(Random Forest, RF)基学习器的超级学习算法(Super Learning, SL),以移民构成比例的对数作为响应变量,预测199个国家在1990-1995年至2015-2020年六个五年期内男性和女性移民的年龄和教育构成。研究人员通过交叉验证(Cross-Validation, CV)、基学习器比较、与欧洲统计局(Eurostat)年龄构成数据对比以及留一时期验证(Leave-One-Period-Out)全面评估了模型性能。

研究使用了来自IPUMS International数据库的143个人口普查样本(74个国家,1990-2016年)作为迁移数据来源。方法核心包括:1)应用贝叶斯实现的Rogers-Castro七参数迁移年龄表对原始年龄构成进行平滑,以处理小样本和年龄堆积;2)构建超级学习算法(SL),集成12个不同超参数设置的随机森林(RF)基学习器,以对数比例作为响应变量,通过10折交叉验证和非负最小二乘元学习器进行组合;3)采用包括人口年龄-性别-教育结构、移民存量、人类发展指数等全球数据库指标作为预测变量。通过交叉验证、Eurostat比较和留一时期验证评估模型。

在结果部分,研究人员首先报告了移民流动的年龄和教育比例。预测结果显示,各国移民年龄-教育构成差异显著。例如,澳大利亚和德国具有较高比例的高等教育移民,而孟加拉国和尼日利亚移民以低教育水平为主。南非的年轻劳动年龄移民比例较高。时间趋势上,澳大利亚、德国和美国的高等教育比例上升,而中国和斐济的中学教育比例增幅最大。墨西哥在2005-2010年期间15岁以下移民比例增加,可能与从美国返回的移民有关。性别之间的构成差异很小。

其次,关于预测变量,通过置换方法计算变量重要性,发现年龄组是最重要的预测变量,其次是人口年龄和教育结构相关变量。该重要性仅用于解释,不用于变量选择。

第三,数据记录方面,数据集包含199个国家、六个五年期、2个性别、16个年龄组、4个教育水平组合下的移民流动比例,以CSV格式在Zenodo平台公开获取。

第四,技术验证方面,交叉验证结果表明,包含Rogers-Castro平滑的超级学习算法优于所有基学习器和未平滑的SL。SL的交叉验证均方误差(Mean Squared Error, MSE)远低于零膨胀泊松(Zero-Inflated Poisson, ZIP)、零膨胀负二项(Zero-Inflated Negative Binomial, ZINB)和负二项(Negative Binomial, NB)等备选模型。与Eurostat年龄构成数据比较的皮尔逊相关系数为0.86。留一时期验证的平均MSE为0.0001,表明模型具有良好的泛化能力。

在讨论部分,作者指出,与随机森林类似,SL模型擅长插值,但对训练数据范围之外的高比例值预测能力有限,因此高比例预测应谨慎解读。欧洲统计数据中的差异(如是否包含国外出生婴儿、避难者等)可能导致某些年龄组出现偏差。该研究的结论可翻译为:本文提出了一种新方法,利用IPUMS International数据库的可用数据估计按性别划分的移民流动的年龄和教育构成。研究人员的估计首次使人们能够更好地理解与人力资本损失和收益相关的国际移民流动的人口构成。这些估计也可能为按年龄、性别和教育进行的全球人口预测中使用的国际移民流动人口构成提供更可靠的基础。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号