一种用于解耦有向网络中协变量对同质性和互惠性影响的潜在空间模型
《Computational Statistics & Data Analysis》:A Latent Space Model for Disentangling the Effect of Covariates on Homophily and Reciprocity in Directed Networks
【字体:
大
中
小
】
时间:2026年09月04日
来源:Computational Statistics & Data Analysis 1.7
编辑推荐:
# 摘要
量化协变量对互惠(即行为者形成相互关系的倾向)和同质性(即行为者倾向于与相似个体建立联系的倾向)的影响,是分析有向网络的一项基本任务。然而,在许多二元依赖网络模型中,控制这两个机制的参数的协变量效应往往混杂在一起,使其解释变得困难。为了解决这一问题,本文提出了一种
# 摘要
量化协变量对互惠(即行为者形成相互关系的倾向)和同质性(即行为者倾向于与相似个体建立联系的倾向)的影响,是分析有向网络的一项基本任务。然而,在许多二元依赖网络模型中,控制这两个机制的参数的协变量效应往往混杂在一起,使其解释变得困难。为了解决这一问题,本文提出了一种新的潜在空间模型,该模型通过将联系形成的边际概率模型与联系之间的依赖结构分离开来,从而将协变量对同质性和互惠的影响解耦。本文提出了两种贝叶斯推断程序,以确保在不同网络规模下都能实现可行的估计。对于小到中等规模的网络,引入了哈密顿蒙特卡洛算法从参数的后验分布中采样。对于大型网络,则开发了该后验的结构化平均场变分近似以及一种快速的随机变分推断算法。通过模拟研究和对美国青少年健康纵向调查(National Longitudinal Survey of Adolescent Health)中的友谊网络的实证应用,验证了该方法在确定协变量如何影响互惠和同质性方面的能力。
# 引言
网络数据是研究各领域涌现的复杂系统的重要组成部分,如社会科学、生物学和信息技术(Girvan和Newman,2002;Kolaczyk,2009;Malliaros和Vazirgiannis,2013)。网络表示实体(即节点,可以是人、基因、网站或任何感兴趣的单位)对之间的关系或边。这些信息通常用一个 $n \times n$ 的邻接矩阵 $Y$ 表示,其元素 $\{Y_{ij}: 1 \leq i, j \leq n\}$ 描述节点 $i$ 与节点 $j$ 之间的关系。网络通常是有向的,意味着两个节点之间的关系可以是非对称的。例如,在在线社交网络中,节点 $i$ 可能与节点 $j$ 的内容互动,反之却未必成立。由于网络数据的复杂性,统计网络分析已成为研究人员获得对复杂系统结构背后的随机倾向的严格洞见的不可或缺的工具。关于网络数据和统计网络分析的概述,请参阅Goldenberg等人(2010)和Kolaczyk(2020)。
分析有向网络数据的一个突出目标是确定节点属性如何影响形成网络结构的随机倾向(Kandel,1978;McPherson等人,2001;Wimmer和Lewis,2010)。本文聚焦于网络形成背后的两个基本随机机制:同质性和互惠。同质性是具有相似属性的节点形成连接的倾向,互惠是节点形成相互(或对称)关系的倾向。例如,图1展示了从美国青少年健康纵向调查中收集的学生之间的友谊关系网络(Moody,2001)。该可视化表明,此网络具有同质性,并且基于学生的属性互惠性增加,即同性别和同年级的学生往往是朋友,且他们的友谊往往是相互的。在统计术语中,确定节点协变量对同质性和互惠的影响,分别转化为量化它们对联系形成的边际概率 $\mathbb{P}(Y_{ij}=1)$ 以及联系 $Y_{ij}$ 和 $Y_{ji}$ 之间关联的影响。
为此,已提出多种统计模型来捕捉有向网络中的同质性和互惠。许多模型基于边变量联合分布的对数线性参数化,其协变量效应在条件概率的意义上进行解释,例如 $\mathbb{P}(Y_{ij}=1 \mid \{Y_{lk}:(l,k)\neq(i,j)\})$。这类方法的例子包括指数随机图模型(ERGMs)(Frank和Strauss,1986;Lusher等人,2013;Vu等人,2013)以及几种条件独立的二元模型,如p1模型(Holland和Leinhardt,1981)、p2模型(van Duijn等人,2004;Zijlstra等人,2006)、特定的随机块模型(Holland等人,1983;Wang和Wong,1987)和特定的潜在空间模型(Loyal等人,2025)。这些模型适用于用比值比衡量互惠。此外,这些模型可以量化条件同质性,即在给定网络中其余联系的情况下,节点属性对形成联系的概率的影响。然而,这些对数线性模型不适合量化边际同质性,即节点属性对联系形成边际概率的影响。事实上,协变量对这两种同质性的影响可能截然不同;有关具体示例,请参见第2节中的图2。这种差异产生的原因是,协变量对条件同质性的影响考虑了联系互惠的倾向,而边际同质性则不然。因此,当科学目标是区分协变量对联系形成的边际效应与其对联系互惠的影响时,需要另一种方法。
一种解耦这些效应的解决方案是直接建模联系形成的边际概率和联系之间的关联结构。据我们所知,网络文献中这种方法的唯一例子是加性和乘性效应网络(AMEN)模型(Hoff,2021),该模型通过多元Probit模型实现了这种解耦。AMEN模型是一种潜在空间模型(LSM)。潜在空间模型因其可解释性和灵活性之间的平衡而广受欢迎。通常,LSM为每个节点分配一个低维欧几里得空间中的潜在位置,并假设具有相似潜在位置的节点更可能在网络中形成连接。自引入以来,LSM已被扩展以捕捉网络的重要结构特性,包括同质性、度异质性、聚类和传递性(即三元组的形成)。尽管AMEN模型被广泛采用,但它不适合量化协变量对互惠的影响。关键在于,AMEN模型假设互惠在整个网络中是均匀的,因此无法量化由节点属性引起的互惠异质性。此外,AMEN模型的关联结构用潜在变量表示,因此无法直接转化为研究人员通常使用的互惠度量。
更广泛的LSM文献有结合协变量的历史;然而,这些方法未能解耦协变量对边际同质性和互惠的影响。各种LSM包含边级或节点级协变量来解释边际同质性。其他工作将潜在位置建模为节点协变量的函数,或反之,以揭示协变量与潜在网络结构之间的依赖关系。然而,这些方法仅推断协变量与影响边际同质性的网络结构之间的关系,因此无法推断协变量对互惠的影响。对于动态(随时间变化)网络,Yang等人(2017)和Huang等人(2022)开发了用于关系事件数据的LSM以捕捉纵向互惠,即回应先前互动的倾向。然而,纵向互惠与本工作研究的横截面互惠不同,横截面互惠描述的是在单次网络观察中相互联系同时发生的倾向。这种横截面互惠无法由Yang等人(2017)或Huang等人(2022)中的LSM捕捉,因为它们假设同一时间发生的边是独立的。此外,这些LSM不包含协变量。
为了解决这些局限性,本文引入了一种新的贝叶斯潜在空间模型,该模型通过分离联系形成的边际概率模型与联系之间的依赖结构,明确解耦协变量对边际同质性和互惠的影响,而不使用潜在变量。与我们现有方法相比,本方法的主要优势在于对协变量影响同质性和互惠的解释更为直接。此外,我们的参数化产生了比竞争方法更灵活的建模框架,因为它允许影响同质性的协变量与影响互惠的协变量不同。最后,与现有的LSM不同,我们通过引入节点特定的互惠效应来考虑节点在互惠倾向方面的异质性。
阻碍使用贝叶斯LSM的一个障碍是,对于大型网络,推断通常计算需求量大。因此,我们的第二项贡献是开发一系列估计程序,使得能够在不同规模的网络上进行贝叶斯推断。对于小到中等规模的网络,我们引入了哈密顿蒙特卡洛算法从参数的后验分布中采样。此外,我们针对大型网络构建了基于参数后验变分近似的估计,该近似保持了参数之间的重要依赖关系。变分近似在网络文献中有长期的应用历史,并应用于LSM推断。由于我们使用非共轭先验,我们开发了一种利用重参数化技巧产生低方差梯度估计的随机变分推断(SVI)程序。
本文的其余部分组织如下。第2节介绍了解耦协变量对边际同质性和互惠影响的拟议LSM。第3节提出了使用马尔可夫链蒙特卡洛和随机变分推断的贝叶斯估计框架。第4节包含一项模拟研究,展示了所提出的MCMC和SVI算法在模拟网络上恢复真实模型参数的能力。第5节将所提出的方法应用于根据美国青少年健康纵向调查构建的两个真实友谊网络。第6节包含简要讨论。拟议方法的Python包以及重现本工作结果的代码可在 https://github.com/joshloyal/lsmdhr 获取。
# 有向网络数据
考虑一个具有 $n$ 个节点的有向二值网络。我们在一个具有随机元素 $Y_{ij} \in \{0, 1\}$(对于 $1 \leq i, j \leq n$)的二值 $n \times n$ 邻接矩阵 $Y$ 中总结这些二元关系,其中若从节点 $i$ 到节点 $j$ 存在有向边则 $Y_{ij}=1$,否则为零。我们假设没有自环,因此对于 $i=1,\cdots,n$ 有 $Y_{ii}=0$。我们用 $\mathbf{y} \in \{0, 1\}^{n \times n}$ 表示观察到的邻接矩阵,其 $(i, j)$-元素为 $y_{ij}$。我们提出的模型聚焦于边变量对 $\{D_{ij}=(Y_{ij}, Y_{ji}): 1 \leq i < j \leq n\}$,即……
# 后验推断
以下我们采用贝叶斯方法进行推断,基于参数的后验分布估计模型参数 $\theta$,即:
$$p(\theta \mid \mathbf{Y}=\mathbf{y}, \mathcal{X}, \mathcal{Z}) \propto \mathbb{P}(\mathbf{Y}=\mathbf{y} \mid \mathcal{X}, \mathcal{Z}, \theta) \cdot p(\theta)$$
其中似然函数由方程(1)及方程(7)–(10)中的模型给出,$p(\theta)$ 为模型参数的先验分布。我们开发了两种估计方案,以确保能够对不同规模的网络进行推断。第一种方法使用马尔可夫链蒙特卡洛从后验中采样;
# 模拟研究
我们进行了两项模拟研究,以评估第3节中提出的MCMC和VI算法恢复模型参数的能力。第一项研究评估了随着节点数增加时VI算法的估计误差。第二项研究比较了在中等规模网络上使用VI算法和MCMC获得的估计的准确性。所有合成网络均由第2.3节中提出的模型生成,具有两个潜在维度,两个……
# 青少年健康数据集
在本节中,我们将所提出的方法应用于作为美国青少年健康纵向调查的一部分收集的两个真实友谊网络,该调查于1994年至1995年进行。友谊网络由一份在学问卷创建,该问卷面向来自84个社区的7至12年级的90,118名学生,学生们最多指定五名男性朋友和五名女性朋友。调查还记录了各种节点协变量,包括每位学生的……
# 讨论
在本工作中,我们引入了一种新的潜在空间模型,完全解耦了协变量对边际同质性和互惠的影响,这是现有的对数线性网络模型和潜在空间模型所无法实现的。此外,我们开发了一个贝叶斯推断框架,利用哈密顿蒙特卡洛和随机变分推断,为小型和大型网络提供估计。
此外,我们使用所提出的方法来揭示协变量如何影响
未引用引用 图4, 图7 Xiangyu Wu|Joshua Daniel Loyal
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号