由样本均值和方差驱动的预测分布的渐近性质

《Journal of Applied Probability》:Asymptotics of predictive distributions driven by sample means and variances

【字体: 时间:2026年08月11日 来源:Journal of Applied Probability 0.6

编辑推荐:

  设αn(·) = ?(Xn+1 ∈ · ∣ X1, …, Xn)为p维随机向量序列(X1, X2, …)的预测分布。假设α

  
设αn(·) = ?(Xn+1 ∈ · ∣ X1, …, Xn)为p维随机向量序列(X1, X2, …)的预测分布。假设αn = ??(Mn, Qn),其中Mn = (1/n)∑i=1nXi,Qn = (1/n)∑i=1n(Xi – Mn)(Xi – Mn)?。则存在?p的Borel子集上的随机概率测度α,使得‖αn – α‖a.s.→ 0,其中‖·‖为全变差距离。给出了α的显式表达式,并证明了‖αn – α‖的收敛速度可任意接近n–1/2。此外,即使αn = ?(Mn, Qn),其中?属于远大于正态分布的一类分布,‖αn – α‖a.s.→ 0仍然成立。预测分布αn在包括贝叶斯预测推断和预测重抽样在内的多种框架中具有实用性。最后,研究了基于Copula的预测分布的渐近行为,并进行了数值实验。
**论文解读:基于样本均值和方差的预测分布渐近性分析**

**研究背景与问题**

预测分布是序列数据分析中的核心概念,它描述了在给定历史观测条件下未来观测值的条件分布。在贝叶斯预测推断、预测重抽样、机器学习、因果推断等众多统计框架中,预测分布的选择直接决定了推断的有效性与计算效率。然而,如何构造一个既简单易用又具有良好渐近性质的预测分布序列,仍是一个开放问题。现有方法如基于Copula的预测分布(Hahn et al., 2019)虽然能够处理非高斯数据,但其收敛性往往依赖于权重序列和Copula密度的特定选择,且在全变差距离下的收敛不一定成立。此外,许多预测分布序列的计算复杂度较高,限制了其在大规模数据中的应用。因此,研究人员旨在设计一种基于样本均值和协方差矩阵的新预测分布序列,该序列应具有显式的结构、快速的收敛速度,并能在多种推断任务中表现良好。

**研究内容与结论**

本文针对p维随机向量序列,提出了一类新的预测分布序列αn = ?(Mn, Qn),其中Mn和Qn分别为基于前n个观测的样本均值向量和样本协方差矩阵,?是一个满足矩条件和密度存在的分布族(包括正态分布等)。主要结论包括:(1)αn几乎必然在全变差距离下收敛到一个随机概率测度α = ?(M, Q),其中M和Q分别为Mn和Qn的几乎必然极限;(2)当?取正态核时,收敛速度可任意接近n–1/2;(3)对于Copula型预测分布βn,给出了其全变差收敛的充分条件(如权重序列可和或平方可和且Copula密度有界),并指出在一般情况下βn可能仅弱收敛而不全变差收敛。数值实验表明,αn在收敛速度上显著优于βn,且在预测重抽样(PR)框架下对总体均值、方差、偏度、峰度及中位数的估计中,αn的均方根误差(RMSE)更小,后验方差更合理,计算时间仅为βn的极小部分。该研究为预测分布的构造提供了新的简单有效工具,尤其适用于PR方法。论文发表在《Journal of Applied Probability》。

**主要关键技术方法**

研究人员首先利用Ionescu–Tulcea定理,将随机向量序列的联合分布完全由预测分布序列指定,从而允许任意选择预测分布。然后,针对新序列αn,通过鞅理论证明Mn为L2有界鞅,从而几乎必然收敛;利用拟鞅理论证明Qn的每个分量几乎必然收敛。进一步,借助全变差距离的上界估计(基于正态分布间距离的已知不等式),证明当? = ??时收敛速度可任意接近n–1/2。对于Copula型预测分布βn,通过构造随机变量Dn并分析其期望,推导出全变差收敛的充分条件。数值实验部分,研究人员从混合t分布生成样本,采用模型聚类(mclust R包)确定初始混合结构,并利用预序对数似然优化选择Copula参数ρ,随后运行PR算法(B = 1000次重复,N = 5000)比较两种预测分布的表现。

**研究结果**

**2.2 新预测分布的渐近性**

**定理1**:若αn由(3)式定义,则Mn和Qn几乎必然收敛到M和Q,且Q几乎必然属于正定矩阵集合??。进而‖αn – α‖a.s.→ 0,其中α = ?(M, Q)。该结论通过将序列表示为基于独立同分布随机向量Zi的递推形式,利用鞅和拟鞅收敛定理证明。

**定理2**:设? = ??,取任意常数序列dn,若dn/√n → 0,则dn‖αn – α‖?→ 0。收敛速度接近n–1/2,且该上界是最优的(因为√n‖αn – α‖不依概率收敛到0)。证明基于正态分布全变差距离的上界不等式以及Mn和Qn的矩估计。

**2.3 基于Copula的预测分布**

**定理3**:若∑n rn < ∞,则βn几乎必然在全变差意义下收敛(即存在随机密度f)。证明通过构造Dn并利用期望有界性。

**定理4**:若∫f0(x)2dx < ∞,∑n rn2 < ∞,且Copula密度cn有界,则βn全变差收敛。证明利用条件期望和二阶矩估计。

**例4**:当limsupn rn > 0且cn = c固定(且∫∫|c(u,v)–1|dudv > 0)时,βn不全变差收敛,仅弱收敛。

**3.2 收敛速度数值比较**

对于αn(取?=??),L1距离‖f0 – fnα1约150次迭代后稳定。对于βn,当rn = rn(a)且ρ=0.9时,约4000次迭代后才稳定;当rn = rn(b)(∑rn<∞)或ρ=0.4时,收敛更快;当rn = rn(c)(含常数项)时,βn不收敛。αn的最终距离大于βn,表明其重构的不确定性更多。

**3.3 参数估计数值比较**

基于混合t分布(s=50至2000)的模拟:αn的RMSE均值(0.818)远小于βn(2.731),而后验方差均值αn(0.206)大于βn(0.019),说明αn的后验分布更集中真值。95%置信区间覆盖真值的次数:αn为15次,βn仅3次(共30种组合)。计算时间上,αn(0.012–0.026分钟)远快于βn(5.10–9.98分钟),且随s增大,βn时间增长显著。

**讨论与结论**

本文引入并研究了新预测分布序列αn = ?(Mn, Qn),证明了其全变差收敛,给出了极限的显式表达式。在?=??的特殊情形下,收敛速度达到n–1/2。与Copula型预测分布βn相比,αn在全变差收敛方面具有保证,且数值实验表明其在收敛速度和参数估计精度上均优于βn。未来研究方向包括:给出使αn仍保持n–1/2收敛速度的?的条件;将αn应用于回归问题(如Fong et al., 2019中使用βn的方式)。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号