避免取对数与求导的双参数多元正态(Multivariate Normal)似然函数(Likelihood Function)最大化

《Research in Statistics》:Maximization of the two-parameter multivariate normal likelihood avoiding logarithm and differentiation

【字体: 时间:2026年06月02日 来源:Research in Statistics

编辑推荐:

  摘要:研究人员考虑给定来自k维多元正态分布(MVN(μ, M),其中μ为均值向量(Mean Vector),M为色散矩阵(Dispersion Matrix,即协方差矩阵)样本的均值向量与色散矩阵的似然函数(Likelihood Function, L(μ,

  
摘要:研究人员考虑给定来自k维多元正态分布(MVN(μ, M),其中μ为均值向量(Mean Vector),M为色散矩阵(Dispersion Matrix,即协方差矩阵)样本的均值向量与色散矩阵的似然函数(Likelihood Function, L(μ, M|x1,…,xn))最大化这一经典问题。尽管该问题的解已被熟知,但所有现有求取方法均较其必要复杂度更为繁琐。在假设色散矩阵正定(Positive Definite)且样本量n大于空间维数k的条件下,研究人员给出一种完全不使用自然对数函数(Logarithm)与任何形式的微分(Differentiation)即可获得唯一极大似然估计(Maximum Likelihood Estimate, MLE):样本均值向量x?= (1/n)Σi=1nxi及样本色散矩阵S = (1/n)Σi=1n(xi? x?)(xi? x?)T分别为μ与M的唯一极大化元,即L(μ, M|x1,…,xn) ≤ L(x?, S|x1,…,xn),等号成立当且仅当μ = x?且M = S。该方法仅需依赖指数函数(Exponential Function)的幂级数定义及其基本代数性质(严格单调递增、指数加法定理、值域为(0,+∞)、倒数关系及不等式exp(v) > v·exp(1)当v≠1)、正定矩阵的性质(特征值分解、平方根存在性、行列式(Determinant, det)与迹(Trace, tr)的性质)以及欧氏空间的勾股恒等式(Pythagorean Identity),从而比传统取对数后求偏导的方法更为初等基本且易于接受。
本文解读对象为Suman Majumdar发表于《Research in Statistics》的论文"Maximization of the two-parameter multivariate normal likelihood avoiding logarithm and differentiation",该研究针对多元正态分布(Multivariate Normal Distribution, MVN(μ, M),μ∈Rk为均值向量,M∈S++k为正定色散矩阵/协方差矩阵)基于i.i.d.样本X1,…,Xn(n > k)的极大似然估计(Maximum Likelihood Estimate, MLE)问题展开。经典统计教材均通过对似然函数取自然对数得到对数似然函数(Log-likelihood Function),再借矩阵微分或标量偏导求解??/?μ=0与??/?M?1=0,最终得到MLE为样本均值向量x?=(1/n)Σi=1nxi与样本协方差矩阵S=(1/n)Σi=1n(xi?x?)(xi?x?)T。然而取对数依赖于指数与自然对数为互逆函数的非平凡数学事实,而矩阵微分亦需较高前置知识门槛。研究人员指出,在该特定问题中直接对原始似然函数进行代数放缩即可完成最大化证明,无需引入对数变换与微积分工具,从而使推导更初等、更易被广泛受众理解。
关键技术方法概述:研究人员基于指数函数exp(v)=Σi=0vi/i!(幂级数定义)导出的五条基本性质——严格递增于R、exp(u+v)=exp(u)exp(v)、值域(0,+∞)、exp(?x)=1/exp(x)、exp(v)>v·exp(1)(v≠1);利用正定矩阵A∈S++k的特征值全正、可逆、有对称平方根A1/2∈S++k、det(A)=Πi=1kdi、tr(A)=Σi=1kdi及tr(AB)=tr(BA);并通过将二次型转化为经M?1/2变换后的欧氏范数平方和,结合样本离差向量Σi=1nM?1/2(xi?x?)=0导出勾股分解,分步证明均值固定时μ=x?使指数项最大,再固定μ=x?后通过特征值代换与exp(v)≥v·exp(1)(等号仅v=1)证明M=S使带行列式的整体似然最大,从而得到全局唯一极大值。
研究结果如下:
2.1. Exponential Function Properties(指数函数性质)
研究人员罗列并确认可由exp(v)幂级数定义直接推出的五条基本性质,特别给出不等式exp(v) > v·exp(1)(v≠1,v∈R)之证明思路:v≤0时由值域显然成立;v>0时构造函数g(v)=exp(v)?v·exp(1),通过幂级数逐项差商不等式证得g(v)在(0,1)严格减、(1,∞)严格增且g(1)=0,从而不等式成立且等号唯一。这些性质是后续避免对数与微分的全部分析基础。
2.2. Positive Definite Matrices(正定矩阵)
研究人员回顾正定矩阵A∈S++k具k个正特征值d1,…,dk,有逆A?1∈S++k及平方根A1/2∈S++k,det(A)=Πdi,tr(A)=Σdi,且tr(AB)=tr(BA)。进一步,对于样本中心化离差矩阵B=(1/n)Σ(xi?y0)(xi?y0)T∈S++k,研究人员证明对任意A∈S++k有Σi=1n(xi?y0)TA?1(xi?y0) = n·tr(A?1/2B A?1/2) = n·Σi=1kγi,其中γ1,…,γk为A?1/2B A?1/2之特征值;同时det(A?1)=det(A?1/2B A?1/2)/det(B)。此两等式将二次型和与特征值求和、行列式比关联,是后续将似然中指数项与分母det(M)n/2统合为关于特征值αi之单变量函数的基础。
2.3. Likelihood Maximization(似然函数最大化)
研究人员写出k维MVN(μ,M)之联合似然L(μ,M|x1,…,xn) = c·exp{?(1/2)Σi=1n(xi?μ)TM?1(xi?μ)} / [det(M)]n/2,其中c=(2π)?nk/2。第一步(固定M,优化μ):令zi=M?1/2(xi?μ),利用‖zi2展开并代入ΣM?1/2(xi?x?)=0得Σ‖M?1/2(xi?μ)‖2= Σ‖M?1/2(xi?x?)‖2+ n‖M?1/2(x??μ)‖2≥ Σ‖M?1/2(xi?x?)‖2,等号当且仅当μ=x?。因exp严格递减于负自变量,故对任意M固定有L(μ,M) ≤ L(x?,M),等号仅μ=x?。第二步(固定μ=x?,优化M):将Σ(xi?x?)TM?1(xi?x?)=n·Σαi(αi为M?1/2SM?1/2之特征值),且1/det(M)=Παi/det(S),代入似然得L(x?,M)=c·[Πi=1kexp(αi)/αi]?n/2·[det(S)]n/2。由不等式exp(α) > α·exp(1)(α≠1)得exp(αi)/αi≥ exp(1),等号仅αi=1,故Π exp(αi)/αi≥ exp(k),等号仅α1=…=αk=1 ? M?1/2SM?1/2=Ik? M=S。因此L(x?,M) ≤ c·exp(?kn/2)/[det(S)]n/2= L(x?,S),等号仅M=S。综合两步得L(μ,M) ≤ L(x?,S) ?(μ,M)∈Rk×S++k,等号成立当且仅当μ=x?且M=S,即样本均值向量与样本协方差矩阵为多元正态似然函数的唯一极大化元。
讨论与结论:研究人员通过纯代数—分析途径(指数函数幂级数基本性质、正定矩阵谱分解与迹/行列式关系、欧氏空间勾股分解)完整证明了多元正态模型MLE的经典结论,全程未借助对数变换与任何微分运算。此方法虽不改变最终估计量形式,但揭示经典MLE推导可脱离微积分框架,降低了对学习者的数学预备要求,具有教学价值;同时强调exp与ln互逆性的非平凡性,倡导在适宜场合回归更基本的数学工具。论文结论为:在n>k且M正定条件下,(μ?MLE, M?MLE) = (x?, S) 是似然函数L(μ,M|x1,…,xn)在Rk×S++k上的唯一最大值点。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号