《Journal of Cereal Science》:Causal inference in conjoint analysis: Logit models vs. potential outcomes
编辑推荐:
在联合分析中,从Logit模型估计平均边际效应(Average Marginal Effects, AME)是评估属性重要性的常用方法,但其依赖于较强的参数化和行为假设。近期研究在Rubin的潜在结果框架内形式化了联合分析,并引入了平均边际成分效应(Avera
在联合分析中,从Logit模型估计平均边际效应(Average Marginal Effects, AME)是评估属性重要性的常用方法,但其依赖于较强的参数化和行为假设。近期研究在Rubin的潜在结果框架内形式化了联合分析,并引入了平均边际成分效应(Average Marginal Component Effect, AMCE)作为一个非参数因果估计量,但AMCE依赖于额外的识别假设。条件随机化检验(Conditional Randomization Test, CRT)不需要这些假设即可检验某个属性是否具有任何因果效应,并且也可用于诊断关键AMCE假设的违背情况。本研究首次使用四个在任务复杂性和属性数量上存在差异的公共数据集,对AME、AMCE和CRT进行了全面的实证比较,旨在为应用研究人员在不同复杂性的联合设计中提供实用指南。研究发现,具有多个属性和多个任务的设计更容易违背AMCE的假设,而更简单的设计往往更具鲁棒性,这使得AMCE在此类情境中成为优选的因果估计量。当AMCE假设不成立时,与CRT结果一致的AME估计值比AMCE为推断提供了更可信的基础。当AME在统计上不显著但CRT提示存在效应时,可以在Logit模型中探索交互项以捕捉偏好异质性并调和差异。因此,尽管基于Lasso的CRT实现在应用场景中偶尔会产生反直觉的结果,需要谨慎使用,但CRT可以为假设检验和参数设定提供信息。
一、 研究背景、问题与研究目的
联合分析(Conjoint Analysis) 是理解消费者对多属性产品和服务偏好的关键工具,其中选择型联合分析(Choice-Based Conjoint, CBC)应用尤为广泛。研究人员通过让受访者在具有系统变化属性的备选方案中进行选择,来推断决策中各属性的相对重要性。长期以来,多项Logit(Multinomial Logit, MNL)模型被广泛用于估计属性的平均边际效应(Average Marginal Effect, AME)。然而,模型化估计面临两大关键挑战:一是其依赖于未被观察到的潜在决策过程假设,不正确的行为假设可能导致模型误设和估计偏差;二是行为模型函数形式没有标准设定程序,这增加了模型选择和解释的复杂性。
为应对这些模型化方法的挑战,近期研究在Rubin的潜在结果框架下形式化了联合分析,并定义了平均边际成分效应(Average Marginal Component Effect, AMCE)作为感兴趣的因果估计量。与参数模型不同,该方法无需施加严格的函数形式和行为假设即可非参数地估计属性的相对重要性。然而,AMCE估计在实践中可能因关键实验假设难以满足而不可靠,这些假设包括跨任务偏好稳定、无先前选择情境对后续情境的遗留效应,以及无轮廓顺序(如左右位置)影响。
为应对AMCE的局限性,Ham等(2024)在CBC分析的潜在结果框架中引入了条件随机化检验(Conditional Randomization Test, CRT)。CRT是一种非参数检验程序,用于评估特定属性在控制其他属性不变的情况下是否对选择结果产生因果影响。尽管CRT无法量化属性重要性的大小,但能识别属性是否具有因果效应,并提供检验AMCE核心假设的系统方法。总之,参数化的AME与非参数的AMCE在量化属性重要性时面临不同挑战,可能产生分歧结果,而CRT可作为有价值的补充。
鉴于上述背景,Zheng Wu、Guocong Zhai和Prateek Bansal三位研究人员开展了这项研究。他们认识到,尽管AME和AMCE都旨在量化决策中属性的重要性,但各自面临独特挑战且结果可能相左,而CRT虽不能完全替代二者,却能通过因果效应识别和假设检验提供有价值的互补视角。此前,尚无研究对这三种方法进行系统的实证比较,对AMCE核心假设在实践中是否成立、其估计与AME的一致性如何、以及与CRT结果的比较也缺乏深入探讨。因此,本研究旨在首次系统地比较CBC分析中的三种互补方法:AME、AMCE和CRT。研究人员调查了这些方法在假设、解释和鲁棒性方面的差异,以及每种方法如何为更全面地理解选择行为做出贡献。通过使用四个关于比萨和度假套餐偏好的公开数据集,本研究旨在为不同情境下最适用哪种方法提供实用指南。该研究发表在《Journal of Cereal Science》上。
二、 主要研究方法
研究人员运用了实证比较与定量分析的方法。首先,他们选取了来自Louviere等(2008)的四个选择型联合分析公共数据集,涵盖比萨服务和度假套餐两个产品类别。每个类别包含A、B两个版本,在属性和选择任务数量上存在系统差异(例如B版本拥有两倍于A版本的属性数和任务数),这为检验方法在不同设计复杂度下的表现提供了基础。其次,研究核心采用了三种方法学框架:基于多项Logit模型估计平均边际效应(AME)、在Rubin潜在结果框架下非参数估计平均边际成分效应(AMCE),以及进行条件随机化检验(CRT)。其中,CRT的实施参考了Ham等(2024)的方案,使用200次重采样迭代,Lasso回归的收敛容差设定为1×10-4。最后,研究人员通过系统比较在不同数据集上应用这三种方法所得的估计结果、统计显著性及假设检验情况,评估了各种方法的性能、假设稳健性及其互补性,从而得出实践建议。
三、 研究结果
数据准备:本研究使用了四个CBC数据集,它们系统地改变了属性数量(8 vs. 16)和选择任务数量(16 vs. 32),以及受访者样本量,这有助于分析设计复杂度对方法估计的影响。
联合分析的潜在结果框架:该部分形式化了CBC分析的因果推断基础。AMCE被定义为感兴趣的因果估计量,其非参数估计无需严格的模型假设。然而,AMCE的可靠性依赖于一系列实验假设,如跨任务偏好稳定、无遗留效应等。CRT被引入作为一种非参数检验,用于评估特定属性的因果效应,并可以诊断AMCE关键假设的违背情况。
结果与讨论:研究计算了测试统计量,并设置了敏感性分析以检查参数(如收敛容差在1×10-2、1×10-3和1×10-4之间变化)对结果的稳健性。核心发现如下:1. 设计复杂性与假设稳健性:具有更多属性和更多任务的设计更容易违背AMCE的假设,而更简单的设计往往更加稳健。因此,在简单设计中,AMCE是优选的因果估计量。2. 方法间比较与互补性:当AMCE的假设成立时,其与AME的估计值可能接近,但并非总是如此。当AMCE假设不成立时,如果AME的估计结果与CRT的检验结果一致,那么基于AME的推断比基于AMCE的推断更为可信。3. CRT的作用与局限:当AME在统计上不显著但CRT提示存在因果效应时,研究人员可以在Logit模型中引入交互项来捕捉偏好异质性,从而调和差异。因此,CRT既能用于检验AMCE的假设,也能为参数模型(Logit)的设定提供信息。但需要注意的是,基于Lasso的CRT实现在某些应用场景中可能偶尔产生反直觉的结果,需谨慎使用。
结论:本研究首次对联合分析中估计属性效应的三种关键方法——来自Logit模型的平均边际效应(AME)、平均边际成分效应(AMCE)和条件随机化检验(CRT)——进行了全面的实证比较。虽然AME在应用环境中仍被广泛使用,但其对强参数化和行为假设的依赖引发了人们对模型误设的担忧。AMCE提供了一种非参数的替代方案,但其有效性依赖于实践中难以评估的严格实验假设。CRT则提供了一种与模型无关的检验,用于评估属性的因果效应,并能诊断AMCE的关键假设。实证结果表明,在具有许多属性和任务的设计中,AMCE的假设更容易被违背,使得AME(当与CRT结果一致时)成为更可靠的替代方案。此外,当AME不显著而CRT显示存在效应时,在Logit模型中纳入交互项可以调和差异。因此,研究人员建议采用一种综合方法:首先使用CRT评估AMCE假设并检验因果效应;在简单、稳健的设计中优先使用AMCE;在复杂设计或AMCE假设被违背时,将AME与CRT结果结合使用以获得更可靠的推断。未来的工作应探索在更广泛的模型类别中整合CRT,并开发能够量化异质性处理效应大小的非参数估计量。