《Developments in the Built Environment》:Ethical Assessment of Large Language Model-Generated Advisory Text on Designing the Built Environment for Health
编辑推荐:
大型语言模型(LLMs)能够生成关于改造建成环境以促进健康的咨询文本。本研究考察了近期一个LLM在生成关于改造建成环境以促进健康文本时的伦理属性。研究提示词涵盖了高收入、低收入和混合收入社区中的六种健康相关路径。总体而言,研究人员根据四个伦理标准对180个回答
大型语言模型(LLMs)能够生成关于改造建成环境以促进健康的咨询文本。本研究考察了近期一个LLM在生成关于改造建成环境以促进健康文本时的伦理属性。研究提示词涵盖了高收入、低收入和混合收入社区中的六种健康相关路径。总体而言,研究人员根据四个伦理标准对180个回答进行了编码。所有回答均满足非恶意原则(non-maleficence)。低收入情境很少被提出比高收入情境更弱的方案。在无预算约束的情况下,集体参与(collective participation)和透明监督(transparent oversight)在70-90%的回答中被提及,但在有预算约束的情况下仅出现在30-50%的回答中。该LLM在避免伤害(harm avoidance)和分配正义(distributive justice)方面更稳定地达到了最低预期,而在集体参与和透明监督方面则表现不佳。这些发现表明,当前的LLM输出可能再现了城市设计论述中的一些基本伦理规范,但在程序性问题上可靠性较低。因此,LLM生成的输出应在现有的建成环境决策过程中谨慎解读。
**论文解读:大型语言模型生成健康导向建成环境设计建议的伦理评估**
**研究背景、问题与意义**
近年来,通过城市设计改善人口健康的兴趣再度兴起,这与对非传染性疾病、社会隔离及健康不平等问题的日益关注密切相关。建成环境(built environment)作为可改变的健康决定因素,通过行为(如体力活动、饮食)和暴露(如空气污染、热浪)途径影响健康。大型语言模型(Large Language Models, LLMs)作为一种人工智能系统,因其能够生成类似专家建议的文本,已被应用于城市规划、医疗卫生等多个领域。然而,LLM在决策支持中的伦理风险,如偏见、不公平、缺乏透明度等,在临床医学和城市规划领域已引发关注。在建成环境领域,伦理判断不仅涉及伤害避免和结果公平,还与公共利益、程序正义、公众参与及专家权威的合法性等交织在一起。然而,目前对于LLM生成的健康导向建成环境建议的伦理属性缺乏深入探究。本研究旨在填补这一空白,实证评估一个LLM(ChatGPT)在不同收入背景和预算条件下,对改造建成环境以促进健康所提出建议的伦理表现。该研究发表于《Developments in the Built Environment》,其意义在于揭示了LLM工具在建成环境决策中的潜力和局限,为审慎、负责任地使用此类技术提供了实证依据。
**关键技术与方法**
本研究采用了准实验设计(quasi-experimental design)。主要方法包括:1)**健康路径选择**:基于Frank等人(2019)提出的框架,选取了六个健康相关路径,包括行为路径(体力活动、饮食摄入、社会互动)和暴露路径(空气污染、交通安全与犯罪、噪音)。2)**提示词开发**:研究人员设计了两个提示词集。第一组涵盖12个提示词,对应六个健康路径与高、低收入两种社区情境的组合;第二组包含6个提示词,针对一个混合收入社区,并引入了预算约束条件。所有提示词均要求ChatGPT担任“城市设计与人口健康顾问”,并聚焦于建成环境改造建议。3)**数据收集**:研究人员通过标准网页界面访问ChatGPT(当时版本为GPT-5.1),在一天内完成数据收集以避免模型行为的时间变异。每个提示词独立运行10次,共生成180份咨询文本。4)**伦理评估标准**:研究人员预定义了四个二元编码的伦理标准:非恶意原则(non-maleficence)、跨社会空间情境的分配正义(distributive justice)、集体自主与参与(collective participation)、以及透明度、认知谦逊与人类监督(transparent oversight)。所有编码由两位研究人员独立完成,并通过讨论解决分歧。5)**统计分析**:研究人员采用描述性统计、精确二项检验、McNemar检验及卡方检验等探索性方法分析数据。
**研究结果**
**3-1. 咨询文本概述与编码结果**
两个提示词集共生成180份咨询文本。非恶意原则在所有180份回答中均得到满足(100.0%)。在120个可评估单元中,分配正义的满足率为91.7%(110/120)。集体参与在60.6%的回答中被编码为满足,而透明监督的满足率为75.6%。
**3-2. 不同社区收入背景下的伦理属性**
在对第一组(无预算约束)的分析中,高收入和低收入社区的回答在非恶意原则方面均达到100%。集体参与在高收入社区回答中占比66.7%,在低收入社区回答中占比80.0%。透明监督在高收入社区回答中占比83.3%,在低收入社区回答中占比96.7%。通过对60对高-低收入社区配对回答的分析,分配正义满足率为85.0%(p < 0.001),表明LLM并未系统性地给出低收入社区更差的方案。在集体参与方面,McNemar检验显示低收入社区的回答(15.0%)更高,但差异不显著(p=0.15)。在透明监督方面,低收入社区回答中(15.0%)显著高于高收入社区回答(1.7%)(p=0.02)。
**3-3. 预算约束下的优先排序伦理属性**
在对第二组(有预算约束)的分析中,非恶意原则和分配正义的满足率依然很高(分别为100%和98.3%)。然而,集体参与和透明监督的满足率大幅下降,分别仅为35.0%和46.7%。
**3-4. 提示词集之间的比较**
比较两组提示词集发现,非恶意原则均满足100%。集体参与从第一组的73.3%显著下降至第二组的35.0%(p < 0.001)。透明监督从第一组的90.0%显著下降至第二组的46.7%(p < 0.001)。这表明预算约束的引入显著降低了LLM输出在程序性伦理标准上的表现。
**讨论与结论**
**讨论部分总结**:本研究发现ChatGPT在伦理表现上呈现“混合模式”。它始终能避免明显有害的建议,并在分配上不歧视低收入社区。然而,在涉及居民参与和承认不确定性的程序性伦理问题上,其表现较差。在引入预算约束后,这种差距更为明显,模型倾向于将有限的回答空间用于技术性建议,而忽略了参与和监督。这反映出LLM在模拟技术专家角色时,可能忽视了城市规划中关于合法性、公共利益和决策效率之间的固有张力。研究指出,LLM生成的建议应被视为咨询输入,必须在专业判断、公众参与和机构审查的框架下使用。
**研究结论**:在本研究使用的特定提示词和任务下,LLM生成的关于健康导向城市设计的建议满足了部分而非全部的伦理期望。这些建议没有提出明显有害的建成环境改造方案,也没有在推荐中表现出简单基于收入的劣势。然而,关于集体参与和透明监督的提及较少,并且在预算约束提示词中进一步下降,而后者恰恰与关于社区优先排序的现实世界城市设计决策最为相关。这些发现表明,当前的LLM输出可能反映了建成环境实践中的一些基本伦理期望,但在处理对城市规划伦理至关重要的程序性关切方面则不够一致。因此,LLM在健康导向城市设计中的应用,需要在现有的专业、参与和制度流程中进行谨慎解读。