编辑推荐:
本章对Agentic AI(人工智能体)在道德与法律决策中的设计、开发和使用所涉及的本体论(ontological)、认识论(epistemological)和伦理(ethical)问题进行了概念性与哲学性分析。其目标在于梳理、分类并聚焦人工代理(artifi
本章对Agentic AI(人工智能体)在道德与法律决策中的设计、开发和使用所涉及的本体论(ontological)、认识论(epistemological)和伦理(ethical)问题进行了概念性与哲学性分析。其目标在于梳理、分类并聚焦人工代理(artificial agents)在道德与法律判断情境中自主运作所引发的主要哲学问题。本章通过区分AI自主性的两个层次,为现有文献作出贡献:咨询型系统(advisory systems)具备有限的自主性,其提供的建议仍须经人类评估;而监管型系统(regulatory systems)则行使更大程度的自主性,并被赋予最终决策权。研究采用怀疑主义视角,考察了在重要领域部署Agentic AI之提案所面临的概念脆弱性与认识论困难。研究特别关注表面上属于咨询型的系统在实践中可能悄然转变为监管型系统的风险,尤其是在关于AI的客观性、准确性与有效性的普遍假设影响之下。该研究通过逐步分叉的结构展开,围绕三个核心问题进行:此类系统应基于何种道德价值加以设计与开发、其在何种程度上能够理解伦理与正义的概念,以及其决策与输出的责任应如何归属。每个问题均引出多条替代性分析路径,从而系统性地勾勒出所涉及的主要哲学挑战。本章旨在提供相关哲学问题的综合性概览,同时凸显其广度与多元性。为系统组织这些问题,本章采用算法的图式,清晰有序地呈现所考察问题之间的可能关联,以及替代性答案如何生成既相互区别又彼此交织的哲学探究路径。
《Agentic AI与善的算法》:关于自主人工智能系统用于道德与法律决策的哲学审视
一、研究背景与问题意识
人工智能(AI)作为一项技术科学事业,其正式起点通常追溯至20世纪50年代,尽管其理论与技术渊源可追溯至更早时期。近年来,随着AI研究取得显著进展及其应用领域急剧扩展,关于AI风险与收益的讨论显著升温。这一重新聚焦在很大程度上涉及为AI监管建立清晰且普遍可接受的伦理与法律框架的提案,可称之为AI伦理的制度化努力,其最终目标不仅是保护人类福祉免受AI威胁,更在于通过AI促进人类繁荣。在这一进路中,AI不被视为来自外部强加于人类的威胁,而被理解为人类繁荣的组成部分。
在此背景下,学界提出了多种监管框架,包括阿西洛马AI原则(2017)、IEEE的伦理对齐设计(2017)、蒙特利尔负责任AI宣言(2017)、英国上议院AI准则五项总原则(2018)、AI伙伴关系信条(2018)以及欧洲委员会伦理小组关于AI、机器人与"自主"系统的声明(2018)等,这些框架为近期通过的欧盟《人工智能法案》(AI Act)奠定了基础。然而,当前关于"AI向善"的学术文献仅占整体AI研究文献的较小比例,且AI伦理原则的理论阐述与其实际实施之间存在显著差距。
本文所探讨的核心问题在于自主AI系统在道德与法律决策中的设计、开发与使用。研究区分了两种层次的AI自主性:咨询型系统(advisory systems)具有有限自主性,其建议仍须经人类评估;监管型系统(regulatory systems)则行使更大程度的自主性,被赋予最终决策权。研究特别关注一个关键风险:表面上属于咨询型的系统在实践中可能悄然转变为监管型系统,尤其是在关于AI客观性、准确性和有效性的普遍假设影响之下。这种转变的可能性构成了本文分析的核心关切之一。
二、研究内容与主要结论
本文以"善的算法"(Algorithm of Good)为隐喻性标题,构建了一个哲学与概念分析的图式,系统梳理了监管型AI系统设计、开发与使用所涉及的本体论、认识论与伦理维度。研究围绕三个核心问题展开:如何构建此类监管系统?这些系统能否理解道德与正义的概念?谁将为其行为与决策承担责任?每个问题均引出多条替代性分析路径,从而形成系统性的哲学挑战图谱。
在"如何构建"的问题上,研究区分了两种主要进路:监督学习(supervised learning)与减少监督的机器学习(reduced supervision machine learning)。前者涉及明确规则编程或基于标注示例的学习,后者则包括无监督学习、强化学习、从人类反馈中学习、模仿学习与元学习等范式。研究指出,即便看似自主的学习也极少脱离人类规范,例如AlphaGo Zero虽未使用人类专家棋局数据训练,但其游戏规则、获胜条件、架构、学习程序与评估信号均由人类预先设定。研究还探讨了算法偏见(algorithmic bias)、控制问题(control problem)与黑箱问题(black box problem)等核心挑战。
在"能否理解"的问题上,研究从本体论角度考察了AI系统理解伦理与正义概念的可能性。肯定立场认为AI可被视为认知实体(cognitive entities),但这也带来情感不稳定、自利与偏见的风险;否定立场则援引超级智能(superintelligence)、中文房间论证(Chinese Room argument)、框架问题(Frame Problem)以及具身认知理论(Embodied Cognition)等观点,质疑AI系统能否真正理解道德与正义概念。研究还探讨了伦理与正义能否完全以计算术语呈现这一本体论问题,涉及理性主义、功利主义、直觉主义等不同立场。
在"责任归属"的问题上,研究强调Agentic AI的出现对现有监管框架构成重大挑战。Agentic AI与传统AI存在根本差异,甚至可被视为范式转变,其特征包括增强的自主性、目标导向性、学习能力、适应性、新涌现行为以及多代理协作能力。这些特征可能对人类自主性产生更大影响,并促成人类与AI之间更深的纠缠关系。研究指出,当AI系统实施有害行为时,责任归属变得日益模糊:是归咎于设计、部署它们的人类,还是归咎于系统本身(若将其视为智能实体)?这一问题在监管型AI系统中尤为紧迫,因为其决策直接关涉人类行为的规范。
三、关键技术与方法
本文主要采用以下关键方法:其一,概念分析与哲学论证方法,系统梳理AI自主性的不同层次(人在环内、人在环上、人在环外)及技术自主性与决策自主性的区分;其二,文献综述与框架比较方法,考察六大影响力较大的AI监管框架并提炼其核心原则;其三,算法图式方法,以"善的算法"为隐喻性框架,以分叉结构系统呈现三个核心问题及其替代性答案的哲学关联;其四,经验证据考察方法,援引自动化偏见(automation bias, AB)的实证研究证据,涵盖医疗保健、国家安全、军事、人事选拔、就业决策、警务等领域,以支持咨询型系统可能悄然转变为监管型系统的论断。
四、研究结果
关于咨询型与监管型系统的区分:研究通过区分技术自主性与决策自主性,阐明AI系统的自主程度不仅取决于技术架构,更取决于制度安排所决定的人类控制程度。咨询型系统的输出仅为建议,须经人类最终评估;监管型系统的输出则为具有约束力的决策。然而,由于人类对AI的积极偏见(positivity bias),咨询型系统在实践中可能被默认为监管型系统,导致人类决策者事实上退出决策环路。
关于伦理模型的寻求:研究考察了功利主义(utilitarianism)、道义论(deontology)、初始义务(prima facie duties)与德性伦理(virtue ethics)等伦理模型在AI系统训练中的适用性。功利主义的"幸福计算"看似契合AI的计算特性,但未来后果的不可预测性制约了其客观性与精确性;康德式道义论强调自由意志与自律,难以转化为依赖外部规范目标的计算系统;罗斯的初始义务模型提供结构化道德指导,但无法消除道德困境;亚里士多德式德性进路将系统置于社会结构中,以公众认可作为其道德性的最终判准。
关于社会接受度:研究通过"道德机器"(Moral Machine)实验揭示跨文化道德多样性,表明任何单一道德决策模型均不可能获得普遍接受。研究还探讨了"节奏问题"(pacing problem)——技术发展速度与制度响应速度之间的时间差,以及AI民主化问题——广泛使用是否构成知情同意,还是需要将民主价值嵌入AI系统的设计层面。
关于减少监督学习:研究指出,尽管无监督学习、元学习等范式可减少人类对学习内容的直接监督,但任务、特征、目标与约束仍由人类设定。统计一致性无法确立规范性有效性,系统可能准确且一致地泛化反映历史偏见或不公正制度实践的模式。
关于算法偏见:2016年一项针对法律决策中AI工具的评估研究揭示了基于种族、国籍与肤色标准的算法偏见,在累犯风险评估中对黑人被告产生更严苛的评估结果。缓解措施包括移除或重新加权有偏数据以及反事实公平(counterfactual fairness)等方法,但在无监督学习与有限人类干预条件下,偏见重现的可能性依然存在。
关于控制问题与黑箱问题:控制问题不仅涉及AI的信息处理方式,还涉及其广泛部署导致的实际不可治理性。超级智能概念与"奇点"(singularity)相关,其行为本质上不可预测。黑箱问题指深度学习系统在数据分析和输出生成过程中的不透明性,欧盟已将这一问题作为安全可信AI的优先监管事项。然而,安德森夫妇主张以"伦理图灵测试"(Ethical Turing Test)评估系统决策是否合乎人类原则,而非要求过程透明。
关于AI理解伦理与正义的可能性:若监管型AI系统具备认知能力,则可能具备自利倾向,从而危及开发此类系统的初衷——公正性。研究由此提出设计困境:以认知类似性质获得衡平性(equity),还是以纯机械性质获得公正性(impartiality)。若AI系统为无心灵的符号操作者,则其能力局限于无意义的句法操作,无法把握法律精神,可能以危险的方式僵化行事,缺乏衡平与灵活性。研究还考察了伦理与正义能否完全计算化的问题,涉及理性主义、功利主义、具身认知理论与直觉主义等不同本体论立场,并援引停机问题(Halting Problem)的类比,说明某些计算本质上无法终止,可能导致"人工法官"陷入无限计算而无法作出最终裁决。
关于责任归属:Agentic AI的特征——增强自主性、目标导向性、学习能力、适应性、新涌现行为与多代理协作——对现有监管框架构成重大挑战。研究强调需要清晰的监管框架来规定责任归属原则,澄清这些系统的道德与法律地位,并处理其部署必然引发的认识论与本体论问题。
五、讨论与结论
研究的讨论部分强调,关于认知、知识、道德与正义本体论的更广泛讨论仍不完整,各种理论立场——无论理性主义、功利主义、具身认知还是直觉主义——目前仍属形而上学层面,尚无一种立场具有足够坚实的科学基础可被提升为凌驾于其他立场之上的唯一权威。然而,人类似乎正在接近监管型AI系统的开发与部署,实践并不等待理论"自我修复"。这种技术科学实践与可能指导它的理论之间的分歧引发了深切的关切。
研究结论的核心在于:决定开发此类监管系统预设了对一系列本体论、认识论与伦理哲学问题的参与。若不解决这些问题,此类系统可能被赋予与人类优先事项不一致的目标,或无法得到充分控制。研究以怀疑主义视角指出,在重要领域部署Agentic AI的提案面临概念脆弱性与认识论困难,尤其是咨询型系统在实践中悄然转变为监管型系统的风险,这一风险在关于AI客观性、准确性与有效性的普遍假设影响下尤为突出。研究最终以"善的算法"这一概念图式,系统呈现了这些哲学挑战的广度与多元性,以及替代性答案如何生成既相互区别又彼此交织的哲学探究路径。