《Journal of Environmental Management》:Automating SWMM-based stormwater modelling and analysis through a tool-augmented single-agent system
编辑推荐:
城市暴雨雨水建模在评估洪涝风险与水质量管理干预措施以应对基础设施老化与未来不确定性方面发挥着关键作用。然而,实际建模工作流仍高度依赖人工,模型配置、执行与解释等关键步骤常需专业知识,导致效率低下。为此,研究人员提出SWMM-Agentic,一种基于大语言模型(
城市暴雨雨水建模在评估洪涝风险与水质量管理干预措施以应对基础设施老化与未来不确定性方面发挥着关键作用。然而,实际建模工作流仍高度依赖人工,模型配置、执行与解释等关键步骤常需专业知识,导致效率低下。为此,研究人员提出SWMM-Agentic,一种基于大语言模型(LLM)的工具增强型单智能体系统,用于城市暴雨雨水建模、模拟与情景分析。该系统构建于暴雨雨水管理模型(Storm Water Management Model,SWMM)之上,利用单一编排模型解释自然语言指令,并依次调用带文档记录的函数,实现可追溯的模型配置后工作流。在Astlingen基准模型上的评估包含能力演示与由20项静态、20项动态、20项情景任务构成的60任务套件,使用三种LLM各执行一次,共产生180次模型-任务运行。DeepSeek-V3.2-Exp成功完成59/60项任务(98.3%),Qwen3-236B完成58/60项(96.7%),Qwen3-14B完成45/60项(75.0%)。在180次运行中,100次失败工具调用中的89次在三次尝试内出现成功纠正调用。SWMM-Agentic还复现了管网特征、比较了替代控制策略,并开展了一项人为框架的雨水花园实验,显示合流制溢流(combined sewer overflow,CSO)排放量随覆盖率提高而下降,但边际效益递减。结果表明,在所评估基准与工具范围内,SWMM-Agentic可通过自然语言可靠操作现有SWMM模型,支持准确且可复现的暴雨雨水模拟与分析,为集成规划与假设驱动研究的自然语言驱动平台奠定基础。
研究背景方面,城市排水建模支撑洪涝风险、合流制溢流削减及暴雨干预措施评估等环境管理决策,但SWMM、MIKE Urban、InfoWorks等平台的实际工作流仍高度手动,模型建立、模拟执行与结果解释依赖领域专家知识与定制脚本,导致劳动密集、周期长且质量波动。大语言模型(LLM)虽在水工程决策辅助中展现潜力,但既有研究多聚焦离线模块化任务,未在执行期直接与SWMM等过程型水动力引擎耦合,无法支持推理—模拟—解释紧耦合的交互迭代。研究人员据此开展本研究,核心是验证单一工具增强型LLM智能体在受控函数空间内能否可靠编排SWMM配置后工作流。论文发表于《Journal of Environmental Management》。
关键技术方法上,研究人员采用Astlingen基准网络(含23节点、6调蓄单元、23管段、10子汇水区、4雨量计,由Sun等2020年提供已校准可运行SWMM输入文件)作为案例;构建由13个无状态Python工具组成的任务导向工具库(覆盖断面检视、参数编辑、LID控制、模拟执行、结果提取与绘图),所有编辑经save_as生成新版本输入文件而不覆盖原文件;以ReAct风格提示词将自然语言映射至工具调用签名,由单一编排LLM(DeepSeek-V3.2-Exp为主,交叉测试Qwen3-236B与Qwen3-14B,温度设0)在AutoGen框架下执行多轮推理—动作—观测循环,每轮至多调用一个工具,会话设最大轮次预算,人在回路可在轮次终止后介入;图像解读子模块tool_dataAnalyser内嵌Qwen3-Max提供多模态能力,与编排模型角色不重叠。
研究结果部分,4.1节通过网络结构理解任务表明,智能体可顺序调用tool_list_sections、tool_get_section_table、tool_run_simulation等工具,自动生成含组件统计、CSO标识说明(CSO7~CSO10显式标注,CSO1~CSO6以调蓄单元T1~T6编码)、径流事件与峰值流量解读的分析报告,数值与手工SWMM模拟一致。4.2节多模态控制情景对比中,智能体对基准规则控制(BC)与事件驱动等充水度(EFD)策略分别改控、模拟、提取存储单元T1体积过程线与系统排放总量,得出EFD提升T1主动利用率、延长T1排放历时并增加其排放量,同时降低全系统排放总量,结论与Sun等2020及RPT提取表一致。4.3节人为框架—智能体执行实验中,针对子汇水区SC08设定雨水花园(rain garden,RG)覆盖率0%、5%、10%、15%、20%情景,智能体自主设计梯度、改LID_USAGE、模拟并绘图,结果显示CSO8总排放量、峰值排放率与排放时长随覆盖率增加单调下降,边际效益递减,SWMM连续误差绝对值低于0.5%。4.4节跨模型60任务评估(静态20/动态20/情景20,三模型各跑一遍共180运行)显示DeepSeek-V3.2-Exp 59/60、Qwen3-236B 58/60、Qwen3-14B 45/60成功;180运行中1576次工具调用失败100次,其中89次在后续三次内自纠正(DeepSeek 45/52、Qwen3-236B 24/26、Qwen3-14B 20/22),说明编排模型能力而非工具层是瓶颈,且上下文自纠可行。
讨论部分,5.1节以图9两类实例(RPT表名不匹配、LID类型与属性名误用)说明工具返回结构化错误可触发上下文内纠正,但随工具数与任务复杂度上升,提示词变长变脆、上下文丢失风险增加。5.2节指出单智能体集中推理降低通信开销且日志统一可追溯,但牺牲并行性,顺序模拟限制多情景筛查,长会话受上下文窗口与token成本制约,固定工作流下传统PySWMM脚本仍更优,多智能体与否属经验设计问题。5.3节强调专家知识不可替代:假设界定、参数区间、绩效指标与结果解释仍需领域专家,智能体仅在执行层组合既有SWMM操作。5.4节列明局限:依赖预校准INP、不建模型不校准、继承SWMM一维管网不模拟二维地表漫流、证据限于单中网单跑温度0、未测大模型迁移与畸形请求拒绝行为。
结论部分翻译如下:本研究提出SWMM-Agentic,一种工具增强型基于LLM的单智能体系统,通过自然语言指令操作现有SWMM模型。系统结合单一编排模型与结构化工具库,支持从模型检视、编辑到模拟、输出分析与情景评估的可追溯工作流。主要贡献为:其一,SWMM-Agentic解释开放式查询并选择、排序、执行带文档的工具有序序列,同时保留观测值与模型产物供工作流核验;其二,在人为框架内生成并模拟雨水花园覆盖率情景,显示合流制溢流总排放量、峰值与历时下降且高覆盖下边际效益递减;其三,跨模型评估中DeepSeek-V3.2-Exp、Qwen3-236B、Qwen3-14B分别完成59/60、58/60、45/60任务,180次运行中100次失败调用里的89次在三次尝试内成功纠正,体现上下文内错误恢复。总体而言,SWMM-Agentic凸显了LLM智能体系统在降低暴雨雨水模型操作交互与脚本负担的同时保留SWMM水动力计算的优势;产物级验证仍必要,当前证据限于单一中网、每模型任务对单次运行、固定分析器及可执行范围内查询,迁移性、鲁棒性、畸形请求与计算成本需进一步评估,实时控制与耦合二维模拟为未来方向,本框架提供可复现起点。