《Nutrire》:Accuracy of free-tier and subscription chatgpt versions for carbohydrate counting in frequently consumed Brazilian foods: a factorial validation study
编辑推荐:
摘要专业翻译
目的:评估ChatGPT对巴西常见食物碳水化合物估算的准确性(以标准化成分为基准),并比较免费版与订阅版以及简化提示与详细提示之间的差异。
方法:采用2×2析因设计,覆盖巴西家庭预算调查(POF 2017–2018)中最常获取的20种食物。每种食
摘要专业翻译
目的:评估ChatGPT对巴西常见食物碳水化合物估算的准确性(以标准化成分为基准),并比较免费版与订阅版以及简化提示与详细提示之间的差异。
方法:采用2×2析因设计,覆盖巴西家庭预算调查(POF 2017–2018)中最常获取的20种食物。每种食物在四种条件下各查询一次:模型层级(GPT-5.1 Instant,免费版;GPT-5.1 Thinking,订阅版)×提示复杂度(普通用户;专家)。遵循ISO 15197架构,当估算值与巴西糖尿病学会(SBD)参考值的偏差在每100 g 1.0 g以内或15%以内(取较宽松者)时,视为临床准确。分析考虑了每种食物内四个观测值的聚类结构(针对聚类数据的Bland–Altman分析、食物内配对检验、含食物随机截距的线性混合模型)。
结果:ChatGPT对全部80次查询均返回了可用估算值;总体临床准确率为85.0%(68/80;95% CI 75.3–92.0)。在模型层级或提示策略之间未观察到差异证据(四种条件下均为85.0%;精确McNemar检验,p = 1.000)。平均绝对误差范围为每100 g 1.14至1.43 g。一致性分析显示存在轻微、无统计学意义的低估趋势(?0.37 g/100 g;95%一致性界限?4.42至+3.69;p = 0.389)。
结论:在受控条件下,85.0%的估算值落在该准确性界限内,且未发现模型层级或提示复杂度影响估算误差的证据。这些发现并不确立临床安全性、有效性、层级间等效性,或适用于无监督的患者使用。
论文解读
一、研究背景与问题
糖尿病是一组以慢性高血糖为特征的代谢性疾病,2024年全球20–79岁成人糖尿病患者估计达5.89亿,占该年龄组的11.1%,预计到2050年将增至8.53亿。在1型糖尿病(T1D)中,患者依赖外源性胰岛素维持血糖控制,而碳水化合物计数是计算餐时胰岛素剂量的核心技能。然而,成人在T1D中对餐食总碳水化合物的估计误差约为20%,平均误差达15.4 ± 7.8 g,且约63%的餐食存在低估。这一误差是血糖控制不佳和血糖变异增加的重要诱因。在资源有限的环境中,专业糖尿病教育和营养师支持的可及性受限,亟需低成本、易获取的决策支持工具。
大型语言模型(LLM)如ChatGPT已被应用于多种医疗任务,包括鉴别诊断、临床决策支持和营养指导。ChatGPT提供免费版(优化快速响应)和订阅版(增强推理能力,月费约20美元)。尽管已有研究评估AI工具在营养指导中的潜力,但尚无研究系统比较免费版与订阅版ChatGPT在标准化营养成分食物碳水化合物计数中的准确性。此外,现有验证工作主要依赖美国农业部(USDA)或欧洲机构食物成分数据库,对巴西等饮食配方和营养成分存在显著差异的人群推广性有限。同时,简单自然语言查询与包含临床背景和结构化响应要求的专家提示之间是否存在性能差异,也尚不明确。
二、研究设计与主要结论
研究人员开展了一项2×2析因实验设计研究,纳入巴西家庭预算调查(POF 2017–2018)中最常获取的20种食物,每种食物在四种条件下各查询一次:模型层级(GPT-5.1 Instant免费版 vs. GPT-5.1 Thinking订阅版)×提示复杂度(简化版面向普通用户 vs. 详细版面向专家),共产生80个观测值。以巴西糖尿病学会(SBD)“Contagem de Carboidratos”移动应用(版本4.0.0)作为碳水化合物含量的参考标准。准确性判定遵循ISO 15197:2013架构:参考值低于6.7 g/100 g时,绝对偏差≤1.0 g/100 g视为准确;参考值≥6.7 g/100 g时,相对偏差≤15%视为准确。
研究得出以下主要结论:ChatGPT对全部80次查询均返回可用数值估算,总体临床准确率为85.0%(68/80;95% CI 75.3–92.0)。四种条件下准确率完全相同(均为85.0%),模型层级和提示复杂度对准确性均无显著影响(精确McNemar检验,p = 1.000)。平均绝对误差(MAE)为1.24 g/100 g,范围1.14至1.43 g/100 g;平均绝对百分比误差(MAPE)为11.7%。Bland–Altman分析显示平均偏差为?0.37 g/100 g(95% CI ?1.24至+0.50),95%一致性界限为?4.42至+3.69 g/100 g,呈轻微且无统计学意义的低估趋势。方差分解显示,食物间差异解释了误差变异的大部分(MAE的ICC = 0.75,MAPE的ICC = 0.97),而模型层级和提示复杂度几乎不解释误差变异(边际R2分别为0.005和0.001)。
三、关键技术方法
研究采用的关键技术方法包括:析因实验设计(2×2:模型层级×提示复杂度);食物选择基于POF 2017–2018数据集(391种食物中筛选出20种最常获取且具有标准化营养成分并可在SBD应用中对应条目的食物);参考标准为SBD移动应用(整合巴西食物成分表TBCA和USDA数据库);提示策略包括简化版(面向普通用户,口语化直接提问)和详细版(面向专家,包含角色设定、临床背景和结构化响应要求);统计分析包括针对聚类数据的Bland–Altman分析、食物内精确McNemar检验、含食物随机截距的线性混合模型(拟合MAE和MAPE)以及广义线性混合模型(拟合二分类准确性结局)。数据收集于2025年11月由单一研究者(ARV)完成,所有查询均在ChatGPT临时聊天模式中进行,禁用记忆和训练功能以减少交叉污染。
四、研究结果
临床准确性:ChatGPT对全部80次查询均返回可用数值估算,68/80(85.0%;95% CI 75.3–92.0)满足准确性标准。四种实验条件下准确率完全相同:每种模型层级和每种提示策略下均为34/40(85.0%),四种组合条件下均为17/20(85.0%)。相同准确率来自不同食物:白米饭仅在Thinking版+普通用户提示下达标,西瓜仅在Thinking版+专家提示下达标,Pera橙在两种Instant条件下达标但两种Thinking条件下均未达标;瓜拉那软饮料在四种条件下均未达标。食物内配对比较中,模型层级比较有36/40对一致、4对不一致(各方向2对);提示复杂度比较有38/40对一致、2对不一致(各方向1对)。广义线性混合模型将几乎全部结局方差归因于食物级随机截距(ICC = 0.973),所有条件效应在logit尺度上估计为零且置信区间宽泛。
与参考数据库的一致性:针对聚类数据的Bland–Altman分析得出平均偏差为?0.37 g/100 g(95% CI ?1.24至+0.50;p = 0.389),95%一致性界限为?4.42至+3.69 g/100 g。两种参数化下均无比例偏差证据(以参考值为横轴时斜率?0.013,p = 0.359;以两者均值为横轴时斜率?0.012,p = 0.429)。绝对误差与参考值之间的关联同样较弱(Spearman ρ = 0.289,p = 0.217)。
估算误差幅度:四种条件下有符号误差均分布在零附近,四种条件均值均为负且95%置信区间均包含零。总体MAE为1.24 g/100 g(95% CI 0.52至1.95),条件间范围1.14至1.43 g/100 g;总体MAPE为11.7%,条件间范围11.0%至12.6%。模型层级对MAE的估计差异为?0.11 g/100 g(p = 0.563),提示复杂度差异为+0.10 g/100 g(p = 0.617);对MAPE的相应差异分别为+0.72个百分点(p = 0.420)和?0.04个百分点(p = 0.964)。交互作用对两种结局均不显著。食物间差异解释了误差变异的大部分(MAE的ICC = 0.75;MAPE的ICC = 0.97),而模型层级和提示复杂度几乎不解释任何变异(边际R2 = 0.005和0.001)。
五、讨论与结论
讨论部分指出,本研究的误差幅度(MAE 1.14–1.43 g/100 g)远小于患者自身的估算误差(平均约15.4 g/餐),但两者不可直接比较,因为患者误差包含份量估计、餐食组成、制备方法、标签解读和健康素养等因素,本研究均未涉及。模型层级和提示复杂度之间未检测到差异,且方差分解显示食物间差异解释了大部分误差变异,提示碳水化合物含量检索更像知识检索任务而非推理密集型任务,额外推理能力不带来优势。若此解释成立,则对可及性具有实际意义:对于该特定任务,更昂贵的层级和更复杂的提示不带来可测量的获益。与基于图像的AI估算方法相比,文本检索避免了从二维图像推断体积的几何不确定性,这可能解释了本研究更窄的一致性界限和缺乏方向性偏差。两项偏差最大的食物(瓜拉那软饮料和Pera橙)说明了验证语言模型与国家食物成分应用之间的一般性属性:模型能否解析特定国家条目或退回到通用值,取决于参考数据库能否表示该条目。研究强调任何临床整合应严格作为决策支持而非替代专业判断,15%的估算落在准确性标准之外且集中于四种食物,支持保留人工监督的必要性。
研究结论翻译如下:在这项对20种具有标准化营养成分的巴西食物的受控比较中,ChatGPT生成的碳水化合物估算值在85.0%的查询中落在相对于SBD参考数据库的研究准确性界限内,平均差异为?0.37 g/100 g。在订阅版与免费版之间、详细提示与简化提示之间均未检测到差异;由于本研究并非按等效性试验设计且未预设等效性界限,这些发现并不确立模型层级间的等效性。这些结果描述了标准化条件下知识检索任务的技术准确性,将免费版ChatGPT确定为碳水化合物计数的候选辅助工具(尤其在资源有限的环境中),但并未确立临床安全性或有效性,任何此类使用都需要在营养师监督下采用人在回路模式。确定该工具是否使患者获益,需要跨会话重复性研究、非标准化餐食验证以及测量血糖结局的实用性试验。