未代谢叶酸:生物学、流行病学与临床后果——一项系统综述

《Nutrients》:Unmetabolized Folic Acid: Biology, Epidemiology, and Clinical Consequences: A Systematic Review

【字体: 时间:2026年09月04日 来源:Nutrients 5.8

编辑推荐:

  背景/目的:在基于视觉语言模型(VLMs)的食物图像营养估算中,份量大小是误差的主要来源,然而提示词如何改变估算量——以及改变的方向——尚未得到表征。研究人员测试了日本营养师提示词是否对模型的份量估算产生系统性、方向性的影响,以及显式幅度指令相比之下会产生何种

  
背景/目的:在基于视觉语言模型(VLMs)的食物图像营养估算中,份量大小是误差的主要来源,然而提示词如何改变估算量——以及改变的方向——尚未得到表征。研究人员测试了日本营养师提示词是否对模型的份量估算产生系统性、方向性的影响,以及显式幅度指令相比之下会产生何种效果。方法:研究人员评估了来自三家供应商的六种视觉语言模型(VLMs),在两个份量模式形成对比的数据集上——NutriImage(日本食堂菜肴;营养师计算的真实值)和SNAPMe(美国膳食照片)——在角色条件(无、日本营养师、美国营养师)与两种份量规格水平交叉设置下进行测试,另设五种额外提示词对照条件,采用图像级配对统计量结合自助法置信区间、交互作用检验、等价性检验以及重复调用变异性分析。结果:日本营养师提示词在所有六种模型和两个数据集中均降低了预测能量(角色主效应p < 10?94),且相对而言大致保持了预测宏量营养素组成;美国提示词仅产生微小且符号不一致的变化。该效应无法由显式“假设份量更小”的指令所复现,后者使估算偏移更大但一致性明显更差,而“假设份量更大”的指令几乎被六种模型中的四种一致遵循,两个OpenAI模型对任一方向的显式幅度指令均基本不敏感。准确性后果取决于数据集:在小份量数据集上误差降低(最高约20个MedAPE百分点),在较大份量数据集上11/12的模型×份量组合中统计上等价(±5个百分点边界)。所有主要效应在统一分析中得到确认,该分析将模型身份在合并图像集(n = 2159张独立图像;Holm校正;在1000次随机重分配中稳健)上随机化。结论:日本营养师提示词对VLM份量估算构成一致的下行影响,且区别于显式缩小指令;其准确性价值具有领域特异性,在实用前必须针对目标领域进行验证。
**1. 引言与背景**

视觉语言模型(VLMs)在膳食评估领域的应用日益广泛,其通过直接分析照片估算营养素含量,作为一种低负担的自我报告替代方案受到关注。此前研究已表明提示词设计和模型选择会显著影响估算精度,但尚未回答一个关键问题:特定提示词会使估算结果向哪个方向偏移。在基于视觉的膳食评估中,份量大小估算是误差的主要来源——因为单个缩放误差会传播至所有营养素,估算量的偏差而非食物识别错误构成了能量和宏量营养素预测方差的主要部分。然而,特定提示词下该误差的系统性方向尚未被表征。角色提示此前多被作为社会和文化偏见的来源加以研究,例如国籍角色会系统性地改变模型对国家的评价方式。本研究试图回答一个此前未被探讨的问题:角色标签是否能够作为模型定量先验的系统性操作符,而非仅仅影响其社会判断。

**2. 研究设计与目的**

研究人员在先前探索性观察的基础上提出假设:日本营养师提示词将相对无角色和美国营养师条件向下移动估算量。本研究利用两个份量模式形成对比的数据集和跨越三家供应商的六种模型,旨在(i)表征这一方向性角色效应及其日美不对称性,(ii)将其方向性特征与准确性后果分离,并(iii)证明该效应近似保持营养素组成中性且对去除场景背景具有稳健性。

**3. 主要技术方法**

本研究采用两个数据集:NutriImage(899张日本食堂菜品图像,由注册营养师根据日本食品标准成分表计算真实值,Zenodo存档)和SNAPMe(1478份美国膳食照片,含棋盘格比例标记,Ag Data Commons存档)。六种模型来自Anthropic(Claude Haiku 4.5、Sonnet 4.6)、OpenAI(GPT-4o、GPT-4o-mini)和Google(Gemini Flash、Pro)。实验设计为三角色条件(无、日本营养师、美国营养师)×两份量规格水平(L0无份量信息、L1明确标注一份标准份量)的完全交叉设计,另设五种对照提示词条件。主要指标为MedAPE、偏倚和MAE,采用Bootstrap置信区间、图像级配对统计、TOST等价性检验、线性混合效应交互分析以及重复调用变异性分析。此外还设计了统一的随机模型分配分析(n = 2159张独立图像)以消除模型和数据集身份的影响。

**4. 研究结果**

**4.1 角色将份量先验向下移动**:日本营养师提示词在所有六种模型和两个数据集中均向下移动预测能量,且效应深度与模型的基线误差呈负相关(Pearson r = ?0.82);美国提示词仅产生微小且符号不一致的变化。在图像水平上,日本提示词的偏移表现为条件性校正——对模型已低估的图像接近零,对高估的图像随高估程度增大而加深。角色效应无法归因于输出随机性,重复调用分析确认了其稳健性。

**4.2 提示词对照条件**:显式“假设份量更小”指令虽然也产生向下偏移但一致性较差且幅度过大(在代表模型中将中位预测/真实比从1.11降至0.92),而“假设份量更大”指令被Anthropic和Gemini模型几乎一致遵循,两个OpenAI模型对显式幅度指令均不敏感。分解条件表明国籍/地域成分是效应的主要载体:日本家庭主妇提示词复现了大部分日本营养师效应,而中性营养师提示词仅产生微小且符号不一致的变化。

**4.3 输出随机性与重复调用**:Sonnet模型在默认设置下近乎确定性输出,Flash模型表现出真实随机性;两种模型下日本提示词的效应均清晰地区别于条件内变异性,GPT-4o的响应较弱但方向一致。

**4.4 准确性后果取决于数据集的真实份量规模**:在NutriImage(小份量)上,日本提示词降低了所有六种模型的能量MedAPE(Flash ?19.9、Pro ?11.2、Haiku ?7.1、GPT-4o ?5.1等);在SNAPMe(大份量)上,相同的向下偏移未改善准确性。供应商排序一致:OpenAI效应最小、Anthropic居中、Google最大。

**4.5 营养素间泛化**:日本提示词的效应不限于能量,蛋白质和碳水化合物的MedAPE同步改善,与单一向下调整估算量传播至各营养素驱动的营养素一致。脂肪估计较不稳定,盐被排除在主要声明之外(R2 ≤ 0.16)。预测的宏量营养素能量比例和Atwater一致性在角色条件下基本不变,表明效应为量的缩放而非成分的重新分配。

**4.6 去除场景背景的稳健性**:将图像裁剪至菜品边界框后,日本提示词的准确性效应在16个模型×份量×裁剪组合中的15个为负向改善。

**4.7 跨模型和数据集的角色效应稳健性**:统一的随机模型分配分析(n ≈ 2157)确认了所有主要效应。日本营养师提示词在所有四种宏量营养素上产生稳健下降(能量?25.4 kcal),日本家庭主妇提示词效果类似(?19.6 kcal),美国角色仅稳健地降低盐等价物,中性营养师无稳健效应。日本提示词的效应在图像水平表现为条件性校正:最低五个十分位的基线偏倚中偏移为零,最高十分位加深至?0.44 log2。等效性检验确认所有25个角色-营养素组合均未超过+5个百分点退化界限。

**5. 讨论**

**5.1 效应的机制与性质**:日本营养师提示词与显式缩小指令在种类上不同——前者表现为条件性校正,后者产生近似恒定的偏移。分解条件表明国籍/地域成分而非职业身份是主要载体。这提示该效应可能反映了web-scale训练语料中信息的地理本地化:日常定量规范(如典型份量大小)主要在其自身的语言和区域社区内被记录,角色提示词可能选择了模型所调用的地域规律。

**5.2 与人类膳食评估的类比**:接受过训练的膳食学学生从膳食图像中识别食物的可靠性远高于定量(79.5%正确识别对比38%的份量估算在真实重量±10%以内),且照片份量感知长期已知依赖于评估者携带的参考份量——角色操作似乎控制了模型所参考的份量群体,类似于人类评估者带到同一任务中的文化习得份量大小。

**5.3 两个轴线的区分**:SNAPMe结果迫使进行关键区分——日本提示词在SNAPMe上同样触发了向下开关,但未改善准确性,因为该数据集的基线误差方向不同。这直接回应了此前关于角色效应在客观任务上大体不一致的报告:一旦将对方向性开关及其准确性后果分开考虑,部分不一致性即可被预期。

**5.4 实践意义与伦理考量**:真实膳食评估中每张照片的误差方向因缺少真实值而未知,系统性向下的提示词在一个领域有益而在另一个领域可能有害。该提示词应被视为候选的领域特异性校准干预措施,仅在目标领域代表性标注样本验证后使用,而非常规默认设置。此外,将群体层面规律应用于个体估算存在生态谬误和强化关于国家饮食习惯的规范性假设的风险——本研究表征了一种机制,而非推荐将国籍标签作为校准设备部署。

**6. 结论**

在所评估的六种模型和两个数据集中,日本营养师提示词作为对预测量的定性一致的下行影响:(i)偏移在每一种模型×数据集组合中均为向下;(ii)其深度随模型基线高估程度缩放,而无论基线误差符号如何均会触发;(iii)在种类上区别于显式幅度指令——表现为集中于高估图像的条件性校正,而指令产生近似恒定、供应商特异性的偏移,且对显式指令的遵循本身是供应商依赖性的;(iv)其载体是角色的国籍/地域成分而非职业身份,日本家庭主妇提示词复现了大部分效应而无限定国籍的营养师提示词几乎没有效应;(v)其准确性后果取决于数据集,在小份量单品菜数据集上降低误差,而在较大份量的膳食数据集上基本不变。该效应近似保持预测的宏量营养素组成,盐是记录在案的例外。统一的随机模型分配分析表明,这些效应在六种评估模型、两个图像来源以及重复随机模型重分配下均保持稳健。以上是对所评估特定提示词的定性表征:报告的幅度以确切措辞为条件,不存在校准过的角色强度量表,对其他国籍或角色提示词的推广性仍有待验证。该论文发表于《Nutrients》。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号