
-
生物通官微
陪你抓住生命科技
跳动的脉搏
用于食品与营养领域的领域定向问答数据集
《Scientific Data》:A Domain-Targeted Question-Answering Dataset for Food and Nutrition Applications
【字体: 大 中 小 】 时间:2026年08月14日 来源:Scientific Data 7.2
编辑推荐:
摘要像Llama、GPT和Mistral这样的通用大型语言模型在处理食品与营养领域的特定问题时面临挑战,因为该领域的数据往往零散、多样且语义复杂。虽然经过微调的LLM在医疗保健和生命科学领域取得了成功,但在食品领域的进展较为有限,这主要是因为缺乏高质量、针对特定任务的数据集。我们
像Llama、GPT和Mistral这样的通用大型语言模型在处理食品与营养领域的特定问题时面临挑战,因为该领域的数据往往零散、多样且语义复杂。虽然经过微调的LLM在医疗保健和生命科学领域取得了成功,但在食品领域的进展较为有限,这主要是因为缺乏高质量、针对特定任务的数据集。我们提出了FoodBench,这是一个精心整理的问答对基准数据集,用于训练和评估处理食品与营养问题的LLM。它涵盖了营养素估算、食物分级分类、同义词关联、烹饪量度转换以及食品命名实体识别与关联等关键任务。FoodBench能够在零样本、单样本和少样本场景下进行可靠的性能评估,为构建可靠、适应特定领域的语言模型奠定基础。这一资源有助于推动个性化营养、饮食评估以及食品系统创新的发展。在FoodBench任务上对四种通用LLM(Llama 3、Mistral、Gemma、Gemini)进行的测试表明,即使在少样本提示的情况下,它们在营养素估算、食物分级分类以及食品互操作性方面的表现仍然有限。这些结果凸显了需要基于食品数据对LLM进行领域专用微调的必要性,同时也让FoodBench不仅成为评估通用模型的基准,还能用于指导和完善微调工作。