
-
生物通官微
陪你抓住生命科技
跳动的脉搏
Cell:你衰老得有多快?问人工智能
《nature》:How fast are you ageing? Ask AI
【字体: 大 中 小 】 时间:2026年09月20日 来源:nature
编辑推荐:
一个新的系统将帮助科学家完善长寿研究的大型语言模型,并阐明生物年龄。
从神话中对长生不老的追求,到现代科学对延年益寿药物的探索,了解人类衰老的原因以及如何延缓这一过程,是一个困扰了数千年的问题。
现在,这项任务已经进入了人工智能时代。
今天发表的一份报告展示了一种定制的人工智能系统,旨在加速寿命研究。该系统引入了大型语言模型(llm),作者对这些模型进行了老化生物学数据的训练。它还包括一套17项任务,可以作为衡量这些LLM和其他LLM在老龄化相关项目中的表现的基准。最后,它包括一个接口,将模型和其他与老龄化相关的研究工具与称为代理的人工智能助手结合在一起,以帮助分析。
作者使用他们的基准来评估他们的专业LLM和OpenAI和DeepSeek等公司生产的更大的尖端商业模型,这些模型在更大、更多样化的数据集上进行训练,以处理更广泛的任务。在许多(尽管不是全部)测试中,专门针对老龄化研究的LLM表现优于大型LLM。
“这篇论文对长寿和老龄化领域做出了非常重要的贡献,”Marinka Zitnik说,他是马萨诸塞州波士顿市哈佛医学院的计算机科学家,没有参与这项工作。它可以为下一代人工智能模型的开发提供信息。
这项工作还解决了该领域的一个关键问题:在科学家自己还没有定义衰老这个概念的情况下,研究人员如何训练人工智能工具来理解衰老?Zitnik说,对于某些疾病领域,比如癌症,人工智能的任务可以非常明确地定义。老龄化是一头非常不同的野兽。这很难定义。
但是,即使时钟越来越复杂,研究人员仍然不确定如何解释他们的结果。上周,一组研究人员报告说,在一项小型临床试验中,一种治疗肺部疾病的实验性药物降低了接受者的生物年龄。这个结果是基于六种不同的衰老时钟得出的,然而研究人员很难得出结论,这种药物是否真的逆转了衰老的基本过程,或者它只是改善了整体健康状况。
这是一个难题,并不局限于那项研究。英国剑桥大学的表观遗传学家Chiara Herzog问道:“衰老在哪里结束,疾病在哪里开始?”你如何解开这个谜团?这不是很清楚。
由生成式人工智能(AI)驱动的临床阶段生物技术公司Insilico Medicine(“Insilico”;香港交易所:3696)今日宣布,在《细胞》杂志上发表了一项具有里程碑意义的研究,该研究推出了一套开放的人工智能工具包,其中包括LongevityBench、Longevity-LLMs和LongevityClaw,旨在加速衰老与长寿领域的研究及治疗开发。
长寿领域
衰老是由一系列复杂且相互关联的生物学过程所驱动的,这些过程贯穿于人体生物学的多个层次。要深入理解这些过程,研究人员需要将临床记录与遗传学、表观遗传学、转录组学、蛋白质组学以及其他大规模生物数据集进行整合。
“长寿领域正从静态的衰老时钟迈向能够生成可量化、可付诸行动的洞见的基础模型。我们正在研发经过基准测试、具备自主智能的系统,这些系统有望演变为个性化的长寿助手与长寿伴侣,最终帮助人们监测并提升健康寿命。这一系统有望通过加速靶点识别、实现更精准的个性化干预以及改善人群层面的健康结局,彻底变革长寿医学、药物研发、保险及公共卫生等领域。”Insilico Medicine创始人兼联席首席执行官、博士Alex Zhavoronkov表示。
尽管通用大型语言模型在诸多科学任务中表现出色,但其在真实世界衰老数据上进行可靠推理的能力仍鲜有检验。现有的评估体系也往往更青睐对科学事实的记忆,而非对新生物测量数据的解读能力或基于证据得出结论的能力。
为弥补这一空白,研究团队开发了LongevityBench——一个专门用于评估人工智能系统是否能够跨多种表征人类衰老的异构数据模态进行推理的开源基准。
研究人员评估了18个领先的前沿人工智能系统,其中包括由OpenAI、谷歌、Anthropic、xAI、DeepSeek和Moonshot AI等机构开发的模型。分析结果显示,在各个生物领域均存在显著的性能差距。没有任何一个前沿模型能够在全部五类数据上都取得最优表现。此外,模型的性能还因问题表述方式的不同而发生显著变化,这凸显出其稳健性不足,可能制约通用型人工智能系统在科学研究中的可靠性。
最棘手的挑战是从组学数据直接推断生物年龄。即便是规模最大的前沿模型也难以胜任这一任务,这表明仅靠模型规模并不足以实现一致的生物学推理。
为评估这些局限性是否能在不依赖超大规模算力的情况下得以克服,研究人员开发了一套由五款紧凑型开源长寿大语言模型(L-LLMs)组成的系列。
这些模型的参数量介于6亿至90亿之间,并基于与衰老相关的临床数据及多组学数据,在Insilico公司专为科学应用开发的AI系统训练与评估框架——MMAI Gym for Science上进行了微调。
该家族基于Liquid AI和阿里巴巴的开放模型架构构建,其中包括Liquid AI的LFM2架构以及阿里巴巴的Qwen3和Qwen3.5模型系列。
尽管规模相对较小,这些专用的长寿大模型在LongevityBench上的表现均与16个前沿系统相当,甚至超越了其中多数。
表现最佳的模型L-Qwen3.5-9B在该项研究涵盖的26个AI系统中取得了最高综合得分,其性能超越了所有经过测试的前沿模型,包括谷歌的Gemini 3.1-Pro,而参数量仅为后者的极小一部分。
即便是参数量约为6亿的最小专用模型,其性能也优于大多数经过测试的前沿系统。
研究结果表明,在面向特定生物学应用场景时,精心筛选的科学训练数据与领域专用的模型优化,其重要性可能超过模型规模。此外,小型化模型还能为科研机构带来切实的便利:降低计算资源需求,并支持在本地基础设施上更安全、更经济地部署。
生物通微信公众号