乐于分享
好东西不私藏

AI制定的饮食方案可靠吗?国际权威期刊揭示真相

AI制定的饮食方案可靠吗?国际权威期刊揭示真相
来源   科学家杂志

生成式AI制定的饮食方案可靠吗?Frontiers in Nutrition最新研究:非常不可靠 科学家杂志AI绘图 GPT5.5

生成式AI系统制定的饮食方案有多可靠?根据近期发表于《Frontiers in Nutrition》的一项研究,答案是不太可靠。这些系统生成的膳食计划在热量摄入、宏量营养素和微量营养素方面均存在不足,尤其对青少年群体而言问题更为突出。
该研究旨在评估AI生成膳食计划的临床有效性,通过将其营养成分与注册营养师依据特定国际指南制定的参考方案进行对比。研究人员使用五种生成式AI模型(ChatGPT-4o、Gemini 2.5 Pro、Claude 4.1、Bing Chat-5GPT和Perplexity),为四种标准化青少年档案各生成60份为期3天的膳食计划。针对每种档案,营养师根据最新的青少年推荐指南制定了相应的参考方案。
研究发现,AI模型系统性地低估了热量摄入(低估695千卡)、蛋白质(19.9克)、脂肪(15.8克)和碳水化合物(114.6克),同时高估了蛋白质(占总能量的21.5%-23.7%)和脂肪(占总能量的41.5%-44.5%)的比例。尽管各模型表现差异显著,但没有任何一个模型展现出对指南推荐的有意义依从性。

训练数据质量是关键

生成式AI在健康领域再次证明其不可靠。它们生成的建议看似令人信服,却并非总是具有临床适宜性。一个令人困惑的因素是,来自权威科学学会和卫生机构的国际指南在网上广泛可得,这本应让人期待更高的可靠性。然而,AI的回答往往反映的是网络上质量参差不齐的内容,包括流行观念和缺乏科学支持的营养方案,如极端低碳饮食。
核心问题在于训练数据的质量。AI模型并不理解循证医学原则,不受既定证据等级体系的指导,且训练材料本身的科学严谨性有限。例如,近期研究表明,YouTube是谷歌生成式AI模型Gemini的主要训练来源之一。此外,这些系统倾向于将回答导向用户预期,优先考虑合理性和内部一致性,而非严格遵循科学指南。这可能导致营养计划看似正确,但临床适宜性不足。

新兴解决方案

正如许多专家所指出的,提高AI训练数据的质量和可靠性势在必行,垂直整合可能是实现这一目标的途径。一个典型案例是世卫组织(WHO)支持的创新研究原型——智能AI健康资源助手(S.A.R.A.H.)。S.A.R.A.H.旨在探索专门基于WHO生成的文件和报告进行训练的生成式AI,如何改善公共卫生信息的传播与分发,包括合理营养方面的信息。
一些随机研究已基于国际指南和当前科学证据,评估了聊天机器人系统和生成式AI在改善饮食习惯和促进减重方面的有效性。
例如,在糖尿病护理领域,一项完全自动化的AI驱动糖尿病预防项目被证明在实现复合结局(包括减重、体力活动和糖化血红蛋白水平)方面,与标准糖尿病预防项目相比具有非劣效性,研究对象为糖尿病前期或超重/肥胖的成年人。
基于聊天机器人干预的荟萃分析也报告了其在生活方式改善方面的有效性,包括增加体力活动(每日增加735步)、水果和蔬菜摄入(每日增加1份),以及睡眠时长(增加45分钟)和睡眠质量。
垂直整合的AI解决方案——专注于单一目标、基于全面且异质化的数据集进行训练、纳入开发个性化膳食计划所必需的临床数据、使用当前临床指南和最新科学证据、并通过严谨的研究方法进行科学验证——这些正是经严格评估后对健康和疾病预防产生真实效果的关键底层工具。而这恰恰是当前面向公众的生成式AI系统所缺乏的。
作者:Eugenio Santoro,意大利马里奥·内格里药理研究所IRCCS(Istituto di Ricerche Farmacologiche Mario Negri IRCCS)数字健康高级研究员,数字健康研究与数字疗法部门主任。
来源: 本文翻译自Medscape旗下Univadis Italy
声明: 本文仅为学术资讯分享,不构成任何医疗或营养建议。如有健康问题,请咨询专业医疗人员。
点评

这项研究的结论其实很直观:让生成式AI“直接写饮食计划”不够可靠。因为AI会“编得像”,但它很难真正对齐青少年的营养缺口与配比——所以出现热量、蛋白质、脂肪、碳水以及微量营养素等指标系统性偏差,且不同模型也同样缺乏与指南一致性的效果。

更关键的是,研究衡量的是“营养成分是否对标注册营养师依据指南的参考方案”,而不是“看起来是否合理”。青少年处在生长发育窗口,热量和关键营养素误差的后果更大,因此不可靠的影响会被放大。

给公众的实用建议:把AI当成点子/备餐灵感/偏好汇总工具可以,但最终计划(尤其青少年、减重、慢病人群)最好交给注册营养师或医生复核,至少核对总热量、三大营养素比例、铁/钙/维生素D/纤维等关键项。