学
习
篇
如今市面上有许多诸如大语言模型的AI工具可供选择,其中部分工具擅长编码,另一些则更擅长整合综合信息。不同AI产品的性能与使用质量参差不齐,最终的使用效果也天差地别。
记得去年给研究生班上课,发现不少小组最初提交的作业里,都充斥着浓浓的AI生成痕迹。且不说不顾一切滥用AI是否合理,这类AI生成的内容本身就漏洞百出,最典型的问题就是编造虚假参考文献。印象尤其深刻的是,有一位同学引用文献标注的期刊来源,在自己的认知里这本刊物根本不会刊发基础教育方向的文章,几番核对验证后才发现,是AI编造了一个和正规刊名高度相似的假刊名。
可见,不同学生即便同样使用AI工具,最终的使用效果也截然不同,这种差异有时源于使用者驾驭工具的能力高低,也取决于大家选择的AI工具本身质量不同。

如今,AI越发成为大学生、研究生以及高校教师辅助科研的必备工具,无论是润色论文、编写代码乃至生成研究假设,我们现在拥有的生成式人工智能工具选择,比以往任何时候都要多。
但实际上,每款AI工具都各有适配的任务场景:部分以免费聊天机器人的形式提供服务,另一些则开放付费应用程序接口,这意味着它们可以和其他软件完成集成;还有少数模型支持本地下载,方便使用者自行搭建自定义模型。
那么,哪款AI最适合哪类科研任务?不少国际科研人员向《自然》分享了他们当前的AI工具选择方案与使用策略。

o3-mini(理性者)
总部位于美国加利福尼亚州旧金山的OpenAI,早在2022年就通过可免费使用的ChatGPT聊天机器人,将大语言模型推到了全球公众面前。最初,科研人员大多用它查询信息,或是充当写作助手如草拟论文摘要,但新一代模型正在不断拓展这项技术的潜在应用边界。去年9月,OpenAI推出的o1“推理模型”惊艳了整个科研圈,随后又在同年12月推出了性能更先进的o3模型。
这两款推理模型的运行速度比单用普通大语言模型更慢,原因在于它们经过专门训练,会以分步推导的方式响应查询。这种旨在模拟人类推理逻辑的“思维链”过程,帮助它们在科学与数学领域攻克了多项高难度基准测试,也让它们格外擅长处理各类技术任务,如解决编码问题、完成数据重格式化等。
在我国杭州初创公司DeepSeek推出同类推理竞品后,OpenAI推出了一系列新工具,其中就包括响应轻快的o3-mini——这款推理工具对所有注册聊天机器人的用户免费开放,同期推出的还有“深度研究”功能:它允许部分付费订阅者整合数百个网站的信息与引用生成研究报告,效果堪比专业的人工文献综述。这些模型组合使用时表现尤为出色:如在拆解新数学证明中陌生概念这类任务上,o3-mini就完成得十分出色。换言之,想要学习掌握陌生的学术概念,借助这款工具往往能获得更高的准确性。

DeepSeek (全能选手)
DeepSeek-R1的整体功能与o1-mini不相上下,还可通过应用程序接口以极低的成本获取调用。它和OpenAI的常规模型有着本质区别:DeepSeek-R1是开放权重模型,这意味着即便它的训练数据没有公开,任何人都可以下载底层模型,结合自身具体科研项目完成定制化调整。行业内认为R1“彻底解锁了全新范式”,在这套新范式下,整个AI社区,尤其是资源相对有限的开发群体,也能搭建出属于自己的专用推理模型。
运行完整的DeepSeek-R1需要高性能计算芯片,而这正是不少科研人员难以获得的资源。与o1类似,DeepSeek-R1的核心优势集中在数学解题、代码编写与研究假设生成等领域。这得益于DeepSeek选择完整公开模型的“思维过程”,让科研人员能够更高效地优化后续开发方向,最终提升模型输出质量。这种透明度也有望对医疗诊断领域产生深远影响:借助模型的类推理能力开展实验,可以搭建出“从患者评估,到诊断结果,再到治疗建议的完整清晰逻辑路径”。
不过,DeepSeek-R1也存在明显缺陷。这款模型的“思考”过程往往格外冗长,不仅拖慢了响应速度,也降低了它在信息检索、头脑风暴场景下的实用性。由于业界对其应用程序接口和聊天机器人的数据输入安全性存在顾虑,多个国家已经出台禁令,禁止本国国家机构工作人员使用它。

Llama (老黄牛)
Llama长期以来都是科研界公认的首选大语言模型,它是Meta AI于2023年在加利福尼亚州门洛帕克发布的系列开放权重模型,仅通过开放科学平台Hugging Face,下载量就已经突破6亿次。
对处理专有或受保护数据而言,能够在个人或机构自有服务器上运行大语言模型至关重要,可以从根源上避免敏感信息外流,被反馈给其他无关用户或开发者。科研人员已经基于Llama开发出可预测材料晶体结构的大语言模型,还实现了对量子计算机输出的模拟,这都得益于Llama适配性强,更容易学习理解专业的量子语言。

Claude (程序员)
在硅谷,诸多技术从业者都极力推荐使用Claude 3.5 Sonnet进行代码开发。这款由人工智能公司Anthropic打造的大模型,不仅能解读图表等视觉信息,还可流畅处理各类文本内容。此外,它还支持特殊模式,能够远程操作用户的计算机,进而实现对其他软件的控制。
Claude模型的写作风格也广受赞誉。不少大型语言模型(如ChatGPT)在简化技术性表述时,往往会一并丢失原文的核心含义,而Claude模型更擅长在保留原始完整语义的前提下,写出流畅自然的内容,也就是减少所谓的“AI味”。这一优势在不少场景中都是不小的加分项,如:用它起草课题项目资助申请,或是为代码编写解释性注释。
在取自生物信息学、计算化学等领域真实论文的数据驱动型科研任务基准测试中,它的表现同样出色。尽管Claude 3.5 Sonnet可以像OpenAI的模型那样作为在线聊天机器人免费使用,但科研人员若要实现系统的完整集成,只能通过付费应用程序接口访问该服务。

Olmo (开源模型)
对渴望探明大语言模型底层原理的科研人员而言,现有Llama、DeepSeek模型的透明度远远不足,他们需要更开放透明的研究对象。真正的开源模型(而非仅开放权重的模型)会完整提供算法对应的训练数据,以及用于模型训练、评估的全流程代码。目前,这类开源模型中性能表现最优的AI工具就是OLMo 2。
研究这类模型,能够帮助科研人员追溯大语言模型中偏见的源头,将其定位到具体训练数据中,还可以通过更深入地理解算法生成输出的逻辑,进一步提升研究效率。不过当下,所有这类开放模型的主要短板在于:人们通常需要掌握一定的专业知识才能正常运行模型;但随着社区中免费实践课程不断增多,这一领域的“准入门槛正日复一日地降低”。
What are the best AI tools for research? Nature’s guide
Elizabeth Gibney, https://doi.org/10.1038/d41586-025-00437-0
夜雨聆风