ARTICLE · 1030863
从工具到同事:AI科研智能体的下一步��
从工具到同事:AI科研智能体的下一步🤝
AI已经开始参与“做科研”了,但真正决定研究方向的,仍然是人类。🤖🧠
🔍 科学问题:AI能成为科研合作者吗?
现在的AI不仅会聊天,还能检索资料、写代码、运行实验、分析结果,甚至根据反馈修改方案。
但一个更关键的问题是: AI能不能从“执行任务”升级为“提出问题、设计实验、判断结果”的科研合作者?它距离真正的递归自我改进还有多远?
🛠️ 研究方法:测能力,也看真实研发过程
研究团队推出了 Atria Dawn Preview,一个面向科研和工程任务的智能体模型。它基于7440亿参数的混合专家模型训练,并通过“可验证经验流水线”学习:模型需要调用工具、运行任务、生成代码或报告,再通过测试、指标和外部反馈验证结果。研究覆盖两部分:
✅ 在工具调用、深度搜索、办公任务、软件工程、机器学习和网络安全等方向进行16项基准测试;
✅ 分析56名参与者的769条真实研发任务记录和智能体日志,观察AI和人类如何分工。
📊 研究结果:AI负责执行,人类负责判断
🚀 模型能力达到前沿水平 Atria Dawn在16项评测中的5项取得最高报告分数,包括深度搜索、浏览、工具调用和网络安全等任务;在另外3项中排名第二。
💡 AI让更多任务变得可行 在455个AI辅助任务中,有151个被参与者认为:如果没有AI,在相同条件下根本无法完成,占比 33.2%。AI带来的不只是提速,还扩大了“能做什么”的边界。
🤝 AI提出方案,人类做最终选择 在方法和参数决策中,“AI提出、人类选择”占 55.4%;总体上,人类完成了 85.5% 的最终方法或参数决策。
🧭 人类仍是科研方向的掌舵者 在遇到困难的任务中,76.0%通过人类介入继续推进,但人类主要负责补充背景、诊断问题和调整方法,而不是直接接管工作。
🌟 核心结论
AI正在经历三个阶段:
研究对象 → 任务执行者 → 项目级合作者
但它目前还不擅长稳定判断“什么问题最值得研究”。所以,未来科研的关键不只是让AI做更多事情,而是让它学会发现有价值的问题、理解失败经验,并决定下一步该探索什么。
🔗 资源
论文:https://arxiv.org/abs/2609.15818