过去半年到一年,AI工具的使用体验一直处在一个矛盾状态里:单看某个任务,它们常常让人惊艳,但一旦切换场景,表现就变得飘忽不定。写论文提纲时思路清晰的工具,换到净现值计算就开始信口开河;调试代码时表现稳重的助手,面对行业分析却给出一堆正确的废话。
更让人困惑的是,市面上大量测评要么只测聊天手感,要么只盯单一学科,你很难从中找到一条清晰线索:这些工具到底在不同专业任务里表现相差多少,以及,我们该信谁。
我们打算自己来回答这个问题。
本系列共创作者是两位不同专业的学生,一个读商科,一个读工科。我们准备用五期内容、每期4-5个主测工具、2个学科方向、3个核心任务,系统性地测评一批主流AI工具,同时在文中分享我们自己日常使用AI的一些心得和体会。
不过,我们不做排行榜——我们的核心问题是:同一个AI工具,在不同门类的学科任务里,表现是否一致?它在哪类任务中更可靠,又会在哪些环节上频繁失误?这个问题的答案,对不同专业的学生来说,可能比一张笼统的榜单更有用。
为了对比检验 AI 的能力,每期测评会设置三个核心任务。一个是商科任务,主要检验工具对材料的理解能力、论证的严密程度以及证据使用的规范性;一个是工科任务,重点看计算精度、技术判断的合理性和数据处理的可靠性;还有一个跨学科综合任务,要求工具把技术证据转化为带有成本考量的经济或决策建议。
换句话说,我们不只是看每个工具能不能“回答问题”,还要看它能不能在不同学科的话语体系之间切换,能不能在事实和推理之间搭起一座靠谱的桥。
为了确保结果不流于主观感受,我们制定了一套比较严格的流程。
根据控制变量法,每期的任务由一个不参赛的固定第三方 AI 辅助生成初版问题提示词,最终的任务设计、材料定稿和答案验证都由两位作者人工完成,相关问题的提示词在横向对比不同AI工具时保持固定。命题AI不参加当期测评,也不独立提供标准答案。
所有主测工具统一使用默认或标准模式运行,版本、会员档位、测试日期和允许功能全部锁定并如实记录;最高模型、增强推理等额外付费能力只作为前述综合评分最高模型的“能力上限”单独展示,不混入主成绩,避免把两种不同使用场景的问题揉成一个排名。
测试完成后,两位作者会分工复核实验事实、工程计算、代码运行结果和引用来源,能用公式验证的不用感觉,能用程序跑的不用口头承诺。
每篇推文的结论会分三个层次呈现:
先给出每个工具在经济学任务和工科任务中的分别得分,再展示跨学科综合任务的完成情况,最后说明哪些工具更均衡、哪些有明显的学科偏向,以及不同专业的学生可以怎么选。
我们还会把那些“翻车”案例单独拎出来醒目标注,比如文件打不开、主要事实错误、虚构引用、代码无法运行却声称完成,因为这些失败比成功更能说明工具的可靠性边界。
至于最终的得分,为了避免作者主观感受对最终结果产生过多影响,我们的评分标准尽可能客观。评分标准如下:

这次系列测评一共规划了五期,从AI Agent、大语言模型的能力测试开始,逐步扩展到生态与价格比较、智能体搭建平台的易用性评估,最后再对版本更新后的结论做一次复测与复盘。五期之间既有相对独立的话题,又形成一条递进线索,最终希望给你一份带有学科意识的工具使用参考。
第一期会以“AI Agent大战——谁具备真正‘替你工作的能力‘?”为主题,选择五个市面上常见的主测工具,以默认或标准推荐模式完成三个任务、共十五次正式运行。到时候你会看到同一批AI工具,在商科试卷和工科试卷上分别拿了多少分,以及它们在哪里翻了车。
我们不想选出一个脱离场景的万能冠军。我们想做的事更朴素也更实际——观察这些工具跨越学科边界时,哪里可靠,哪里失真,以及谁更适合谁。
欢迎你的持续关注,也欢迎在评论区和后台留言,告诉我们你想测哪个工具、想看什么任务,以及对本实验有何补充指正之处。
那我们,下期见。
作者:里脊肉、任冉
夜雨聆风