我用同一组任务测试三大 AI 助手

同题同表,不凭印象选工具。
我过去选择 AI 工具,常用一句模糊评价:“这个回答感觉更好。”问题是,换一道题、换一天、换一个模型版本,感觉就可能反转。这次我不做总排名,而是先设计一组任何人都能复跑的任务。ChatGPT、Gemini 和 Claude 使用相同输入,关闭历史记忆,不告诉评分人答案来自哪个产品。比较对象不是品牌,而是一次任务交付。
我为什么选这 9 道题
测试分成三组。写作组包括压缩一段冗长通知、从采访记录提取三个观点、为一个反直觉结论重写标题。资料组包括从给定材料找出互相冲突的数字、给每个结论标注出处、拒绝回答材料中不存在的问题。执行组包括修复一个带测试的函数、把混乱表格转成固定字段、根据失败日志提出下一步检查。每组都故意加入一项“应该拒绝猜测”的任务。会回答不是满分,知道证据不够同样重要。
评分前先写答案标准
每道题最多 10 分:结果正确 4 分,证据可追溯 2 分,遵守格式 1 分,不编造 1 分,人工修改量 2 分。人工修改量不是凭感觉打分。我会开启计时:无需修改得 2 分,5 分钟内修完得 1 分,超过 5 分钟或必须重做得 0 分。代码题还要通过现成测试,不能由评分人“看起来应该能跑”来决定。速度和价格单独记录,不混进质量分。否则便宜模型容易因价格得到质量加分,慢模型也可能因等待时间掩盖正确性。
怎样减少品牌偏见
把三个输出复制到纯文本文件,随机标为 A、B、C。删除产品自称、固定口头禅和界面元素,再交给另一人评分。评分完成后才揭晓来源。如果只有一个人,也可以把答案保存一天后再评,至少避免刚看完产品界面时的第一印象。真正严格的盲测还应交换输出顺序,因为人会更认真读第一份答案。
测试最容易犯的三个错误
第一个错误是用不同入口。一个产品能读 Google Drive,另一个只拿到复制文本,这比较的是连接器,不只是模型。如果要比模型,输入材料必须完全相同;如果要比产品,就应明确把入口便利也作为指标。第二个错误是只测一道“擅长题”。长文、代码、实时数据和结构化输出需要的能力不同,单题冠军没有迁移意义。第三个错误是当天宣布永久结论。产品会更新,测试只对日期、版本、套餐和设置负责。报告必须保留这些条件。
我会怎样使用结果
我不会选一个工具包办所有任务。某个产品若在资料题上证据最稳,就作为研究入口;代码题通过率高的承担开发任务;写作题人工修改最少的负责初稿。三组冠军可以是三个产品。项目中的 analytics/templates/ai-assistant-blind-test.csv 已放入 9 道任务的评分字段。测试完成后,只需按产品汇总平均分、直接可用数和人工分钟。这个表比“谁最强”的投票慢一点,但结论能复查,也能在下一次版本更新后重跑。这套方法参考了 OpenAI 关于成功任务成本的评估思路,任务与评分设计由本账号整理。它不是尚未执行的产品排名,而是一份公开测试方案。
夜雨聆风