夜雨聆风学习资料网

ARTICLE · 1128527

我让AI把同一件事想三遍:它想得越久,真的做得越好吗?

我让AI把同一件事想三遍:它想得越久,真的做得越好吗?

QUOTE

不是所有任务都值得最高推理,真正重要的是让思考成本和任务难度匹配。

我们常常以为,AI想得越久,答案就应该越好。

如果一次回答不够好,那就让它多检查几遍;如果任务比较复杂,那就把推理强度调到最高。

但我最近看到一个值得验证的现象:高推理有时确实能提高正确率,可它也可能带来额外修改、范围膨胀,甚至把原本正确的结果改坏。

所以这次我没有只问AI“哪个答案更好”,而是设计了一个实验:同一件事,分别让AI用低、中、高三种推理强度来完成。

本文看点

01

三档推理怎么比较

02

高推理为什么会失控

03

怎样做难度匹配

01

我准备了30项任务

任务分成三类。

第一类是简单且答案明确的任务,例如压缩客服回复、提取合同日期、修正错别字、转换温度单位。

第二类是需要调用工具的任务,例如读取CSV、比较报价、查询网页、整理库存和生成FAQ。

第三类是高复杂任务,包含多个同时存在的约束,例如重构脚本、设计采购方案、建立客服Agent升级规则和修复多模块软件问题。

每项任务都分别运行低、中、高三档,共90次模拟运行。

02

我没有只看正确率

如果高推理多答对了几道题,但同时把正确内容改坏,或者多花两倍时间才完成,那么它未必真的更适合工作。

因此我提前设定了六个观察指标:

正确率;

有效完成率;

过度修改率;

范围膨胀率;

回归错误率;

Token和耗时。

这里的“有效完成”有一个额外条件:除了答对,还必须没有无关修改、没有擅自扩大范围,也没有把原本正确的内容改错。

03

第一次看成绩单,我差点只看正确率

指标
低推理
中推理
高推理
正确率
63.3%
93.3%
96.7%
有效完成率
63.3%
90.0%
70.0%
过度修改率
0.0%
6.7%
23.3%
平均Token
1.4k
3.6k
8.5k
平均耗时
56秒
168秒
425秒

如果只看正确率,高推理当然最好:96.7%。

但如果看有效完成率,高推理反而只有70%,低于中推理的90%。

04

高推理是怎么把事情做复杂的?

在一个简单任务中,要求只是把邮件里的错别字修正,不改变语气。高推理档不仅修正了错别字,还把邮件改得更正式,甚至调整了原本没有问题的句子。

另一个任务要求从表格中找出金额最高的订单,只返回订单号和金额。高推理档在答案后面补充了客户价值分析和异常订单建议。这些内容听起来并没有错,但它们都不在任务范围内。

对复杂任务来说,这种主动扩展有时是价值;对简单任务来说,它就是风险。

更麻烦的是,工具任务中的一次“额外清理”删除了原始重复记录。AI可能认为重复记录是数据问题,但原任务要求保留原始数据。它是在检查过程中把正确的边界改掉了。

05

低推理也不是答案

低推理档的问题很明显。

在需要读取工具、处理多重约束的任务中,它经常直接开始回答,没有先确认数据结构,也没有检查不同条件之间是否冲突。

高复杂任务中,低推理的有效完成率只有30%。

所以结论不是“以后都用低推理”,而是:任务越复杂,越需要给AI足够的思考和检查空间。

06

中推理在这次实验中最划算

中推理没有高推理那么慢,也没有低推理那么容易漏掉工具和约束。

在本次模拟任务集中,中推理的正确率达到93.3%,有效完成率达到90%,平均Token为3.6k,平均耗时168秒。

高推理只比中推理多提高了3.4个百分点的正确率,却多消耗约136%的Token,耗时增加约153%,有效完成率还下降了20个百分点。

这说明“正确率更高”并不自动等于“工作结果更好”。

07

真正值得做的是难度匹配

不同任务不应该使用同一个推理档位。

简单且边界明确:低推理通常足够;

需要工具和一次检查:中推理更合适;

多约束、高风险、需要反复验证:高推理才值得使用。

更理想的Agent工作流,不是把所有任务都调到最高档,而是先判断任务难度,再决定是否升级推理。

可以设置几个升级信号:任务约束超过一定数量、工具调用失败、证据互相冲突、第一次检查没有通过,或者任务涉及不可逆操作。

只有出现这些信号,才把任务交给更高推理档继续处理。

08

如果你想自己复现

你可以准备10个简单任务、10个工具任务和10个复杂任务,让同一个模型分别使用三档推理设置。

但一定要在实验前写清楚:什么叫正确,什么叫过度修改,什么叫范围膨胀,什么叫超时。

否则实验结束后,很容易只挑看起来最漂亮的答案,而忽略它是否真的完成了原始任务。

09

这次实验的边界

本次任务、AI输出、Token、耗时和盲审结果全部是模拟数据,没有实际调用Claude或其他模型,因此不能据此判断任何真实模型的推理档位性能。

Anthropic官方材料能够支持的是:推理强度本身存在速度、成本和检查深度之间的权衡。至于某个具体模型在某项编码测试中是否因高推理导致超范围修改或超时,需要以对应测试的原始数据为准。

这次实验真正验证的,不是“AI想多久最好”,而是一个更实际的问题:

「你有没有为不同难度的任务,设置不同的思考成本?」

把所有任务都交给最高推理,就像让一个经验丰富的工程师去检查每一个标点符号。它可能更认真,但不一定更有效。

我是丙海,拿一个现实世界里的真实任务,让AI做一遍,然后解析结果。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

相关学习资料