真正聪明的,不是什么都会,而是知道什么时候不该猜

让 AI 计算:
73927 × 4861 等于多少?
它可能答对,也可能在最后几位犯错。
但一个最普通的计算器,几乎不会出错。
这看起来很奇怪:
为什么能写文章、分析代码的 AI,反而可能算不好一道乘法题?
原因是,大语言模型与计算器擅长的是两类事情。
语言模型擅长理解意图、组织表达和处理模糊问题;计算器擅长按照确定规则完成精确计算。
过去,我们试图让一个模型包办一切。
现在,方向开始改变:
不再要求 AI 什么都会,而是让它学会使用合适的工具。
一、语言模型不是万能机器
大语言模型通过预测后续内容生成回答。
它可以从大量例子中学习乘法的形式,却不等于内部安装了一台永不出错的计算器。
类似的问题还有很多:
它知道大量历史知识,却不知道刚刚发生的新闻;
它能够解释程序,却不能只靠语言真正运行代码;
它能描述天气,却无法凭空获得你所在城市的实时气温;
它能分析日程,却不知道你的日历中已经安排了什么。
这些问题不能只靠“模型再大一点”解决。
因为缺少的不是表达能力,而是:
对外部世界的实时访问能力。
二、工具是 AI 伸向现实世界的手
当 AI 获得工具后,一个回答可以变成这样的过程:
用户问题→ 判断需要什么信息→ 选择工具→ 填写参数→ 获取结果→ 组织答案
例如你问:
东京明天下午会不会下雨?
AI 不应该根据训练数据回忆东京的气候。
它应该调用天气服务,读取最新预报,再向你解释。
你问一个复杂数字时,它应该使用计算器。
你要求分析一份表格时,它可以执行代码。
你想安排会议时,它需要先读取日历。
Toolformer 研究展示了语言模型如何学习判断何时调用搜索、计算器、翻译和日历等外部工具,并把工具结果继续用于生成答案。Toolformer 论文
三、工具为什么能减少幻觉?
因为它把一个问题拆成了两部分。
AI 负责:
理解用户想要什么;
判断该去哪里寻找答案;
把结果解释清楚。
工具负责:
查询实时数据;
执行精确计算;
搜索指定资料;
运行可验证的程序。
可以把它概括为:
模型负责判断,工具负责确定。
ReAct 研究把“推理”和“行动”交替进行:模型先判断下一步需要什么,再访问外部环境,根据结果继续调整。论文报告,这种方式能在部分问答和事实核验任务中缓解纯语言推理带来的幻觉与错误传播。ReAct 论文
四、有工具不等于一定可靠
AI 仍可能:
选择错误的工具;
输入错误的参数;
误解工具返回的结果;
找到过期或质量很差的资料;
在正确数据之上得出错误结论。
更重要的是,工具让 AI 从“说话”走向“行动”。
回答错一道题,影响可能有限。
但如果它调用的是转账、邮件、数据库或文件删除工具,一次判断错误就可能改变真实世界。
所以工具必须配合:
明确的权限范围;
可靠的数据来源;
完整的操作记录;
高风险步骤前的人工确认;
失败后的停止和恢复机制。
五、普通人可以怎样使用工具型 AI?
需要事实时,让它检索
要求给出原始资料,而不是只要一段流畅解释。
需要数字时,让它计算
要求使用计算器或代码,并展示可核验结果。
需要最新信息时,说明时间范围
“日本的首相是谁”和“截至某年某月的日本首相是谁”,可靠性完全不同。
需要执行操作时,先限定权限
可以让 AI 整理邮件草稿,但发送前由人确认。
可以让 AI分析文件,但不要默认授予删除权限。
最后
大模型最有价值的能力,可能不是记住整个世界。
而是面对问题时,知道:
哪些可以自己回答,哪些需要查证,哪些应该交给工具,哪些必须请人确认。
真正聪明的 AI,不是永远自信地给出答案。
而是知道什么时候应该停下来,伸手拿起正确的工具。
夜雨聆风