乐于分享
好东西不私藏

给AI装了20个工具后,我发现它还是只会用1个

给AI装了20个工具后,我发现它还是只会用1个

点击上方蓝字关注我们

hello,大家好,又见面啦,我是星禾。
从大厂程序员到全职宝妈,再到米核AI合伙人,这几年我算是把"转型"这事儿踩了个遍。现在all in AI方向,每天跟Agent打交道,今天想聊一个让我特别有感触的话题。
前段时间有个朋友跟我吐槽,说他给Agent接了十几个工具——搜索、数据库、邮件、代码执行、文件读写……结果呢?
Agent该用搜索的时候调数据库,该查天气的时候调邮件API,十几个工具摆在那,它就只会用最近加的那个。
我当时听完差点笑出来,因为我自己刚学Agent开发的时候也踩过一模一样的坑——工具越多,Agent反而越笨。

01

为什么工具越多,Agent反而不会干活了?
这事儿反直觉。按理说工具多了,能力应该变强才对。但Agent不是人,它不会"看情况"。
你想,人看到一个任务,脑子里会自动判断:这活用锤子还是扳手?但Agent判断靠什么?靠工具的 description 字段。
你写的描述越模糊,它选错的概率就越高。
比如你写个"处理数据",Agent根本不知道你是处理销售数据还是用户数据,是该查数据库还是该算统计。
更坑的是,当你同时给Agent塞了太多工具,模型的注意力会被分散。
工具一多,噪音就多,Agent分不清哪个才是该用的。
不是模型变笨了,是选项太多了它挑花眼了。
Anthropic的工程团队说得挺直白:上下文是有限资源,得当黄金一样省着用。工具描述也是上下文的一部分,每个工具占的token都是成本。

02

MCP:AI世界的USB-C接口
去年之前,AI工具调用特别混乱。
OpenAI一套格式,Anthropic一套格式,Google又是另一套。
开发者想把同一个工具同时接给GPT和Claude?得写两套适配代码。
2024年底,Anthropic推出了MCP协议(Model Context Protocol)。
它干了一件大事——把AI和工具之间的连接标准化了。
就像USB-C统一了充电口一样,你写一个MCP Server,Claude能用、GPT能用、DeepSeek也能用,一次开发多端复用。
到2026年5月,MCP已经成了事实标准。
公开的MCP Server超过2300个,从数据库查询到GitHub操作到浏览器自动化,基本你想接什么都有现成的。
Cursor、VS Code这些开发工具也都原生支持了MCP。
但MCP解决的只是"怎么接"的问题。更难的其实是"怎么用"。

03

串行、并行、条件调用:工具组合的三种姿势
Agent调工具不是随便调的,有个组合逻辑在里面。
串行调用
最简单的是串行——一个工具的输出是下一个工具的输入。
比如"获取销售数据→分析异常→发报告",三步必须按顺序来,跳步就废了。这种场景最直观,也最不容易出错。
并行调用
然后是并行——多个工具之间没有依赖关系,同时跑。
DeepSeek V4支持在一次响应里返回多个工具调用,用 asyncio.gather 并行执行,3个工具各需1秒的话,串行要3秒,并行只要1秒。GPT-6也原生支持并行工具调用,据评测,Agent Pipeline的吞吐效率提升了数倍。
但并行有个前提:工具之间必须真的互不依赖。如果工具B的输入需要工具A的输出,那就只能串行,硬并行会翻车。
条件调用
最灵活的是条件调用——根据前一步的结果决定下一步调哪个。
这其实才是Agent真正"智能"的地方。
它不是按预设流程走,而是根据上下文自己判断。
有个叫AOG的开源项目挺有意思,它做了一个MCP Server,让Claude、Codex和Gemini三个AI同时写代码,82秒交卷。三个AI在各自的git worktree里并行干活,写完之后互相匿名评审,最后由一个"主席"把最好的部分合并。这就是典型的并行+条件组合。

04

工具打架了怎么办?
这是多工具协作里最容易被忽略、但也最要命的问题。
有个团队做过5个Agent协作的系统——代码架构师、代码生成、质量审查、安全扫描、文档维护。
结果前两周,文档Agent老是覆盖代码注释,安全Agent过度拦截代码生成Agent的输出,开发效率反而下降了。他们花了2个月才找到平衡点。
工具冲突至少有三种类型:
  • 最明显的是输出矛盾——工具A说status等于approved,工具B说status等于rejected,你信谁?
  • 还有目标互斥——"快速回复"和"准确回答"本身就在打架,速度快了思考时间就少。
  • 再就是优先级模糊——用户满意度和公司利润哪个更重要?Agent自己判断不了。
靠谱的做法是搞一套冲突分级机制:
  • 纯文本的小改动,自动合并就行。
  • 字段值冲突但没副作用的,先校验再合并。
  • 涉及审批、权限、外发状态的,必须走人工确认。
  • 已经有副作用而且结果互斥的,直接阻断,先对账再说。
Anthropic在Claude Code里给了三种机制来解决这些问题:
  • Skills管"说什么"——给Agent定义好做某类任务的规范;
  • Hooks管"什么时候自动做"——在关键节点挂确定性脚本,不让AI自己判断危险操作;
  • Subagents管"谁来做、怎么并行"——把大任务拆给多个子智能体,每个有独立上下文,互不干扰。
Netflix用这套架构同时分析数百个构建日志。Shopify更狠——据2026年Q1财报,AI已经写了他们超过50%的代码,团队人数没增加,但交付了300多个产品和功能。

05

核心就一句话
Agent多工具协作的本质,不是给它塞更多工具,而是让它知道什么时候用什么、怎么组合、遇到冲突怎么解决。
这和人用工具的逻辑一模一样。你家的工具箱里锤子扳手螺丝刀都有,关键是知道哪个活该用哪个,别拿锤子拧螺丝。

06

我怎么看,对普通人有什么影响
说实话,我觉得2026年最值得关注的不是模型又变强了多少,而是Agent怎么把工具用好这件事。
因为模型能力的差距在缩小
头部模型的分数差距已经压缩到10个百分点以内了
真正拉开差距的是工具编排能力。
谁把工具选得准、组合得好、冲突处理得稳,谁的Agent就真的能干活,不是只会聊天。
对普通人来说,这事儿直接影响你用AI的体验。
你有没有发现,有时候让ChatGPT帮你查个资料它挺灵,有时候又像在胡说八道?
很多时候不是模型的问题,是它在决定该调哪个工具的时候选错了。
理解了这个逻辑,你就能更好地给AI下指令——
比如把需求拆清楚、一次只让它干一件事,别一上来就丢一个模糊的大任务过去。
工具用对了,AI才是真能帮你干活的搭档,不是个只会刷存在感的聊天机器人。
我自己从学Agent开发到现在,最大的感受就是:
AI能力的天花板,很多时候不是模型决定的,是你怎么编排工具决定的。
模型再强,工具用不对,结果也是垃圾进垃圾出。
如果你也在学AI或者想做AI相关的副业,我整理了一些Agent开发的学习资料和工具清单,免费分享给大家。
有什么问题也欢迎随时交流,看到都会回。
我是星禾,我们下期见!