乐于分享
好东西不私藏

疯狂使用 AI 工具后,我终于看清真正的瓶颈是这两个能力

疯狂使用 AI 工具后,我终于看清真正的瓶颈是这两个能力
你的 AI 还停留在只能提供情绪价值和聊天吗?没法实际干活吗?
我的结论:AI 的分水岭已经不在模型谁更强,而在两样东西——从 Prompt Engineering(提示词工程)到 Loop Engineering(循环工程)的演化,以及 Computer Use(操作电脑)。前者决定 AI 能不能「定目标、把活干完」,后者决定它能不能真的替你动手。大家好,我是"你猜吧 AI"。
一、大佬们已经不写提示词了
今年 6 月,谷歌 Chrome 工程总监 Addy Osmani 写了一篇文章,给一个新词正式命名:Loop Engineering(循环工程)。他的定义很干净:
"Loop engineering is replacing yourself as the person who prompts the agent. You design the system that does it instead."
翻译过来:循环工程,就是不再由你一轮一轮给 AI 发指令,而是你设计一套系统,让系统去驱动 AI。
Claude Code 的创造者 Boris Cherny 说得更直白:
"I don't prompt Claude anymore. I have loops running that prompt Claude and figuring out what to do."
(我已经不再亲自提示 Claude 了,是循环在替我提示它、决定接下来该做什么。)
注意,他们说的不是「提示词要写得更漂亮」,而是——别再自己写提示词了。
二、第一个能力:定目标,把一件事干完
循环工程听着概念,落到工具里其实就一件事:你负责定目标,它负责执行到目标达成为止。
最早的 ChatGPT 只能聊天。你问一句,它答一句,答得再漂亮,活还是你自己干。
后来的 Claude Code、Codex 这类工具能真的动手:读代码库、改文件、跑命令、看报错、再改。关键变化不是「更会说话」,而是它能把活干完——你给的是一个能被验证的目标(比如「把延迟压到 200 毫秒以内,跑这条命令来验证」),它自己循环、自己验证、自己返工,直到把结果交到你手上。
评价标准也跟着换了:以前你评的是「这个回答好不好」,现在你评的是「这件事有没有干完」。没有这个能力的工具,本质还是「你说一句,它干一句」——效率差了一个数量级。
三、第二个能力:操作电脑,卡在「看得懂,但点不准」
第二个能力是 Computer Use:AI 自己看屏幕、自己点鼠标、自己操作软件,而不只是吐一段文字给你。
为什么这个能力稀缺?说到底,是多模态能力不够。现在的主流大模型有两个通病:
一是根本没有视觉能力。有些推理很强的顶尖模型,本身就不带视觉,屏幕对它来说是黑的。
二是有视觉,但空间定位不准。它能看懂这张图里大概有什么,却说不准那个按钮到底在哪个像素上,鼠标一点就点歪了。
这不只是体感。有研究团队专门统计过一个顶级模型在数百个真实电脑操作任务里的失败原因(Agent S,ICLR 2025),结论是:在办公场景下,75% 的失败来自视觉定位(GUI Grounding)错误。针对代码编辑器的研究也指出,模型常常「能找对大致区域,却点不中那个真正可点的像素」。
四、摆在一起看:谁能定目标,谁能操作电脑?
把这两样当坐标轴,市面上的工具一摆就清楚:
更多工具只占一样:阿里的 Qoder 能操作电脑,但还不具备真正的「定目标」能力;DeepSeek 的终端 Reasonix 和 Kimi 则相反——能定目标,但碰不到你的图形界面,操作不了电脑。
也有两样都还没做出来的:比如 Workbuddy,但它也在快速发展。
换句话说:同时具备两项的仍是少数,多数工具只占一样,或两样都还没有。产品体验的差距,才是真差距。
写在最后
我的判断很简单:模型能力之间的差距在缩小,但「能不能把一件事真正干完」的执行差距,正在拉大。
这个结论不是看评测看来的,是真金白银烧出来的。为了拆清楚这些工具,我把手上各类模型和会员额度基本都烧光了——免费的烧到上限,付费的套餐一个个见底。但和「AI 到底能不能解决实际问题」相比,额度烧没烧反而是最不重要的那件事。
所以回到开头:AI 的分水岭,就在「定目标、执行目标」的能力和 Computer Use。谁能把这两样做稳,谁就是下一代 AI 工具的赢家。
关注我,我是"你猜吧 AI",帮你拆解前沿 AI 信息差。

相关学习资料