乐于分享
好东西不私藏

AI学会点鼠标了,但别急着把工作交给它

AI学会点鼠标了,但别急着把工作交给它

7月17日凌晨,OpenAI搞了场直播。不是发新模型,不是更新API,这次他们让ChatGPT做了一件事——用户说"帮我分析三个竞争对手,做一份PPT"。然后ChatGPT自己打开了浏览器,搜索了三家公司,整理了数据,打开幻灯片工具,生成了演示文稿。全程没有人类插手。

这不是概念演示。这是已经上线、你现在就能用的功能。它叫ChatGPT Agent。

三个AI,合成了一个

要理解ChatGPT Agent,得先知道OpenAI之前有三个独立的产品。

Operator——能看网页、点按钮、填表单的"浏览器AI"。你让它订个餐厅,它会自己打开订餐网站,选位置,选时间,填人数。但它的能力仅限于"操作网页",不会深度思考。

Deep Research——能从几十个网站里提取信息、综合分析的"研究AI"。你让它调研某个市场,它会搜索、阅读、整理,最后给你一份报告。但它只会"读和写",不会"动手操作"。

ChatGPT——能推理、对话、规划任务的"大脑"。你问它任何问题,它都能回答。但它被困在对话框里,出不去。

ChatGPT Agent把这三个合成了一个。Operator的手、Deep Research的眼、ChatGPT的脑,统一调度,协同工作。你给一个指令,它自己决定该用哪个能力,该搜索还是该操作,该深度思考还是快速执行。

它到底能干什么

OpenAI在发布会上演示了几个场景,我挑最实际的说。

场景一:会议准备。 你说"看看我日历上明天的会议,根据近期新闻帮我介绍一下背景"。Agent会先读你的日历,知道明天跟谁开会、聊什么话题,然后去搜索相关新闻,整理出一份会议背景摘要。你进会议室之前,准备工作已经做完了。

场景二:竞品分析。 你说"分析三个竞争对手,做一份PPT"。Agent会搜索三家公司信息,提取关键数据——市场份额、产品特点、融资情况——然后打开幻灯片工具,排版生成一份可编辑的演示文稿。不是文字摘要,是真正的PPT文件。

场景三:数据处理。 你说"用最新的财务数据更新这个表格"。Agent会找到数据来源,提取数字,填入你的电子表格。以后每月的财务更新,可能就是一句话的事。

场景四:代码运行。 Agent内置了终端,可以运行代码、下载文件、调用API。这让它在处理需要计算的任务时,不再只是"告诉你怎么做",而是直接做完给你。

这几个场景有个共同点:以前你得自己一步步操作,现在一句话,AI替你走完整个流程。

跑分:到底有多强

OpenAI公布了一组数据。在"人类最后考试"(HLE)中,ChatGPT Agent得分41.6%。这个测试涵盖一百多个学科的极难问题,之前o3得分约21%,o4-mini也差不多。Agent直接翻了一倍。

在FrontierMath——已知最难的数学基准之一——中,Agent配合工具得分27.4%。之前的最佳成绩来自o4-mini,6.3%。差了四倍多。数字很漂亮。但我更关心的是:它在真实任务中靠不靠谱。

它还不是万能的

用了一段时间后,我发现几个问题。

第一,慢。 简单任务比如查个日历,几秒搞定。但复杂任务比如分析竞品做PPT,可能要跑五到十分钟。你盯着屏幕看它一步步操作,有种看实习生干活的感觉——能做,但你得等。

第二,会卡住。 Agent在浏览网页时,偶尔会遇到验证码、登录墙、反爬机制。这时候它会停下来,提示你"需要手动登录"或"遇到了验证码"。任务暂停,等你处理完再继续。不是完全自主。

第三,额度有限。 Pro用户每月大约400次Agent调用,Plus用户只有40次。听起来不少,但一个复杂任务可能消耗多次调用——搜索、浏览、分析、生成各算一次。真用起来,40次可能两三天就没了。

第四,安全边界。 涉及到发送邮件、购买商品、提交个人信息这类操作,Agent会明确征求你的授权。你不在旁边点"确认",它不会自己发。这是好事,但也意味着它没法真正"无人值守"。

所以如果你期待的是"睡一觉起来AI把所有活都干完了"——还早。它更像是"你盯着它干,它替你省掉重复操作的部分"。

大厂方案 vs 自己搭

上一篇我教了大家用Claude Cowork搭自动化工作流。有人可能会问:ChatGPT Agent都出来了,我还用自己搭吗?

这是个好问题。两者的定位完全不同。ChatGPT Agent是"通用智能体"——你给它一个任务,它自己决定怎么做。灵活,但不可控。每次执行路径可能不同,结果也有差异。适合一次性、非标准化的任务。

Claude Cowork是"工作流自动化"——你预先设定好步骤,它按固定流程执行。死板,但稳定。每天早上8点跑同样的流程,结果格式一致。适合重复性、标准化的任务。

打个比方:ChatGPT Agent像雇了个临时工,你说干啥它就干啥,但每次干法可能不一样。Claude Cowork像设了条流水线,产品出来质量稳定,但只能做这一种产品。两者不矛盾。临时性的、探索性的任务交给Agent;固定流程的、每天都要跑的,搭工作流。这才是正确的打开方式。

对普通人意味着什么

ChatGPT Agent的上线,标志着一个转变:AI从"回答你的问题"进化到了"替你完成任务"。

以前你问ChatGPT"怎么做竞品分析",它给你一个方法论,你自己去做。现在你说"帮我做竞品分析",它直接做完了给你。从"顾问"变成了"执行者"。

这个转变的影响是双面的。好的一面:大量重复性操作——搜集信息、整理数据、制作文档——可以被AI接管。你省下来的时间,可以花在判断、决策、创意上。AI做执行,你做决策,这才是合理分工。

需要警惕的一面:当AI能替你操作电脑、替你浏览网页、替你做PPT时,你可能会逐渐丧失"动手能力"。就像GPS导航让很多人不再记路一样,AI Agent可能让很多人不再会"自己干活"。

我的建议是:让AI做执行,但别让AI替你思考。它可以帮你搜集信息,但结论你自己下。它可以帮你做PPT,但内容框架你自己定。它可以帮你操作电脑,但关键决策你亲自点"确认"。

别急着交出方向盘

Agent时代确实来了。OpenAI、Anthropic、Google都在往这个方向走,不是概念,是产品。

但我们还在早期。现在的Agent,更像是一个"需要你盯着的实习生"——能干活,但会犯错,会卡住,需要你在关键时刻出手。它还远没到"完全自主、完全可靠"的程度。

所以,别急着把工作全交给它。先用起来,摸清它的能力边界,知道什么它能做、什么它做不好。然后,把适合自动化的部分交给它,把需要判断的部分留给自己。

AI替你干活,不等于AI替你做主。

我是佳,RJ创意屋的主理人。每周分享AI前沿热点解读和工具实战教程,帮你把AI变成真正能用的工具。关注我,这周还会有一篇关于AI Agent赛道的深度分析。你用过ChatGPT Agent了吗?留言告诉我你的体验。