夜雨聆风学习资料网

ARTICLE · 1115492

AI 正从“聊天工具”变成“持续替你做事的 Agent”

AI 正从“聊天工具”变成“持续替你做事的 Agent”
AI AGENT · 深度观察

从 GPT-6.1 Sol 到 Dots,我越来越确定:聊天框只是 AI 的第一阶段

AI 正在从"等你问一句",变成"接下一件事,然后自己往前走"。

9 月 29 日,OpenAI 又开了一场发布会。

GPT-6.1 Sol、Agents API 的 computer use、Multi-agent,还有一个看起来没有传统模型名字那么炸眼的新产品——Dots。

如果只是刷科技新闻,很容易把这些东西理解成:又一个新模型。又一次 API 更新。又一个 Agent 产品。

可把它们放在一起看,我觉得真正值得关注的变化不是"模型又强了多少"。

而是:AI 正在从"等你问一句",变成"接下一件事,然后自己往前走"。

过去三年,我们习惯的 AI 使用方式其实没有发生根本变化。打开一个聊天框。输入一句话。等待回答。觉得不对,再追问一句。

无论模型从 GPT-4 变到 GPT-5,再走到今天,表面能力变化巨大,但对于绝大多数普通用户来说,操作逻辑依然是:人负责启动每一步,AI 负责完成当前这一步。

但 Agent 想改掉的是这件事。你不再只是问它:"帮我查一下。"而是开始告诉它:"这件事交给你。"

两句话只差几个字,背后的产品逻辑却完全不同。

01

这周最重要的 AI 新闻,不是又发布了一个模型

先看几个发生在最近的数据点。

9 月 29 日,OpenAI 正式发布 GPT-6.1 Sol,用于复杂编码和专业工作,同时在 Responses API 中加入 Multi-agent beta,让一个模型能够把任务分配给多个子 Agent。

同一天,OpenAI 还给 Agents API 加入了 computer use。也就是说,Agent 不再只是调用几个固定 API,它开始可以在托管浏览器中访问网站、操作软件界面,并完成以前必须由人点击鼠标才能完成的一部分工作。

而 Agents API 本身的定位更值得注意。OpenAI 在 9 月推出它时,描述的已经不是传统聊天机器人,而是能够管理上下文、使用工具、协调子 Agent,并在云端持续运行较长时间的 Agent 基础设施。

9 月 29 日 DevDay 上出现的 Dots,则把这种趋势进一步推到了普通用户面前。按照 OpenAI 对外展示的方向,它不是一个"问答机器人",而是一类可以围绕用户目标持续运行、跨工具推进项目的 AI Agent。

另一边的 Anthropic 也在做同样的事。9 月 22 日发布的 Claude Opus 5.5,把长时间运行的 Agent、复杂编码和专业工作作为主要能力;9 月 28 日推出的 Sonnet 5.5,则继续把 Agent 能力做得更快、更便宜。

单独看,每一家都像是在发产品。放在一起看,方向已经非常清楚:

这一轮 AI 公司竞争的对象,正在从"谁回答得更好",变成"谁能把事情真正做完"。

02

Chatbot 和 Agent,中间其实隔着一份"责任"

我觉得很多人现在对 Agent 最大的误解,就是把它理解成:"更聪明的 ChatGPT。"其实不是。

假设我对一个普通聊天模型说:"帮我找杭州最近值得关注的十条 AI 行业新闻。"它给我十条结果。任务结束。

但如果我对一个 Agent 说:"以后每天早上帮我整理过去24小时值得科技博主关注的 AI 新闻,去掉重复消息,优先看官方来源;按照模型发布、产品、商业、争议四类整理,发现特别重要的新闻单独提醒我。"

这就不是一次问答了。它至少需要知道:去哪里找。什么时候找。哪些信息可信。什么算"重要"。昨天已经发过什么。遇到登录怎么办。某个网站打不开怎么办。最后把结果放在哪里。如果错误了怎么停下来。

所以真正的 Agent,从来不只是一个大模型。它至少需要几样东西:模型、工具、记忆、权限、运行环境,以及一套失败之后怎么办的机制。

这就是为什么今年越来越多 AI 产品开始强调 browser、computer use、memory、sub-agent、background task。因为模型公司终于开始碰到一个非常现实的问题:

光会思考,没有手和脚,是没办法接工作的。

03

AI 第一次真正开始进入"时间"

这是我觉得 Agent 最容易被低估的一点。ChatGPT 时代的 AI,基本存在于一个个瞬间里。你打开它。你发一句话。它回复。窗口关掉,这件事结束。

但真实世界里的工作不是这样的。做一个项目,可能持续两周。经营一家店,是每天发生的。运营一个账号,要不断看数据、找素材、回复评论、调整内容。开发一个程序,需要写代码、跑测试、发现报错、修改,再测试。

真正的工作,本质上都是:状态不断变化的一条时间线。而 Agent 第一次开始试图进入这条时间线。

OpenAI 现在强调 long-running agents,Anthropic 也在强调能够持续推进复杂任务的 Agent。这意味着 AI 产品的单位可能正在发生变化。

过去 AI 的最小单位是:

一次回答。

未来可能变成:

一个任务。

再往后,甚至可能变成:

一个持续目标。

比如以前我们说:帮我分析今天的数据。未来可能变成:我的目标是把这个账号的获客成本控制在100元以内,你每天看数据,发现异常告诉我,并给我调整建议。

以前是用户不断调用 AI。以后可能是:AI 围绕目标不断调用工具。这两个世界差得非常远。

04

所以未来最值钱的,可能不是"会写提示词的人"

过去两年,一个非常流行的词叫:Prompt Engineering。怎么写提示词。怎么让模型按照格式输出。怎么用几个关键词提高效果。这些能力当然还有用。

但如果 Agent 真正开始成熟,我觉得它的重要性会下降。因为 Agent 时代最困难的问题已经不是:"这一句话应该怎么问?"而是:"这件事应该怎么做?"

举一个最普通的例子。一家电商公司想用 AI 做客服。最初的玩法是:复制客户问题。粘贴给 AI。生成回复。再复制回来。这是 Chatbot。

进一步,你可以做一个 Agent:读取客服消息。识别售前、物流、退款、投诉。查询订单。调用物流系统。根据公司的售后规则形成回复。金额超过某个范围时转人工。涉及差评时通知负责人。最后把结果记录进客户系统。

这个时候决定效果的已经不是一句 Prompt。而是:流程。哪些步骤 AI 可以自己做?哪些步骤一定要人确认?它可以看到什么数据?可以修改什么?多少钱以上必须停下来?失败了回到哪里?谁对最后结果负责?

这其实已经越来越像过去企业里的 SOP,而不是提示词。

Prompt 是 AI 时代的操作技巧。

Workflow 才是 AI 时代真正可以积累的资产。

05

我现在看模型已经不太在意排行榜第一了

以前新模型发布,我第一反应也是:跑分多少?代码榜多少?上下文多长?超过谁了?

现在我反而越来越关注另外几件事。

第一件:它能独立工作多久?

一个只能连续做三分钟任务的模型,和一个能够稳定运行几个小时、知道自己做到哪一步的 Agent,是两种完全不同的生产工具。

第二件:它能接多少真实工具?

浏览器、邮箱、表格、企业系统、代码库、文件、CRM……这些东西决定 AI 能不能真正离开聊天框。

第三件:它犯错之后,我能不能发现?

这一点可能比能力更重要。模型生成一段错误文案,问题不大。一个 Agent 如果发错一封邮件、删错一个文件、改错一个价格,错误就已经进入现实世界。所以权限、审批、日志、回滚,很可能会成为 Agent 时代最重要,却也是最不性感的一层产品。

第四件:它到底有没有省下人的时间?

一个 Agent 即使能完成80%的任务,但剩下20%需要人花更多时间检查,那它依然可能没有生产价值。所以真正值得算的不是"这个模型每百万 token 多少钱。"而是:原来一个人完成这件事需要多少时间,现在需要多少时间。这是完全不同的一笔账。

06

Agent 越强,"别什么都交给它"反而越重要

这里还有一个经常被发布会演示掩盖的问题。AI 从"提供答案"走向"执行动作"以后,错误的性质会改变。聊天模型答错一个答案,很多时候只停留在屏幕上。Agent 如果拥有浏览器、账号和系统权限,错误可能会直接变成操作。

所以我们现在看到的一个明显趋势是:一边是 Agent 能力越来越强,另一边各家公司开始越来越强调权限控制、审批、审计和安全监控。

这其实透露出了 Agent 时代一个很现实的矛盾:一个 Agent 越有用,就意味着你必须给它越多权限。而权限越多,它犯错的成本就越高。

所以未来非常重要的一项能力,可能不是:"我的 AI 能做什么?"而是:"我的 AI 哪些事情绝对不能自己做?"

付款。删除。发布。签署。提交。改核心数据。联系重要客户。

这些高后果动作,都应该拥有非常明确的人工确认节点。

我甚至觉得,未来真正成熟的 AI 产品不会以"全自动"为卖点。而会越来越强调:在哪些地方自动,在哪些地方一定不自动。

07

Agent 最先改变的不是工作,而是"重复劳动"

很多人一听 Agent,就容易想到:"以后 AI 是不是要替代某个职业?"这个问题太大。我反而更愿意看一个很小的单位:任务。

一个职业由几十甚至几百种任务组成。AI 不需要一次取代一个职业。它只需要不断吃掉其中那些:重复。规则相对清楚。材料比较固定。结果可以检查。失败成本可控。的部分。

对于一个科技博主来说,可能是:每天找新闻。整理官方更新。提炼选题。把直播录音转成提纲。整理评论区问题。统计过去30篇内容的数据。

对于一家小公司,可能是:客户咨询分类。会议纪要。报价资料整理。项目进度提醒。售后问题归档。竞品信息搜集。

对于程序员,则可能是:排查 Bug。跑测试。修改多个文件。整理代码。生成文档。

这些东西单独看都不像"AI 革命"。但如果每天少掉两小时,连续一年,就是另一回事。

所以 Agent 真正的普及方式,很可能不是:某一天所有人突然拥有一个"AI 员工"。而是我们回头才发现:过去每天自己点二十次鼠标的事情,现在已经很久没有亲手做过了。

08

AI 下一代真正的界面,可能不是聊天框

过去几年,我们几乎已经默认:AI = 一个输入框。这个设计太成功,以至于我们容易认为它就是 AI 最终的样子。但聊天框可能只是生成式 AI 最早期、最通用的一种界面。

如果未来一个 AI 能同时管理五件持续任务:帮我盯项目。整理每天的信息。处理客户咨询。监控账号数据。推进一个研究。那么真正合理的界面可能不会是五个聊天窗口。而更像一个任务面板:正在进行。等待确认。出现异常。已经完成。需要人工处理。

到那个阶段,我们甚至不会一天打开 AI 二十次。它会一直在那里工作。人只在需要判断的时候出现。

如果真走到这一步,那么这轮 AI 革命真正改变的就不只是:"电脑里多了一个聪明的软件。"而是电脑本身的操作逻辑发生变化。

过去我们学习软件。知道按钮在哪里。知道菜单怎么点。知道这个数据要从 A 软件复制到 B 软件。未来越来越多时候,我们可能只是表达目标:

"把这件事推进到需要我做决定的地方,再来找我。"

中间那些按钮,逐渐消失。

写在最后

2023 年的时候,大家争论的是:AI 会不会写东西。后来争论:AI 会不会画图、写代码、做视频。到了今天,我觉得问题已经慢慢变成:AI 能不能独立完成一件事情。这是一个比模型参数更重要的变化。

模型智力还会继续增长。价格还会继续下降。新的版本可能隔几周甚至几天就出现。但如果把今年这条产品线拉远来看,也许未来回头时,我们真正记住的不会是:"GPT-6.1 Sol 比上一代强了多少。"而是:从这个阶段开始,AI 第一次不满足于回答人类的问题,而是开始接手人类交给它的任务。

聊天框不会消失。但它可能正在从 AI 的全部,变成 AI 的入口。

而下一阶段真正值得普通人学习的,也许不是再收藏100条提示词。而是找出自己每天都会重复发生的一件事情,然后问一句:如果我不再一步一步教 AI 做,而是把整个任务交给它,我应该怎样设计这条流程?

这可能才是 Agent 时代真正的第一课。

下一篇,我准备挑一个真实工作场景,把它拆成一条完整的 Agent 工作流:哪些步骤可以自动,哪些步骤必须人工确认,以及一条"AI任务链"究竟应该怎么搭。

相关学习资料