乐于分享
好东西不私藏

AI 已经从“会聊天”走到“会干活”,普通人该怎么开始?

AI 已经从“会聊天”走到“会干活”,普通人该怎么开始?

从 ChatGPT 到 Agent,普通人真正要学的不是提示词,而是怎样委派一项工作。

2026 年,一项覆盖美国、英国、德国和澳大利亚近 6000 名企业高管的调查,得到了一组看起来互相矛盾的数据:

69% 的公司已经在使用 AI,但约九成高管表示,过去三年没有观察到 AI 给本公司的生产率或就业带来明显变化。[1]

AI 一边在新闻里写代码、做研究、操作电脑,一边又没有让大多数公司明显变快。

问题出在哪里?

我更愿意把问题归在使用方法上:我们已经拥有了新一代 AI,却还在沿用上一代 AI 的使用方法。

很多人把它当成更方便的搜索框:问一个问题,拿走一段回答。公司给员工开通账号,办几场提示词培训,就算“用上 AI”。

但过去几年,AI 真正重要的变化,是它的工作单位变了。

过去,AI 生成一次回答。现在,Agent 开始接手一项任务。

Agent 不是 2025 年突然发明的

“智能体”并不是大模型公司创造的新词。

早在 1995 年,计算机科学家 Michael Wooldridge 和 Nicholas Jennings 就发表过关于智能体理论与实践的综述;同年,第一届国际多智能体系统会议在旧金山举行。[2]

那时的研究者已经在讨论:一个软件怎样感知环境,做出决定,再采取行动。

问题是,早期系统工作的世界很窄。开发者需要事先规定它能看到什么、有哪些状态、遇到什么情况执行哪条规则。环境一变,规则就可能失效。

所以,今天的 Agent 既新又旧。

“感知—决策—行动”的想法已经存在几十年。改变局面的,是大语言模型逐渐成为了一种通用的目标理解器。

2017 年,Transformer 改变了机器处理语言上下文的方式。2020 年,GPT-3 展示了大模型仅凭指令和少量例子完成多种语言任务的能力。2022 年,ChatGPT 又把这种能力装进了一个人人会用的对话框。

但从“会聊天”走到“会办事”,中间还有一座容易被忽略的桥。

2022 年 10 月,ReAct 论文提出让语言模型交替进行推理、行动和观察:它先判断下一步该做什么,调用外部工具,读取结果,再根据新情况调整计划。[2]

2023 年的 Toolformer 又向前一步:模型可以学习什么时候调用工具、调用哪个 API、传入什么参数,以及怎样使用返回的信息。[2]

后来出现的联网搜索、代码执行、文件处理、长上下文、多模态和电脑操作,并不是一堆互不相关的新功能。它们一起补齐了 Agent 所需的几个部件:理解目标、制定计划、使用工具、观察结果、继续行动。

2025 年以后,这套研究路径开始集中进入大众产品。

于是,人和计算机之间的关系发生了一个很小、却很根本的变化:

过去,我们告诉软件每一步该做什么;现在,我们开始告诉 Agent 最后要完成什么。

从“一次回答”到“一项委派”

普通聊天 AI 的基本单位是一轮问答。

你问:“带孩子去成都,有哪些景点?”它给你一份名单。

你还要继续查天气、核对开放时间、比较酒店、估算路程,再把结果复制进表格。

Agent 的基本单位是一项委派。

你可以直接给它目标:一家三口去成都 5 天,孩子 8 岁;每天最多两个主要景点;预算多少;最后交付行程表、费用表和预订清单;只做研究,不要付款。

它会自己拆解任务,搜索信息,读取网页,整理数据,发现缺项后继续查找,最后交出一份成品。

OpenAI 在 2026 年的一份使用研究中,把这种变化概括为:知识工作的单位正在从单次互动,转向长时间、可委派的任务。[3]

这比“AI 更聪明了”更接近 Agent 的意义。

模型能力当然重要。但对普通人来说,更直接的变化是:你不必始终坐在对话框前,把一件工作手工拆成二十个问题。

它已经能干活,但还不是一个数字员工

科技公司喜欢把 Agent 称为“数字员工”或“超级员工”。这个比喻很容易传播,也很容易让人误判。

NeurIPS 2025 收录的一项研究构建了一家模拟软件公司,让 Agent 像普通员工一样浏览网页、写代码、运行程序、使用内部系统并与同事沟通。最强的参测 Agent,只能自主完成约 30% 的任务。简单任务已经可以自动完成,困难的长任务仍然经常失败。[3]

METR 研究团队使用“人类专家完成同一任务要花多久”衡量 Agent 的能力。他们的长期测量说明,Agent 能处理的任务正在快速变长;但任务越长,成功率仍然越低,超过 16 小时的测量目前甚至不足以可靠估计。[3]

Agent 的演示总是很惊艳,实际使用却没有那么整齐。

一次回答错了,人可以马上重问。一个 Agent 如果在第 3 步理解错目标,可能会带着这个错误继续做十几步,最后交出一份结构完整、方向却错了的成果。

Gartner 把大量只是给聊天机器人换名字、并没有真正行动能力的产品称为“agent washing”,并预计超过 40% 的企业 Agent 项目会在 2027 年底前取消,原因包括成本过高、价值不清和风险控制不足。需要说明,这是预测,不是已经发生的失败率。[3]

所以,我们既不能把 Agent 当成换皮聊天框,也不应把它当成可以独立负责的员工。

Agent 开始具备持续执行一段工作的能力,但它仍需要一个能定义目标、识别偏差并承担责任的人。

人的价值,不只是“更有创造力”

谈到 AI 与人的分工,很多文章最后都会说,人类应该保留创造力、同理心和战略思考。

这些词没有错,但太空了。

一个做了十几年编辑的人看到标题,会立刻感觉它“像广告”;一个有经验的销售看完方案,会察觉客户不会买单;一个经常带孩子旅行的家长,一眼就知道一天跑四个景点不现实。

他们未必能在第一时间把判断依据逐条列出来,却能识别结果是否对劲。

Michael Polanyi 用一句很短的话描述过这种现象:

We can know more than we can tell.[4]

我们知道的,比能完整说出来的更多。

这句话经常被误解为“经验无法传授”。Polanyi 更深的意思是,人的判断依赖许多被整合在一起的线索。我们关注的是整体结果,支撑判断的细节却常常退到了意识背景中。

就像熟练使用锤子时,人关注的是钉子有没有打正,而不是手掌每一处压力。

也因此,Agent 可能比传统自动化更适合普通人。

传统自动化要求你预先写出每一条规则。Agent 允许你先给目标、材料和样例,让它做出一个具体结果;你再指出哪里不对,它重新调整。人的经验不是一次性翻译成完整规则,而是在一次次判断和纠正中进入工作过程。

Agent 没有复制你的全部经验。它搭起了一个工作台,让那些难以预先说清的判断,可以落在具体结果上。

它也改变了人的注意力。

搜索、复制、排版、转换格式、操作软件,这些动作可以逐渐退到背景;人把注意力移到更重要的问题:我们到底想完成什么,哪个取舍更合适,什么结果才算真正完成。

但小白最危险的地方,也在这里

如果你对一件事完全不懂,你就很难发现 Agent 做错了什么。

哈佛商学院与 BCG 的实验发现,在 AI 能力范围内,使用 GPT-4 的顾问完成任务快约 25%,成果质量提高超过 40%;但在一道超出 AI 能力边界的复杂任务中,使用 AI 的参与者得到正确答案的概率反而下降了约 19%。[4]

AI 可以帮助新手快速接近熟练者,却也可能让新手更有信心地接受错误结果。

所以,我需要修正一句常见的建议:

不是“没用过 AI 的人应该直接把工作交给 Agent”,而是“应该把一件自己熟悉的工作交给 Agent”。

这两个说法只差几个字,风险完全不同。

熟悉,意味着你知道哪些材料可信,能看出结果有没有漏项,也知道什么地方必须由自己决定。

第一次使用 Agent,不要让它替你选股票、做医学判断,或者管理重要账号。

让它整理你参加过的会议,比较你了解的产品,把已有材料制作成演示稿,或者为一条你走过的旅行路线重新做方案。

你需要亲自体验的,不是 AI 有多神奇,而是自己能否把一项工作从头到尾委派出去。

中国的 Agent,已经走到哪一步了

截至 2026 年 8 月,国内 Agent 大致形成了三条路线:Kimi、千问等面向普通人的“办事型助手”,开始把研究、文档和生活服务连起来;Kimi Work、腾讯 WorkBuddy 等本地工作 Agent,可以在授权后处理电脑文件;阿里云百炼、WorkBuddy Enterprise 等企业平台,则把 Agent 接入知识库、业务系统和审批流程。[5]

中国 Agent 的优势不只在模型,而在于中文语境、本地服务、办公软件和超级应用之间的连接。但连接得越深,权限和责任问题也越突出。国家网信部门已经把安全、可靠、可信以及用户的最终决策权列为应用底线。[6]

因此,国内 Agent 已经从“能不能行动”,走到“怎样在真实环境里安全行动”;但距离不受监督的“数字员工”,仍然很远。

如果今天第一次使用 Agent

我不会给所有人推荐同一个产品,而会按任务来选。

如果你的需求是查资料、读文件并制作报告或演示稿,可以先从 Kimi Agent 这类通用产品开始;需要处理本地文件时,再尝试 Kimi Work 或腾讯 WorkBuddy,并从文件副本和最小权限开始。

企业用户则不应把消费级 Agent 直接接入核心业务。更合理的起点,是选择一个边界清楚、出错可撤回的流程,再配上知识库、权限控制、日志和人工审批。

产品会很快变化,不必长期纠结排行榜。第一次选择时,看五件事就够了:能否稳定访问,能否联网和读取文件,过程是否可查看,危险动作是否先询问,结果能否导出。

然后,用下面这套结构交代任务:

目标:最后要解决什么问题。

材料:允许使用哪些文件、网页和背景信息。

成品:最后交付文档、表格、演示稿还是清单。

边界:哪些动作不能做,哪些地方必须先问你。

标准:你准备用什么判断结果是否合格。

权限则按顺序逐步开放:先让它阅读和研究,再生成草稿;确认可靠后,才允许它修改文件或操作工具。付款、发送、公开发布和删除,继续保留人工确认。

今天的 Agent 还不值得盲目信任,但已经值得认真学习。

这种学习不是背下一百条提示词,也不是追着每一个新模型跑。

它更像学习怎样带一个新同事:目标要说清,材料要给够,过程能检查,错误要纠正,责任不能交出去。

近几年,计算机开始从执行明确指令,走向理解人给出的目标。

普通人的位置也随之改变:我们不再需要亲手完成每一个步骤,但必须更清楚自己要去哪里,以及什么结果值得接受。

这就是为什么,现在可以从 Agent 开始。

也正因为如此,我们不能把判断权一起交给它。

想把 AI 真正用起来?

如果你不想只停留在“会聊天”,欢迎加入 Starfox AI 学习社区

这里会持续拆解 AI 工具、Agent、自动化和真实项目,把复杂概念变成可以跟着完成的实践。

访问:https://study.starfoxai.cc

你最想先把哪一件熟悉的工作交给 Agent?欢迎在留言区告诉我。


主要资料

[1] NBER:Firm Data on AI(2026)

[2] Agent 发展脉络:Intelligent Agents(1995)、ReAct(2022)、Toolformer(2023)

[3] Agent 的使用与能力边界:OpenAI 使用研究、TheAgentCompany、METR、Gartner 预测

[4] 人与 AI 的判断边界:BCG 实验、Michael Polanyi The Tacit Dimension

[5] 中国 Agent 产品:Kimi、Kimi Work、千问、腾讯 WorkBuddy、阿里云百炼

[6] 国家互联网信息办公室:智能体规范应用与创新发展实施意见