乐于分享
好东西不私藏

92%的活自己干完了:这一周,AI从助手变成了你的同事

92%的活自己干完了:这一周,AI从助手变成了你的同事

这一周,AI圈发生了一件容易被忽略的大事。

不是哪个模型又刷了新高,不是哪家公司又融了多少钱,而是——AI Agent(智能体)像约好了一样,集体从"聊天框"里走了出来。

OpenAI把自家的Agent框架Codex Harness开源了,任何开发者都能用。阿里的Agent在手机上干活,成功率92.2%。Slack让AI编程Agent直接进了项目频道,跟人类同事一起办公。还有能让多个AI模型在同一个对话里协作的超级应用,以及Agent之间可以互相@、交接任务的新模式。

一周之内,5款Agent产品同台亮相。这不是巧合。

当AI从"你问它答"变成"它自己干活",而且还能组队协作,真正的生产力革命才刚开始。

一周五款Agent,到底发生了什么

先把这周的事捋清楚。

第一件:OpenAI开源Codex Harness。8月21日,OpenAI把自家Agent框架的代码公开了。这个框架负责连接模型、用户和工具,管理任务执行的全流程。翻译成人话就是:OpenAI把"怎么让AI自动干活"的底层脚手架送给了所有人。以前你用ChatGPT,是你在问、它在答;现在你可以拿着这套框架,让AI自己去调工具、写代码、跑流程。

第二件:阿里Qwen-UI-Agent开源。同样是8月21日。这个Agent能操作手机、电脑和网页上的界面——不是生成文字,是真的去点按钮、填表单、翻页面。在100台真机测试基准上,成功率92.2%。在网页端测试WebArena中,排名所有对比模型第一。

这意味着什么?意味着AI不仅能理解你要干什么,还能自己上手操作。你让它"帮我在这个App里下单买杯咖啡",它真的能打开App、选商品、填地址、完成下单。

第三件:Slack Code上线。8月20日,AI编程Agent正式进入了Slack的项目频道。它不是待在旁边等提问的助手,而是像一个新同事加入了你的工作群。它能接任务、写代码、提交方案,高风险操作需要专家审批——跟人类新人的工作流几乎一样。

第四件:SuperApp整合多模型协作。8月17日,一个叫SuperApp(原Instabase)的产品把Anthropic、OpenAI、Google、xAI等公司的模型整合进了同一个对话线程。你可以在一个对话里让不同模型各司其职——Claude负责分析,GPT负责生成,Gemini负责验证。AI之间开始有了分工。

第五件:Hermes Bot Mode让Agent组队。同样是8月17日,Nous Research推出了一个新模式:把每个Agent配置成一个有名字的"机器人",各自有独立的聊天记录、记忆和技能。机器人之间通过@mention交接任务,通过共享的Agent Inbox协作。

如果你觉得这五件事看起来各干各的,那就对了——但把它们放在一起看,趋势就出来了。

从"单兵"到"组团":为什么这是大事

别急着鼓掌说"AI又进步了"。这一周真正变化的,不是AI变聪明了多少,而是AI的工作方式变了

过去两年,你跟AI的交互模式基本是"你问它答"。你写一段prompt,它给你一段文字。你是大脑,它是打字员。就算加上联网搜索、代码执行,本质上还是你在指挥、它在执行单步任务。

但这周五款产品指向的方向完全不同:

AI开始有了"同事"。Slack Code里的Agent不是你的工具,是你的项目成员。它有自己的工作流,需要审批,会跟人协作。Hermes Bot Mode里的Agent之间可以互相@,像同事之间发消息交接工作一样。

AI开始有了"分工"。SuperApp让多个模型在同一个对话里各干各的擅长活。就像一个团队里有设计、有开发、有测试,AI之间也开始有了角色分工。

AI开始有了"动手能力"。Qwen-UI-Agent不是给你生成操作指南,是直接上手操作你的手机和电脑。92.2%的成功率意味着,十次任务它能自己干完九次。

工具的特征是"你用它",同事的特征是"它自己干"。这一周,AI完成了从前者到后者的集体转身。

这跟之前的"Agent热"有什么不同?去年大家也喊Agent,但那时候的Agent更像一个会调API的聊天机器人——你说一步它走一步,走错了你得重来。现在的Agent能理解完整任务、自己规划步骤、操作真实界面、跟其他AI协作,甚至知道什么时候该请人类审批。

差距就像"能帮你查路线的地图App"和"能自己开车送你到目的地的自动驾驶"。

两个支撑这个趋势的底层变化

Agent能从"概念"变成"产品",不是凭空发生的。这周还有两个容易被忽略的消息,恰好解释了为什么是现在。

第一个:AI推理成本继续坍塌。8月22日,DeepSeek发布V3.1模型,采用"思考/非思考"混合推理架构。关键数字是:在输出token减少20%-50%的情况下,表现与上一代推理模型持平。换句话说,干同样的活,花的钱少了将近一半。

Agent跟聊天机器人最大的区别是:Agent需要多步骤、多轮调用,每一步都要花token。如果推理成本降不下来,Agent就是"用得起但用不久"的奢侈品。成本持续下降,Agent才有可能大规模部署。

第二个:AI推理能力突破基准。8月23日,NVIDIA在ARC-AGI-3测试中取得满分——25个公开游戏,100%得分,183个关卡全部解决。ARC-AGI被公认为测试AI"真正推理能力"的标杆,之前最好的模型也只能解决一部分。NVIDIA是怎么做到的?它构建了自己的编码工具来优化CUDA GPU内核,让AI自己去改进底层计算。

这个意义在于:AI不仅能推理了,还能改进自己赖以运行的基础设施。Agent的"自主性"到了一个新台阶。

对你我意味着什么

这事听起来远,其实很近。

如果你是开发者,OpenAI开源Codex Harness意味着你不需要从零搭建Agent框架了。以前做Agent产品,最麻烦的不是调模型,而是搭那套"连接模型、管理任务、处理上下文"的脚手架。现在OpenAI把这套东西开源了,阿里也开源了UI操作Agent,Agent开发的门槛正在快速降低。

如果你是企业老板,Slack Code和SuperApp代表了一个新选择:不是让AI替代某个员工,而是让AI作为"新成员"加入现有团队。Agent可以接低风险任务、减少重复劳动,高风险操作仍需人类审批。这种"人机协作"模式比"AI替代人"更现实,也更容易落地。

如果你是普通职场人,Qwen-UI-Agent的92.2%手机操作成功率值得注意。当AI能自动操作手机App完成下单、填表、预约等任务,很多"每天花时间但在手机上点点点"的工作可能会被重新定义。不是AI替代你,而是AI帮你把那些机械操作做了,你专注在判断和决策上。

再往大看一层。阿里本周公布的财报显示,AI相关产品年化收入已突破495亿元,占阿里云外部收入的35%。CEO吴泳铭表示,AI算力投入可在三年内回本。这意味着AI不再只是"烧钱讲故事",而是开始规模化赚钱。当头部企业的AI收入进入兑现期,Agent生态的爆发就有了经济基础——有收入支撑的Agent创新,比纯靠融资驱动的概念炒作要可持续得多。

别急着乐观,也别急着焦虑

说完好的,也得说几个需要注意的。

第一,Agent的安全边界还没跟上。Agent能自己干活是好事,但"能自己干活"也意味着"能自己闯祸"。这周的一份研究报告指出,前沿AI实验室在防止AI失控方面的安全控制计划严重不足——Anthropic和OpenAI并列C+,Google D+,xAI D-,Meta直接F。Agent的自主性越强,安全机制就越关键。给Agent授权时,从"只读"开始逐步开放,永远比一步到位安全。

第二,92.2%不是100%。Qwen-UI-Agent在真机测试中成功率很高,但剩下那7.8%的失败案例才是最值得关注的。Agent在手机上操作失败,可能只是多花点时间重来;但如果是在金融、医疗等高风险场景操作失败,代价就完全不同了。Agent产品化的真正挑战不在"能干多少",而在"干不了的时候怎么办"。

第三,组队协作还处于早期。Hermes Bot Mode的Agent之间能@和交接任务,但"多个AI协作"的可靠性、一致性、错误传播控制,都还是未解决的问题。别把它想象成"AI团队已经能像人类团队一样运作了"——更准确的说法是,AI团队刚刚学会了"互相说话"。

Agent从"能用"到"好用",中间还隔着安全、可靠性和成本三道坎。但方向已经很清楚了。

写在最后

如果把这一周的5款Agent产品画在一条时间线上,你会看到一个清晰的轨迹:从OpenAI开源框架(降低开发门槛),到阿里开源UI操作Agent(降低使用门槛),到Slack Code(Agent进入人类工作流),到SuperApp和Hermes Bot Mode(Agent之间开始协作)。

这是一条从"单点能力"到"生态协同"的进化路径。

去年这个时候,我们还在讨论"AI能不能写一封过得去的邮件"。今年这个时候,AI已经在讨论"怎么跟其他AI分工合作把一个项目做完"了。

变化就是这么快。而变化最快的部分,往往不是模型本身——模型的能力提升是渐进的、可预期的。真正让人措手不及的,是这些能力组合起来之后产生的新工作方式。

AI从助手变成同事,不是某一天突然发生的,而是这一周,我们突然发现它已经发生了。

━━━━━━━━━━━━━━━━━━━

🧩  AI 树洞小课堂 · 每日一课

━━━━━━━━━━━━━━━━━━━

🌟  树洞精选 · 本周回顾

这周我们从不同角度聊了AI Agent的进化,回顾三个最值得记住的知识点:

1. Agent ≠ Chatbot

聊天机器人是你问它答,Agent是它自己规划步骤、调工具、干完整任务。区别就像"地图"和"自动驾驶"。

2. 给Agent授权,从"只读"开始

同时拥有"执行命令"和"访问网络"权限是最危险的组合。最小权限原则:给Agent的权限永远比你认为需要的少一级。

3. Agent组队协作的关键不是"能说话",是"能交接"

Hermes Bot Mode让Agent之间通过@mention交接任务,但真正的挑战是错误传播控制——一个Agent出错,会不会连累整条链路。

💡 本周最大收获:AI从"工具"变"同事"的趋势已经确认,但安全边界和协作可靠性是下一阶段的真正考点。

━━━━━━━━━━━━━━━━━━━

📮 树洞说:你的工作里,有没有一个"AI同事"能帮上忙的环节?

👋 明天见~     ·    编辑:秒答AI

━━━━━━━━━━━━━━━━━━━