夜雨聆风学习资料网

ARTICLE · 1108459

从聊天到办事:AI 助理离普通人还有多远

从聊天到办事:AI 助理离普通人还有多远

"

每天面对二十件事,变成每天做三个决定。这就是个人智能体和过去的 AI 之间,真正的距离。

—— AI·王陈说

9 月 8 日,Meta 上了一款叫 Muse 的 App。

13 天后,它爬到了美国 App Store 免费榜第一的位置,压过了 ChatGPT 和 Claude。当天 Meta 的股价涨了 11.43%。

一天之后,9月22日,阿里千问在云栖大会上宣布一件事,要加速做一个叫 Personal Agent 的东西,面向 3 亿用户。

一个是全球社交巨头,一个是国内云厂商。相隔一天,两家公司做的事情,指向的是同一个方向。

如果你打开最近的科技新闻,会发现同一个词反复出现。Meta的产品叫 Personal Agent,谷歌的叫 Gemini Spark,OpenAI 找来的那位负责人说他在做「下一代个人智能体」。中文这边,联想和 IDC 一起发的白皮书里,给它取了个中文名:个人智能体。

这个词听起来很虚。但它背后其实是一个非常具体的问题。

「你今天用的 AI,都是你问一句、它答一句。那如果有一天,它开始在你没提问的时候替你办事,你的一天会怎么过?」

这篇文章不堆术语,就想把这个新词说清楚三件事。它是什么,它和你现在用的 AI 到底差在哪,以及这件事现在走到了哪一步。

📌 本文看点

01

同一个人的一天

02

和现在的 AI 差在哪

03

普通人该怎么用

01

BASICS

先说人话,它到底是什么

先不讲定义,我们先看同一个人的一天。

早上八点,你还没起床

手机里有 23 封未读邮件,其中 6 封需要你回。桌上放着孩子的体检报告,你上周说过一句担心他身高比同龄人矮。冰箱里上周买的酸奶大概快过期了。今天下午三点有会,你前一晚答应过同事要发一份资料。

现在这样过:

那 23 封邮件,你大概读到第 10 封就烦了,剩下的先放一放。

体检报告这件事,你在短视频里刷到一句「建议看骨科」,收藏了,然后忘了。等到下次复查,你跟医生说「我上次那个事」,医生问你是哪件事。

酸奶过期这件事,你压根没想起来。

孩子身高那件事,你想问 AI。于是你打开 ChatGPT,把报告上的字一个一个敲进去(因为不能直接拍照),问了两轮,拿到一段 800 字的分析,看完你还是不知道明天该干什么。

如果换成一个 Personal Agent:

早上八点,你手机里收到一条消息。

「今天 6 封邮件需要回,其中 2 封是客户在催报价,我已经按重要性排好,草稿写好了等你确认。孩子体检报告里身高那一项,医生上次说继续观察三个月,我把这三个月要记的指标列出来了。酸奶周五过期。下午 3 点的会资料已经放到你桌面上了。」

你要做的只有三件事。改两封草稿、点一下确认复查、把酸奶吃了。

差别在哪里?不在它比你聪明。在两件事:它一直在替你看着,以及它记得你上个月说过什么。

这就是全部的区别。

那它到底是什么

Personal Agent(个人智能体),指的是一个长期服务于你一个人、能记住你的情况、并且能主动替你完成任务的 AI。

关键词是三个:长期、针对你、主动。

我们逐个用生活场景说清楚。

第一,它只服务你一个人。

ChatGPT 服务所有人。你问它「今天晚饭做什么」,它不知道你家几口人、有没有忌口、冰箱里还有什么、你上次买的那家踩没踩雷。同一句问题问一万个人,它给一万个通用答案。

Personal Agent 服务你一个。你说过一次「我女儿对芒果过敏」,它以后每次帮你看食谱都会绕开芒果。

这个差别在买菜的时候最明显。同样是「推荐一道菜」,一个是给了你一篇菜谱,一个知道你家冰箱里已经有半棵白菜、上次那家牛肉丸买贵了、孩子不爱吃胡萝卜。

第二,它的时间轴是连续的。

这个差别在装修的时候能体会得特别清楚。

普通 AI 的用法是一个问题一个问题问。这个月你问了 30 次,每一次它都不知道你上次问了什么。到第 31 次,你得重新描述一遍户型、面积、预算,还有你已经定下来的那几件家具。

等于你在跟一个每次见面都失忆的人做长期沟通。

Personal Agent 记得你说过「主卧要放 1.8 米的床,衣柜的宽度不能超过这个数」。三周后你再看方案,它还在这个约束里给你改。

第三,也是最关键的一点,它会主动。

前面两个关键词还比较抽象,「主动」是最容易被低估的一个。

差别就在早上那 23 封邮件上。

ChatGPT 的逻辑是你问它答。你不输入,它就一动不动。

Personal Agent 的逻辑是反过来。它早上过一遍你的邮箱、日历、订阅账单,整理好,敲你的门。

「你从「每天面对二十件事」变成了「每天做三个决定」。」

这三个特征凑在一起,行业里给它起了个更形象的名字:数字分身。

这不是想象,已经有人在这么用了

这类用法已经从概念走进现实。几个例子。

千问官方在云栖大会上讲过两个场景。

一个是早餐店老板。他每天把账本拍下来,AI 转成表格存在手机里,月末让 AI 分析一下营收状况。

一个是家长。孩子体检发现比同龄人矮,不知道要不要干预,就把报告拿给医学知识库的 AI 看看。

谷歌 Gemini Spark 的演示里有这些画面。

它过夜处理你的邮箱,第二天早上给你一份精简过的简报。它盯着你的订阅续费,标记哪些悄悄涨价了。它从 Gmail 里的收据和云盘里的照片里,把报销单草稿拼出来。它用你的语气起草回复,摆在那里等你点头才发出去。

最后一条是整段描述里最重要的细节。

Meta Muse 有一个真实用户案例。 有人把车险保单上传给 Muse,Agent 找到一份保障相当但价格更低的合同,约 5 分钟内完成了购买和旧保单取消,每年省下约 3500 美元。

省钱的原理不是它算得准,是它替你把「对比 → 下单 → 退掉旧的」这一串动作一次跑完了。

一个官方定义

2025 年 12 月 29 日,联想集团联合 IDC 发布了《个人 AI 产业定义、产业架构与发展趋势白皮书》,里面对「个人 AI」下了一个很克制的定义:这是以个人用户为中心,数据与算法主权归属于用户本人的 AI 体系。

白皮书里还预测,IDC 认定 2026 年会是个人 AI 的产业元年。

现在你已经看到 9 月这密集的落子动作了。这个判断正在被验证。

02

DIFFERENCE

它和你现在用的 AI,差在哪

很多人搞混的地方在于,Personal Agent 和我们过去说的「AI Agent」经常被当成一回事。它们关系很近,但不是一回事。

我把差别拆成五条,用一张表对照。

维度
普通 AI
办公 Agent
个人智能体
服务对象
所有人
团队或项目
你一个人
记忆时长
单次会话
一段任务周期
长期跨场景
工作单位
一个问题
一个明确任务
一类持续事务
主动性
你不问它不动
等你派活
到点自己动
运行环境
云端对话框
代码库终端
云端常驻

逐条解释一下。这几条听起来抽象,我用三个生活场景来对。

关于工作单位这一条,是最本质的差别。

场景是订酒店。

普通 AI 你只能给它一句任务:帮我订个酒店。它能给你列十家,然后你自己去比价、下单。它不知道你上次住过什么牌子,不知道你惯常要靠窗还是离电梯远一点,不知道你上次因为赶早班机订了太远的地方,结果凌晨打车多花了 80 块。

办公 Agent 也类似,它的任务很明确,比如修一个 Bug,读完相关的代码和报错,修完这组上下文就没用了。

Personal Agent 面对的是另一个问题。它需要长期管理一个人的状态。

所以你只要说一句「下个月找个周末出去玩两天」,它就该接着往下办:知道你预算多少,知道你上次那家亚朵太吵了,知道你不坐早班机所以不用订太远的酒店,知道你上次同行的是谁。

关于主动性这一条,是最容易被低估的差别。

场景还是早上那 23 封邮件。

谷歌 Gemini Spark 的产品负责人 Josh Woodward 有句话说得特别形象:使用 Spark 的感觉,像是「你把东西往肩后一扔,它在后面接住」。

这句描述背后是一次交互逻辑的翻转。以前是你问它答,叫拉动模式。以后是它盯着你的数据变化主动整理,再通知你,叫推动模式。

翻译成人话就是两种日子。一种是每天早上打开手机,面对二十件事,你自己决定先干哪件。另一种是每天收到一条消息,告诉你今天只有三件要紧事,剩下十七件它已经处理完了。

谷歌的 Daily Brief 早上给你一份「今天该先做什么」的清单,走的就是这个方向。

「差别的实质是:你从每天做二十个决定,变成每天做三个决定。」

关于运行环境这一条,决定了它到底能干什么。

场景是出差。

Spark 跑在谷歌云上给每个用户分配的独立虚拟机里,24 小时不关机。所以你合上笔记本它照样在干活,坐飞机也没关系,落地打开手机能看到这几天攒下来的结果。

Meta Muse 也是同一个思路,在云端给每个用户开一台独立虚拟机。

而普通聊天 AI 的工作范围基本被锁在对话框里。你不打开那个网页,它什么也不会做。

03

SIMILARITY

相似的地方,底座还是那三层

讲完差别,容易产生一个误解,好像 Personal Agent 是个全新物种。

它底层依赖的三样东西,过去三年一直没变。用生活打个比方,这三样东西分别对应脑子、眼睛手脚、和体力活。

第一样,模型能力,对应脑子。

Personal Agent 好不好用,很大程度取决于底座模型的推理水平。它要听懂你那句含糊的话,判断你真正想要什么。

场景是:你想出去玩,脑子里只有「不想太累」这四个字。它得替你翻译成「那就不安排早起,不去人多的地方,行程排松一点,最好有水有树」。

第二样,工具调用,对应眼睛和手脚。

它得能打开浏览器、能发邮件、能读你的云盘、能访问你的日历。

谷歌的 Spark 通过 MCP 协议接了 Canva、OpenTable、Instacart 这些第三方服务,就是让它有手可以伸。接上这些之后,「订个晚餐位」才变成一句能真正执行的话,而不只是给你一篇攻略。

第三样,长任务管理框架,对应体力活。

这一层最容易被忽略,但很关键。业内叫它 harness,你可以理解成「工头」,负责盯着整个流程往前走。

千问在云栖大会上提到一个数字:动态调节的 harness 可以为每位用户节省 40% 的 Token 消耗。

为什么这层重要?因为一个 Personal Agent 每天要跑的活量极大。早上整理邮件,白天跨服务办事,晚上跑定时任务。如果每一层都用最贵的模型,成本根本撑不住。

所以你会看到一个反直觉的现象:Personal Agent 用的往往不是最强的模型。

谷歌 Spark 跑在 Gemini 3.6 Flash 上,是速度优先的中端模型。谷歌给出的理由很实在,这种后台任务量大、可以并行、对延迟不敏感,用便宜快的模型更划算。

这就像请一个值夜班的保洁阿姨,每天扫三十遍楼,用不着请最贵的清洁团队,但要的是她动作麻利、别漏地方。

「我们过去三年积累的 AI 能力,是 Personal Agent 的地基。它是在地基上新盖的一层楼,地基本身不用动。」

这也是为什么这件事来得这么快。

04

TIMELINE

为什么全世界都在抢这个入口

理解了差别,再看这一轮密集的落子动作就顺了。从时间线看,节奏相当快。

2 月 15 日

OpenAI 宣布 OpenClaw 创始人 Peter Steinberger 加入,职位是主导下一代个人智能体开发。背景是,OpenClaw 当时已经是 GitHub 上增长最快的开源项目,星标数在很短时间内突破 20 万级,周访问量 200 万。

3 月

这个项目在国内引发现象级传播。腾讯云在深圳总部楼下免费部署,排号超过 800 人。美团、联想、京东云都在同一时间切入部署服务,二手平台上甚至出现上门安装收费 300 到 666 元的情况。

8 月 11 日

xAI 发布 Grok Bot,给每个机器人配一台带浏览器、文件系统和终端的常驻 Linux 虚拟机,定位是「你真的可以把活交给它」的 AI 队友。

9 月 8 日

Meta Muse 上线,13 天登顶。

9 月 14 日

苹果推出 Siri AI 测试版,尝试用邮件、照片和屏幕内容完成跨应用操作。这个服务目前没有进入中国市场。

9 月 22 日

千问在云栖大会宣布加速做 Personal Agent。

资本市场的反应更直接。伯恩斯坦的研究认为,代理类 AI 应用开始走出技术圈层,触达普通消费者。富国银行把 Meta 的目标价从 640 美元上调到 796 美元。高盛的说法是,面向消费者的「智能体工厂」既可能释放生产力,也会成为新的算力乘数。

Manus 的故事更能说明这条赛道的热度。这个邀请码曾被炒到 10 万元的公司,2025 年 12 月被 Meta 以超过 20 亿美元收购,一度是中国 AI 智能体赛道估值最高的公司。现在它传出新一轮融资,计划融资 5 亿美元,目标估值 40 亿美元。

国内市场的数据同样能说明问题。易观分析《2026 年二季度中国办公智能体平台市场洞察》显示,纳入观测的 17 款主流桌面端办公智能体,合计月访问量三个月翻了三倍。

2000 万

3 月月访问量

6000 万

6 月月访问量

3 倍

三个月增幅

「过去比的是谁回答得好,现在比的是谁的活办得成、办得稳。」

05

BARRIERS

真正的门槛不在模型

业内外都在讲模型能力,但决定这条路能走多远的,是下面三件更笨的事情。

第一件,记忆的取舍。

这是整个赛道里最难的一环。用一个生活里的场景说明它难在哪。

你三个月前跟朋友吃饭,说了那家店「还不错」。这三个月里你再没提过。现在你问 Agent:订个今晚吃饭的地方,两三个人。

它该不该把这家店推荐给你?答对了,说明它记住了你的偏好。答错了,你明明上个月说过那家太咸,它还推荐给你,这就是翻旧账。

真正难的是第三种情况。你上个月出差住那家亚朵,因为靠近机场所以选了它,结果晚上吵得没睡好。这个「住得还行但是位置妥协」的判断,跟「我喜欢这家店」完全不是一回事。

「这就是记忆系统真正要处理的工作:区分「一次例外」和「长期偏好」。」

它得能分辨四类信息:你明确说过的偏好,你的行为里推断出来的偏好,从应用里读到的数据,和一次性的临时信息。信息冲突的时候还得判断哪个更新、哪个作废。

这些活听起来很小,但一个东西记住了你三个月前随口的一句话,跟记住了你十年的作息习惯,中间隔着一整套工程难题。

第二财经和第一财经在报道千问时,都提到了「跨场景迁移」这个词。千问披露,在处理理财、健康、生活等复杂需求时,超过 60% 的用户会进一步转向工作助理。

这句话值得琢磨一下。用户上午在问理财,下午来问健康体检,晚上问孩子的兴趣班。如果这三个场景之间彼此不通,那说明记忆还是按任务切的。如果能打通,说明它的记忆是围绕你这个人组织的,不是围绕某件具体的事。

第二件,成本。

这是商业化的生死线。用一个具体的算法来算这笔账。

一个聊天 AI,用户一天问 20 个问题,一问一答就结束了。

一个 Personal Agent 要 24 小时在线,随时准备接任务。早上七点整理过夜邮件,九点检查日程冲突,中午跟进你交代的那件事,晚上十点跑你设的定时检查。

「你问它 20 次,和它替你主动跑 200 次,是完全不同的两个数量级。」

谷歌用 Flash 级模型而不是旗舰模型,就是在解这个题。千问的 40% Token 节省也是同一个目的。如果这个成本降不下来,那它就只能一直待在少数人手里,永远不会变成一个普通人日常用的东西。

第三件,信任与权限边界。

这一条是用户最后会不会真的把它放出去的关键。场景很简单。你让它订个餐,它顺手把信用卡号填进去了,然后点错了店、点了三份、金额还不一样。

过去一个答错的答案,代价是你浪费几分钟。现在一个基于错误假设的动作,可能是一封发错的邮件、一笔花掉的钱,或者一段泄露的私人上下文。这两件事的风险不是一个量级的。

Meta 的做法值得看一下。他们在云端给每个用户配置独立虚拟机,然后把系统拆成两个隔离区域。Agent 跑在一个区域,登录凭证、安全服务和一个叫 Sentinel 的独立安全 Agent 存在另一个区域。密码和支付信息放在独立安全存储里,Agent 能调用但看不到具体内容,敏感操作还需要用户二次确认。

翻译成人话:它能刷卡,但它不知道卡号是多少。所以卡号泄露不了,但刷错还是可能的。

亚马逊一度屏蔽了 Muse 在亚马逊商城的购物行为。这也是一个信号,平台方对「AI 代替人下单」这件事还留着顾虑。

所以买这类产品的时候,看两件事:敏感操作有没有二次确认,权限范围能不能自己划。

Meta 那个车险保单的案例很典型。早期用户把保单上传给 Muse,Agent 找到一份保障相当但价格更低的合同,约 5 分钟内完成购买和旧保单取消,每年节省约 3500 美元。

3500 美元这个数字很诱人。但更值得看的是它背后那道流程:它敢不敢自己按下那个付款键,是产品设计的分水岭。

06

ACTION

普通人该想清楚的三件事

聊完行业,落到个人。

第一件,先想清楚你有哪些事是重复的。

Personal Agent 的价值不在于它多聪明,而在于它能不能接住你生活里那些一直在重复、但你一直没空做的活。

上班族的邮件

早上那 20 封邮件里哪些需要回、月底那堆发票要不要整理、订阅服务有没有悄悄涨价、你关注的某个话题这周有什么新进展。

家里开店

每天的账本拍下来要转成表格,月末要算一次营收。

带孩子的家长

小孩要打疫苗,体检报告上哪几个数字要盯着、什么时候该复查。

正在装修

问了 AI 30 次,每次都要重新交代一遍户型和预算。

如果你的重复劳动集中在邮件归类、表单填写这类事上,价值立刻就能兑现。 已经有分析师统计出市面上有 122 款不同类型的 Agent 产品,日常高频场景就集中在这几类。

第二件,把权限当成第一件要配置的事。

不要一上来就授权所有数据。从只读开始,给钱和发出去的权限单独设一道人工确认。你把它当实习生用就行:先让它读东西,读得准了再让它写,写得稳了再让它花钱。

这个顺序不能跳。因为一旦你把付款权限一次性给出去,它买错的东西你要自己承担。

第三件,留意你可能丢掉的判断力。

这一条不太好听,但值得说。场景是这样的。用了三个月之后,你发现自己有个习惯变了:定餐厅的时候不再想「今天想吃什么」,直接接受它推的那一家。

第一次可能是它推得好。但三个月后,你可能已经不知道自己原本的口味是什么了。一个能替你做决定的东西,用久了,人会不自觉地把判断交出去。

千问在描述理想状态时说得很清楚:涉及付款、隐私和重要决策时,最终选择权仍然牢牢掌握在用户手中。

这句话不该只是产品宣传。它是使用这类工具的前提。

∞

THE END

结语

回到开头那个早晨。你八点起床,手机里躺着一条消息,二十三件事已经被处理到只剩三件。

那感觉大概不炫。它不是那种让人发朋友圈的时刻。但你会有一种很具体的轻松,就是今天不用再面对二十个决定了。

我个人的判断是,这个变化会比很多人预期的来得快,但形态可能和大家想的不太一样。

大家想象中的「AI 搭子」,大概是一个什么都能问、什么都能聊的伙伴。真正会普及的那个形态,反而长得不性感。它不跟你闲聊,它只是在你不知道的时候把几件事办完了。

这也是为什么这轮竞争显得有点安静。没有 demo 刷屏,没有产品发布会上的惊叹时刻。但资本已经给出了它的判断。伯恩斯坦、富国银行、高盛,还有国内 17 款产品三个月访问量翻三倍的数据。

如果你想试,我的建议是别从「我能不能造一个 Personal Agent」开始,那个门槛太高。

「从一件具体的、重复的、你已经烦了很久的小事开始。让它替你做一周,然后看看效果。」

END

我是王陈

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

参考资料:Meta 官方信息、2026 云栖大会阿里千问发布、Google I/O 2026、联想与 IDC《个人 AI 产业定义、产业架构与发展趋势白皮书》、易观分析《2026 年二季度中国办公智能体平台市场洞察》、彭博社、第一财经、财新、The Information、雷峰网、36 氪、南方周末。

相关学习资料