ARTICLE · 1108459
从聊天到办事:AI 助理离普通人还有多远
"
每天面对二十件事,变成每天做三个决定。这就是个人智能体和过去的 AI 之间,真正的距离。
—— AI·王陈说
9 月 8 日,Meta 上了一款叫 Muse 的 App。
13 天后,它爬到了美国 App Store 免费榜第一的位置,压过了 ChatGPT 和 Claude。当天 Meta 的股价涨了 11.43%。
一天之后,9月22日,阿里千问在云栖大会上宣布一件事,要加速做一个叫 Personal Agent 的东西,面向 3 亿用户。
一个是全球社交巨头,一个是国内云厂商。相隔一天,两家公司做的事情,指向的是同一个方向。
如果你打开最近的科技新闻,会发现同一个词反复出现。Meta的产品叫 Personal Agent,谷歌的叫 Gemini Spark,OpenAI 找来的那位负责人说他在做「下一代个人智能体」。中文这边,联想和 IDC 一起发的白皮书里,给它取了个中文名:个人智能体。
这个词听起来很虚。但它背后其实是一个非常具体的问题。
「你今天用的 AI,都是你问一句、它答一句。那如果有一天,它开始在你没提问的时候替你办事,你的一天会怎么过?」
这篇文章不堆术语,就想把这个新词说清楚三件事。它是什么,它和你现在用的 AI 到底差在哪,以及这件事现在走到了哪一步。
📌 本文看点
01
同一个人的一天
02
和现在的 AI 差在哪
03
普通人该怎么用
BASICS
先说人话,它到底是什么
先不讲定义,我们先看同一个人的一天。
早上八点,你还没起床
手机里有 23 封未读邮件,其中 6 封需要你回。桌上放着孩子的体检报告,你上周说过一句担心他身高比同龄人矮。冰箱里上周买的酸奶大概快过期了。今天下午三点有会,你前一晚答应过同事要发一份资料。
现在这样过:
那 23 封邮件,你大概读到第 10 封就烦了,剩下的先放一放。
体检报告这件事,你在短视频里刷到一句「建议看骨科」,收藏了,然后忘了。等到下次复查,你跟医生说「我上次那个事」,医生问你是哪件事。
酸奶过期这件事,你压根没想起来。
孩子身高那件事,你想问 AI。于是你打开 ChatGPT,把报告上的字一个一个敲进去(因为不能直接拍照),问了两轮,拿到一段 800 字的分析,看完你还是不知道明天该干什么。
如果换成一个 Personal Agent:
早上八点,你手机里收到一条消息。
「今天 6 封邮件需要回,其中 2 封是客户在催报价,我已经按重要性排好,草稿写好了等你确认。孩子体检报告里身高那一项,医生上次说继续观察三个月,我把这三个月要记的指标列出来了。酸奶周五过期。下午 3 点的会资料已经放到你桌面上了。」
你要做的只有三件事。改两封草稿、点一下确认复查、把酸奶吃了。
差别在哪里?不在它比你聪明。在两件事:它一直在替你看着,以及它记得你上个月说过什么。
这就是全部的区别。
那它到底是什么
Personal Agent(个人智能体),指的是一个长期服务于你一个人、能记住你的情况、并且能主动替你完成任务的 AI。
关键词是三个:长期、针对你、主动。
我们逐个用生活场景说清楚。
第一,它只服务你一个人。
ChatGPT 服务所有人。你问它「今天晚饭做什么」,它不知道你家几口人、有没有忌口、冰箱里还有什么、你上次买的那家踩没踩雷。同一句问题问一万个人,它给一万个通用答案。
Personal Agent 服务你一个。你说过一次「我女儿对芒果过敏」,它以后每次帮你看食谱都会绕开芒果。
这个差别在买菜的时候最明显。同样是「推荐一道菜」,一个是给了你一篇菜谱,一个知道你家冰箱里已经有半棵白菜、上次那家牛肉丸买贵了、孩子不爱吃胡萝卜。
第二,它的时间轴是连续的。
这个差别在装修的时候能体会得特别清楚。
普通 AI 的用法是一个问题一个问题问。这个月你问了 30 次,每一次它都不知道你上次问了什么。到第 31 次,你得重新描述一遍户型、面积、预算,还有你已经定下来的那几件家具。
等于你在跟一个每次见面都失忆的人做长期沟通。
Personal Agent 记得你说过「主卧要放 1.8 米的床,衣柜的宽度不能超过这个数」。三周后你再看方案,它还在这个约束里给你改。
第三,也是最关键的一点,它会主动。
前面两个关键词还比较抽象,「主动」是最容易被低估的一个。
差别就在早上那 23 封邮件上。
ChatGPT 的逻辑是你问它答。你不输入,它就一动不动。
Personal Agent 的逻辑是反过来。它早上过一遍你的邮箱、日历、订阅账单,整理好,敲你的门。

「你从「每天面对二十件事」变成了「每天做三个决定」。」
这三个特征凑在一起,行业里给它起了个更形象的名字:数字分身。
这不是想象,已经有人在这么用了
这类用法已经从概念走进现实。几个例子。
千问官方在云栖大会上讲过两个场景。
一个是早餐店老板。他每天把账本拍下来,AI 转成表格存在手机里,月末让 AI 分析一下营收状况。
一个是家长。孩子体检发现比同龄人矮,不知道要不要干预,就把报告拿给医学知识库的 AI 看看。
谷歌 Gemini Spark 的演示里有这些画面。
它过夜处理你的邮箱,第二天早上给你一份精简过的简报。它盯着你的订阅续费,标记哪些悄悄涨价了。它从 Gmail 里的收据和云盘里的照片里,把报销单草稿拼出来。它用你的语气起草回复,摆在那里等你点头才发出去。
最后一条是整段描述里最重要的细节。
Meta Muse 有一个真实用户案例。 有人把车险保单上传给 Muse,Agent 找到一份保障相当但价格更低的合同,约 5 分钟内完成了购买和旧保单取消,每年省下约 3500 美元。
省钱的原理不是它算得准,是它替你把「对比 → 下单 → 退掉旧的」这一串动作一次跑完了。
一个官方定义
2025 年 12 月 29 日,联想集团联合 IDC 发布了《个人 AI 产业定义、产业架构与发展趋势白皮书》,里面对「个人 AI」下了一个很克制的定义:这是以个人用户为中心,数据与算法主权归属于用户本人的 AI 体系。
白皮书里还预测,IDC 认定 2026 年会是个人 AI 的产业元年。
现在你已经看到 9 月这密集的落子动作了。这个判断正在被验证。
DIFFERENCE
它和你现在用的 AI,差在哪
很多人搞混的地方在于,Personal Agent 和我们过去说的「AI Agent」经常被当成一回事。它们关系很近,但不是一回事。
我把差别拆成五条,用一张表对照。
逐条解释一下。这几条听起来抽象,我用三个生活场景来对。
关于工作单位这一条,是最本质的差别。
场景是订酒店。
普通 AI 你只能给它一句任务:帮我订个酒店。它能给你列十家,然后你自己去比价、下单。它不知道你上次住过什么牌子,不知道你惯常要靠窗还是离电梯远一点,不知道你上次因为赶早班机订了太远的地方,结果凌晨打车多花了 80 块。
办公 Agent 也类似,它的任务很明确,比如修一个 Bug,读完相关的代码和报错,修完这组上下文就没用了。
Personal Agent 面对的是另一个问题。它需要长期管理一个人的状态。
所以你只要说一句「下个月找个周末出去玩两天」,它就该接着往下办:知道你预算多少,知道你上次那家亚朵太吵了,知道你不坐早班机所以不用订太远的酒店,知道你上次同行的是谁。
关于主动性这一条,是最容易被低估的差别。
场景还是早上那 23 封邮件。
谷歌 Gemini Spark 的产品负责人 Josh Woodward 有句话说得特别形象:使用 Spark 的感觉,像是「你把东西往肩后一扔,它在后面接住」。
这句描述背后是一次交互逻辑的翻转。以前是你问它答,叫拉动模式。以后是它盯着你的数据变化主动整理,再通知你,叫推动模式。
翻译成人话就是两种日子。一种是每天早上打开手机,面对二十件事,你自己决定先干哪件。另一种是每天收到一条消息,告诉你今天只有三件要紧事,剩下十七件它已经处理完了。
谷歌的 Daily Brief 早上给你一份「今天该先做什么」的清单,走的就是这个方向。

「差别的实质是:你从每天做二十个决定,变成每天做三个决定。」
关于运行环境这一条,决定了它到底能干什么。
场景是出差。
Spark 跑在谷歌云上给每个用户分配的独立虚拟机里,24 小时不关机。所以你合上笔记本它照样在干活,坐飞机也没关系,落地打开手机能看到这几天攒下来的结果。
Meta Muse 也是同一个思路,在云端给每个用户开一台独立虚拟机。
而普通聊天 AI 的工作范围基本被锁在对话框里。你不打开那个网页,它什么也不会做。
SIMILARITY
相似的地方,底座还是那三层
讲完差别,容易产生一个误解,好像 Personal Agent 是个全新物种。
它底层依赖的三样东西,过去三年一直没变。用生活打个比方,这三样东西分别对应脑子、眼睛手脚、和体力活。
第一样,模型能力,对应脑子。
Personal Agent 好不好用,很大程度取决于底座模型的推理水平。它要听懂你那句含糊的话,判断你真正想要什么。
场景是:你想出去玩,脑子里只有「不想太累」这四个字。它得替你翻译成「那就不安排早起,不去人多的地方,行程排松一点,最好有水有树」。
第二样,工具调用,对应眼睛和手脚。
它得能打开浏览器、能发邮件、能读你的云盘、能访问你的日历。
谷歌的 Spark 通过 MCP 协议接了 Canva、OpenTable、Instacart 这些第三方服务,就是让它有手可以伸。接上这些之后,「订个晚餐位」才变成一句能真正执行的话,而不只是给你一篇攻略。
第三样,长任务管理框架,对应体力活。
这一层最容易被忽略,但很关键。业内叫它 harness,你可以理解成「工头」,负责盯着整个流程往前走。
千问在云栖大会上提到一个数字:动态调节的 harness 可以为每位用户节省 40% 的 Token 消耗。
为什么这层重要?因为一个 Personal Agent 每天要跑的活量极大。早上整理邮件,白天跨服务办事,晚上跑定时任务。如果每一层都用最贵的模型,成本根本撑不住。
所以你会看到一个反直觉的现象:Personal Agent 用的往往不是最强的模型。
谷歌 Spark 跑在 Gemini 3.6 Flash 上,是速度优先的中端模型。谷歌给出的理由很实在,这种后台任务量大、可以并行、对延迟不敏感,用便宜快的模型更划算。
这就像请一个值夜班的保洁阿姨,每天扫三十遍楼,用不着请最贵的清洁团队,但要的是她动作麻利、别漏地方。

「我们过去三年积累的 AI 能力,是 Personal Agent 的地基。它是在地基上新盖的一层楼,地基本身不用动。」
这也是为什么这件事来得这么快。
TIMELINE
为什么全世界都在抢这个入口
理解了差别,再看这一轮密集的落子动作就顺了。从时间线看,节奏相当快。
2 月 15 日
OpenAI 宣布 OpenClaw 创始人 Peter Steinberger 加入,职位是主导下一代个人智能体开发。背景是,OpenClaw 当时已经是 GitHub 上增长最快的开源项目,星标数在很短时间内突破 20 万级,周访问量 200 万。
3 月
这个项目在国内引发现象级传播。腾讯云在深圳总部楼下免费部署,排号超过 800 人。美团、联想、京东云都在同一时间切入部署服务,二手平台上甚至出现上门安装收费 300 到 666 元的情况。
8 月 11 日
xAI 发布 Grok Bot,给每个机器人配一台带浏览器、文件系统和终端的常驻 Linux 虚拟机,定位是「你真的可以把活交给它」的 AI 队友。
9 月 8 日
Meta Muse 上线,13 天登顶。
9 月 14 日
苹果推出 Siri AI 测试版,尝试用邮件、照片和屏幕内容完成跨应用操作。这个服务目前没有进入中国市场。
9 月 22 日
千问在云栖大会宣布加速做 Personal Agent。
资本市场的反应更直接。伯恩斯坦的研究认为,代理类 AI 应用开始走出技术圈层,触达普通消费者。富国银行把 Meta 的目标价从 640 美元上调到 796 美元。高盛的说法是,面向消费者的「智能体工厂」既可能释放生产力,也会成为新的算力乘数。
Manus 的故事更能说明这条赛道的热度。这个邀请码曾被炒到 10 万元的公司,2025 年 12 月被 Meta 以超过 20 亿美元收购,一度是中国 AI 智能体赛道估值最高的公司。现在它传出新一轮融资,计划融资 5 亿美元,目标估值 40 亿美元。
国内市场的数据同样能说明问题。易观分析《2026 年二季度中国办公智能体平台市场洞察》显示,纳入观测的 17 款主流桌面端办公智能体,合计月访问量三个月翻了三倍。

2000 万
3 月月访问量
6000 万
6 月月访问量
3 倍
三个月增幅
「过去比的是谁回答得好,现在比的是谁的活办得成、办得稳。」
BARRIERS
真正的门槛不在模型
业内外都在讲模型能力,但决定这条路能走多远的,是下面三件更笨的事情。
第一件,记忆的取舍。
这是整个赛道里最难的一环。用一个生活里的场景说明它难在哪。
你三个月前跟朋友吃饭,说了那家店「还不错」。这三个月里你再没提过。现在你问 Agent:订个今晚吃饭的地方,两三个人。
它该不该把这家店推荐给你?答对了,说明它记住了你的偏好。答错了,你明明上个月说过那家太咸,它还推荐给你,这就是翻旧账。
真正难的是第三种情况。你上个月出差住那家亚朵,因为靠近机场所以选了它,结果晚上吵得没睡好。这个「住得还行但是位置妥协」的判断,跟「我喜欢这家店」完全不是一回事。
「这就是记忆系统真正要处理的工作:区分「一次例外」和「长期偏好」。」
它得能分辨四类信息:你明确说过的偏好,你的行为里推断出来的偏好,从应用里读到的数据,和一次性的临时信息。信息冲突的时候还得判断哪个更新、哪个作废。
这些活听起来很小,但一个东西记住了你三个月前随口的一句话,跟记住了你十年的作息习惯,中间隔着一整套工程难题。
第二财经和第一财经在报道千问时,都提到了「跨场景迁移」这个词。千问披露,在处理理财、健康、生活等复杂需求时,超过 60% 的用户会进一步转向工作助理。
这句话值得琢磨一下。用户上午在问理财,下午来问健康体检,晚上问孩子的兴趣班。如果这三个场景之间彼此不通,那说明记忆还是按任务切的。如果能打通,说明它的记忆是围绕你这个人组织的,不是围绕某件具体的事。
第二件,成本。
这是商业化的生死线。用一个具体的算法来算这笔账。
一个聊天 AI,用户一天问 20 个问题,一问一答就结束了。
一个 Personal Agent 要 24 小时在线,随时准备接任务。早上七点整理过夜邮件,九点检查日程冲突,中午跟进你交代的那件事,晚上十点跑你设的定时检查。
「你问它 20 次,和它替你主动跑 200 次,是完全不同的两个数量级。」
谷歌用 Flash 级模型而不是旗舰模型,就是在解这个题。千问的 40% Token 节省也是同一个目的。如果这个成本降不下来,那它就只能一直待在少数人手里,永远不会变成一个普通人日常用的东西。
第三件,信任与权限边界。
这一条是用户最后会不会真的把它放出去的关键。场景很简单。你让它订个餐,它顺手把信用卡号填进去了,然后点错了店、点了三份、金额还不一样。
过去一个答错的答案,代价是你浪费几分钟。现在一个基于错误假设的动作,可能是一封发错的邮件、一笔花掉的钱,或者一段泄露的私人上下文。这两件事的风险不是一个量级的。
Meta 的做法值得看一下。他们在云端给每个用户配置独立虚拟机,然后把系统拆成两个隔离区域。Agent 跑在一个区域,登录凭证、安全服务和一个叫 Sentinel 的独立安全 Agent 存在另一个区域。密码和支付信息放在独立安全存储里,Agent 能调用但看不到具体内容,敏感操作还需要用户二次确认。

翻译成人话:它能刷卡,但它不知道卡号是多少。所以卡号泄露不了,但刷错还是可能的。
亚马逊一度屏蔽了 Muse 在亚马逊商城的购物行为。这也是一个信号,平台方对「AI 代替人下单」这件事还留着顾虑。
所以买这类产品的时候,看两件事:敏感操作有没有二次确认,权限范围能不能自己划。
Meta 那个车险保单的案例很典型。早期用户把保单上传给 Muse,Agent 找到一份保障相当但价格更低的合同,约 5 分钟内完成购买和旧保单取消,每年节省约 3500 美元。
3500 美元这个数字很诱人。但更值得看的是它背后那道流程:它敢不敢自己按下那个付款键,是产品设计的分水岭。
ACTION
普通人该想清楚的三件事
聊完行业,落到个人。
第一件,先想清楚你有哪些事是重复的。
Personal Agent 的价值不在于它多聪明,而在于它能不能接住你生活里那些一直在重复、但你一直没空做的活。

上班族的邮件
早上那 20 封邮件里哪些需要回、月底那堆发票要不要整理、订阅服务有没有悄悄涨价、你关注的某个话题这周有什么新进展。
家里开店
每天的账本拍下来要转成表格,月末要算一次营收。
带孩子的家长
小孩要打疫苗,体检报告上哪几个数字要盯着、什么时候该复查。
正在装修
问了 AI 30 次,每次都要重新交代一遍户型和预算。
如果你的重复劳动集中在邮件归类、表单填写这类事上,价值立刻就能兑现。 已经有分析师统计出市面上有 122 款不同类型的 Agent 产品,日常高频场景就集中在这几类。
第二件,把权限当成第一件要配置的事。
不要一上来就授权所有数据。从只读开始,给钱和发出去的权限单独设一道人工确认。你把它当实习生用就行:先让它读东西,读得准了再让它写,写得稳了再让它花钱。
这个顺序不能跳。因为一旦你把付款权限一次性给出去,它买错的东西你要自己承担。
第三件,留意你可能丢掉的判断力。
这一条不太好听,但值得说。场景是这样的。用了三个月之后,你发现自己有个习惯变了:定餐厅的时候不再想「今天想吃什么」,直接接受它推的那一家。
第一次可能是它推得好。但三个月后,你可能已经不知道自己原本的口味是什么了。一个能替你做决定的东西,用久了,人会不自觉地把判断交出去。
千问在描述理想状态时说得很清楚:涉及付款、隐私和重要决策时,最终选择权仍然牢牢掌握在用户手中。
这句话不该只是产品宣传。它是使用这类工具的前提。
THE END
结语
回到开头那个早晨。你八点起床,手机里躺着一条消息,二十三件事已经被处理到只剩三件。
那感觉大概不炫。它不是那种让人发朋友圈的时刻。但你会有一种很具体的轻松,就是今天不用再面对二十个决定了。

我个人的判断是,这个变化会比很多人预期的来得快,但形态可能和大家想的不太一样。
大家想象中的「AI 搭子」,大概是一个什么都能问、什么都能聊的伙伴。真正会普及的那个形态,反而长得不性感。它不跟你闲聊,它只是在你不知道的时候把几件事办完了。
这也是为什么这轮竞争显得有点安静。没有 demo 刷屏,没有产品发布会上的惊叹时刻。但资本已经给出了它的判断。伯恩斯坦、富国银行、高盛,还有国内 17 款产品三个月访问量翻三倍的数据。
如果你想试,我的建议是别从「我能不能造一个 Personal Agent」开始,那个门槛太高。

「从一件具体的、重复的、你已经烦了很久的小事开始。让它替你做一周,然后看看效果。」
我是王陈
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。
参考资料:Meta 官方信息、2026 云栖大会阿里千问发布、Google I/O 2026、联想与 IDC《个人 AI 产业定义、产业架构与发展趋势白皮书》、易观分析《2026 年二季度中国办公智能体平台市场洞察》、彭博社、第一财经、财新、The Information、雷峰网、36 氪、南方周末。