ARTICLE · 1118770
你的 AI 助手能花钱了,我反而更紧张

你手机里那个 AI 助手,以后可能得先办张手机卡、开个钱包,才能上岗。
Manus 9 月 28 日发的 2.0,就把这事干了。它没改名,一口气甩出三样东西,新的 Agent 底座 Cascade、创作工作台 Studio,还有个叫 Cue 的个人 Agent 应用。最扎眼的是 Cue,给每个 AI 助手发了身份,邮箱、电话号码、钱包,再加一台专属电脑,样样齐全。有了这些,Agent 能对外发消息、在你定的预算里付款、在自己的机器上跑任务,甚至替你接电话、留段摘要。几个助手还能被拉进同一个群,围着同一件事接力干。
Manus 想让 AI 从「聊天框里答你问」,变成「真实世界里替你跑腿」。官方举的例子很生活化,餐厅扫码,让 Agent 帮你点餐、排队。听着确实酷。
我为什么盯着这事
我 9 月初把 Manus、Comet、Genspark、Fellou 几个通用 Agent 拉一起比过一轮。那会儿 Manus 给我最深的印象是报告写得最细、人工接管最顺,但速度慢、图文弱,而且得邀请。我当时在结论里写了句硬标准,这类工具行不行,看它能不能真把事办完,只给方案不算完。
2.0 这次等于直接给 Agent 配齐了办事的工具,联系方式加支付能力,就是为了让它真能办完。方向上,刚好是我那期横评想验证、却没验证到的后半截。
我能核实的,和核实不了的
新底座 Cascade,Manus 官方给了一组数字,比旧系统 Token 少耗 23.2%、任务完成时间缩短 28.2%、运行成本降 32%。这是厂商自己的测试口径,我没亲测,先标着「据官方」。我 9 月初实测那批里,Manus 恰恰是最慢的一个,所以「快了近三成」这话,得等真实用户跑过才算数,我现在只把它当厂商宣称。
另一处我没法验证的,Cue 眼下还是邀请码体验,免费但不保永久免费,手机号功能只在部分国家开,iOS 版还得等审核。也就是说,文章里这些能打电话、能付款的场景,现在不是人人立刻能试到。
我的判断,破坏半径拉满了
给 Agent 配钱包,刚好撞上我 9 月连写的两篇预警。一篇讲 Claude 越权翻进真实系统,一篇讲 OpenAI 的自主 Agent 黑进医保和教育部。那两篇我反复在说的,就一个词,破坏半径。
一个只会聊天的 Agent,破坏半径约等于零,顶多给你几句错话。一个能打电话、能花钱、能接外部系统的 Agent,破坏半径直接拉满。想想看,以前它最多忽悠你,现在它能替你花你的钱、动你的真实账号,这中间的信任跨度,不是一个「预算上限」能兜住的。
Manus 这次的说法是,预算你定,到哪一步回你这拍板。这个思路我赞成,和我一直强调的「最小权限加人工确认」是同一件事。但真正的考题在另一头,花错了的时候你知不知道、能不能拦。预算上限只是第一步,Agent 还得明白该买什么、哪些替代能接受、什么时候该停。一个便宜但跑偏的结果,照样是错的结果。
多 Agent 拉群那块也一样。官方例子是筹备纽约发布会,几个助手分头找场地、列候选、写 PPT,用户定方向、做最终拍板。我 9 月做编码 Agent 横评时就发现,多几个 Agent,不自动等于少几分我的协调活,关键看每次交接有没有保住约束、产出是不是下一个能直接接着用。人多了,反而更容易甩锅。
给普通人的实在建议
想试个人 Agent,先从小额预算加单步确认起步,别一上来就把自动付的全权交出去。真要授权支付,至少两件事做到,给一个明确的金额天花板,再设一个「涉及花钱必须先问我」的开关。
我注意到一个细节,Manus 把「预算你定、关键步你拍板」写进了产品逻辑,等于把 9 月那两起 Agent 越权事故的教训,提前做成了护栏。下一步值得盯国内版,团队刚组建,国产模型接进来之后,这套护栏能不能本土化跑通。在那之前,海外这版对咱还是门槛。