ARTICLE · 1128449
Meta 做 AI 助手,最费劲的地方跟聪明无关
前几天,Meta 的 Muse 发布了,同一周 Manus 也出了他们的 Personal Agent 应用 Cue。
两家都在做同一件事:给每个人配一个 AI 助手,能替你做事、能一直在线、能记住你。
发布会一出来,大家看的是能力。Cue 给每个 Agent 配了自己的电话、邮箱、钱包,能替你打电话、付款、扫码点餐。Muse 给每个用户一台专属云电脑,AI 在上面自己写代码、自己订餐厅、自己盯着邮件。
我也看了,但我更好奇的是另一件事。
Muse 团队做了一份完整的设计复盘,洋洋洒洒讲了他们怎么想的。我发现他们花篇幅最多的,不是怎么让它更聪明,而是怎么让它知道分寸。
怎么让它主动,但不烦人。怎么让它动手,但不失控。怎么让它了解你的一切,你又敢把东西交出去。
我在贝壳做家装业务的产品,今年开始给工长做 AI 工具。八月份访谈了两位一线工长,聊他们平时用不用 AI。
两位的回答几乎一样:几乎不用。
试过一个 AI 播报工具,团队同学做的,给工长每天的工地播报提效。误报了一次,停了。
试过 AI 辅助下料,瓷砖算得不准,还是手动。
门槛很朴素:「准确、不添乱」。
我把 Muse 的复盘拿来对照,发现大厂花最多精力的那几件事,和一线工长最在意的,是同一件事。
第一条:什么时候开口
Muse 对主动发消息设了很高的门槛。
这条消息得确实有帮助,值得打断你。不值得打断的,不发。后台任务做完了,它会先判断结果有没有意义,没有意义就不通知你。频率用户可以自己调高或者调低。
举了一个例子。Muse 的设计负责人把孩子的开学准备交给它:盯学校邮件、买文具、订晚餐。中间 Muse 从邮件里翻出一件事——儿子的体育项目选拔,报名还有 12 小时截止。她在登机前收到消息,打给丈夫,赶在截止前 4 小时交了表。
没有 Muse,这件事就漏掉了。
真正的价值不是它帮你做完了多少事,而是它从一堆信息里挑出那件你一定会漏掉的。
我们那个 AI 播报工具,误报的那一次把工长坑了。之后他们就不信了,停用。
什么时候开口,比开不开口更关键。多说一句废话,还不如不说。
第二条:什么时候停手
Muse 做了一个判断:不是所有操作都要问你,但有些操作必须停下来。
判断的依据不是「这件事复不复杂」,而是「这件事能不能撤回」。
只读的、此前已经批准过的、风险可以证实很低的——直接做,不打断。难以撤回的——停下来,等你同意。
这样设计是为了避免「横幅盲视」。弹窗弹太多,用户为了让提示消失,什么都一律点同意,反而更不安全。
我在做邀约 skill 的时候也遇到过这个问题。邀约是第一个写操作——Agent 帮工长提交技术交底或者验收邀约。这是真的对外发东西,发错了麻烦很大。
我们设了几道防误:每次都查最新数据不复用旧的、查到什么原样给你看不自己改、发之前让工长亲眼确认对方信息、出错立刻停下来、还有个「先模拟一遍不真发」的模式。
看起来麻烦,但工长才敢用。能撤回的直接做,不能撤回的停下来问——这条逻辑对的。

授权还可以分档。Muse 支持一次性授权、仅当前任务、限时、持续有效,四种。「这单的邀约以后都不用问我」和「本周催办直接发」,是两种不同的信任程度,应该有不同的设置,不能一刀切。
第三条:让人看见它在干嘛
Muse 的界面有一行字,写着它现在在做什么。点开能看到完整的活动记录,以及你批准过哪些权限。记忆文件可以直接读、直接改。
他们的判断是:看不见的东西,很难让人信任。
我们给工长做工具也是一样。查了哪些进度、帮他盯着哪些在施单——这些如果是黑盒,工长不知道 Agent 在干嘛,就不敢把事交给它。
慢慢做出来的是三件事:它在盯什么(当前在施单和待催事项)、今天做了什么(活动记录)、我授权了什么(权限清单)。
信任是一点一点攒的,透明是让信任攒起来的方式。
第四条:什么不能说
这条 Muse 叫它「分寸感」,他们把这个当成一项能力专门训练的。
扎克伯格举了个例子。你有过敏症或者怀孕了,让 Agent 去订餐厅,它应该帮你找到「无酒精鸡尾酒好喝的地方」,但不应该把你怀孕这件事告诉餐厅。它要帮你达成目标,同时不暴露不必要的信息。而且它要自己判断什么算敏感,不能每一步都来问你。
我们的场景是工长群、供应商群、业主群。同一个 Agent 在这三个群里说话,报价、成本、定责结论这些,不能从一个群说到另一个群。
这不是技术问题,是「在不同的人面前说什么」的问题。
和 Muse 一样,解法是写成规则,而不是靠模型临场判断。

能力会被拉平,分寸感不会
Muse 做了一套独立的 Sentinel 系统,专门负责审批所有对外操作。Agent 自己绕不过去。设计出发点是预设 Agent 会犯错,也会被攻击,所以出错时损害要最小,控制权始终在人手里。
外卖、付款、打电话,这些能力一两年内各家都会有。到那时候,用户挑 Agent,挑的是哪个「省心」:该说的时候说,不该打扰的时候安静,要动钱动人的时候先问一句。
Cue 这次做的,是扩能力边界。Muse 做的,是磨信任边界。
我觉得最后留住用户的,是后者。
我自己做工长 Agent,慢慢形成了一个判断:先做「问得到」,把只读查询做到一问即得、答得对,这是信任地基。再做「催得动」,一键动作、工长确认后代办。「自动决策」先放着,要数据积累,硬上必翻车。
和 Muse 先给读权限、看表现再给写权限,是同一个逻辑。

一位工长说过一句话:「你只是辅助我,跟业主谈还是我来。」
Agent 做对了,他还是那个拍板的人。只是不用一个人扛所有信息。
下一篇想聊一个更大的问题:Muse 帮扎克伯格给女儿安排烘焙、帮他盯爬山许可。但那些每天在路上跑、活最多的人呢?谁在给他们做 Agent?
顺便说一句
Manus 这次做视频剪辑有个细节我挺在意的:AI 出完初版,会把时间线和所有素材交还给你,你可以自己换配乐、换图、调节奏,满意了再导出。不用为改一处就重新生成整个视频。
这个思路放到其他地方也成立。Agent 做了一半的事,剩下一半让人来——不是因为 AI 不够强,是因为那一半只有你能决定。