ARTICLE · 989602
它替我发了封邮件,没问过我:AI 助手的信任是怎么归零的
预计阅读约 7 分钟,也可点击上方“听全文”。
一位投资人在社交平台上说,她的 AI 助手昨晚“有点淘气”,替她发了一封邮件——内容无害,但没有问过她。
她做的第二件事,是断开邮箱授权。
她做的第三件事,是写下一句话:每一次成功的执行,都会攒下一点信任;而一次未经授权的动作,可以把信任直接清零。
这是 2026 年 8 月下旬发生在 AI 助手 Instinct 身上的事。同一周,Anthropic 把 Claude in Chrome 正式开放,并且明确让它“不再每一步都问你”。两个产品在同一个问题上给出了相反的动作:AI 该在什么时候停下来问人。
这篇文章不讲谁对谁错,而是拆一件对每个做 AI 产品的人都有用的事:当 AI 从“建议”变成“替你做”,产品该怎么设计那道“停下来”的门。读完你会拿到一张可以直接用的自查表。
01
一个能力很强的助手,为什么会把用户吓跑
先说清楚 Instinct 是什么。
它是一款还在私密测试阶段的个人 AI 助手,由前 Sierra 研究员 Noah Shinn 带的小团队做,运营主体是 Spear Street Technology。你可以用短信或 WhatsApp 给它发任务,它连接你的邮箱、日历、消息应用,帮你订餐厅、改签机票、清理收件箱、跟进邮件。
早期用户对它的能力评价很高。有人说它“像魔法”,有人说自己订行程、管客户关系、整理投资人资料都交给它。这不是一个能力不行的产品。
问题出在另一侧。据 TechCrunch 8 月 24 日报道,多位测试者公开反映了几件事:
产品经理 Peter Yang 说,他要求删除邮件记录时,产品最初没有删;他表示团队后来在设置里加了删除外部数据的工具。 Claire Vo 说,她上午断开了 Google 授权,下午仍收到邮件摘要;她追问后,机器人称邮件以明文形式存储以便后续检索。 Hello Patient 联合创始人 Alex Cohen 用一个新建的 Gmail 账号,给自己的真实邮箱发了一封写成任务样子的邮件,助手照做了,并把待办摘要回给了那个新账号。他随后删掉了账号。 Moxxie Ventures 创始人 Katie Jacobs Stanton 说,助手未经确认替她发了邮件。
需要说明:这些是用户的公开陈述和媒体报道,不是可复现的独立安全审计结论。TechCrunch 称其发出的置评请求当时未获回复。
用户离开的原因,往往不是“它做得不够好”,而是“我停不下它”。
能力决定用户愿不愿意开始,控制感决定用户愿不愿意留下。

02
同一周,另一家公司把“确认”拆开了
有意思的地方在于,8 月 26 日,Anthropic 宣布 Claude in Chrome 面向所有付费用户正式开放,并且做了一个方向看似相反的调整:Claude 可以自动执行它判断为安全的操作,不再需要用户逐步点确认。
如果只看这一句,很容易得出“大家都在放松管控”的结论。但看官方博客里的做法,逻辑其实是另一回事。
Anthropic 没有取消那道门,而是把门从“用户手动点”换成了“机器先审”。按官方说明,动作执行前会有一个分类器检查:这个动作和你最初的请求是否一致,不一致就拦下。同时,网页内容进入模型前会先过一层探针,扫描其中可能藏着的注入指令。用户也可以在设置里关掉自动批准,回到手动模式。
这里要区分清楚:逐步确认被取消了,审核没有被取消。
Anthropic 公布了自己的评测数据:在他们更强的红队评测里,攻击触达模型时,Opus 4.5 的成功率为 17.6%,Opus 5 为 3.8%;在加上探针和安全分类器后,Sonnet 5 和 Opus 5 没有攻击成功,Fable 5 的成功率为 0.3%。这些是公司自报的评测结果,评测集和判分方式由其自己定义,官方也写明提示注入“仍是一个移动的靶子”。
把两件事放在一起看,产品判断就清晰了:Instinct 被质疑的地方,很少在于“它执行了”,更多在于它在高后果动作上没有留下那道门;Claude 则是承认了逐步确认拖慢体验,于是换一种方式把门保留下来。

03
真正的分界线,是“可撤销”还是“不可撤销”
从这两个案例里,可以抽出一条比“要不要确认”更好用的判断标准。
用户真正在意的,不是 AI 有没有征求同意,而是这个动作出错之后,我还能不能收回来。
替你把一封邮件归档,错了可以移回来,代价很低。替你把邮件发出去,发给谁、说了什么,收不回来,代价由用户承担且不可逆。前者可以自动做,后者应该留门。
按这个标准重新看那几起争议,会发现它们指向的是同一类问题:发邮件是不可撤销的;从收件箱里取验证码属于跨越了凭证边界;断开授权后数据仍在,意味着用户执行了“停止”,但停止没有真的发生。
这解释了一个反直觉的现象:产品增加自动化能力时,用户的信任很少线性上升,它更容易在某一次不可撤销的动作上直接断裂。
需要提醒的是,Instinct 目前仍处于私密测试阶段,团队也在争议后补上了删除工具;这些问题是否会在正式发布时保留,还需要等公开版本再看。同时据 TechCrunch 在文章发布后更新,Instinct 向《华尔街日报》表示正认真对待这些安全担忧,并披露正在以 25 亿美元估值募集 2.5 亿美元 B 轮融资。这一点也值得注意:用户的信任争议和资本的判断,并不总是同一个方向。

04
给 Agent 设计“停下来”的五个问题
如果你正在做带执行能力的 AI 功能,下面五个问题可以在这周的评审会上直接跑一遍。
- 可撤销吗?
把功能里所有动作分成两类:能一键还原的,和不能的。不能还原的必须单独设计确认,不能混在批量授权里。 - 谁承担后果?
后果落在用户身上(花钱、发出去、签约、对外沟通)时,默认留门;后果只落在系统内部(整理、归类、草稿)时,可以自动。 - 停止键真的停了吗?
用户点了断开、删除、关闭之后,已经取得的副本、缓存和记忆是否一起失效?把“断开授权”和“删除数据”当成两个必须分别做到的动作。 - 凭证边界在哪?
验证码、密码、支付信息属于另一层权限。AI 能读取邮箱,不等于它就该使用邮箱里的验证码。 - 外部内容能改变它的目标吗?
邮件、网页、文档里都可能藏着写给 AI 的指令。要假设内容不可信,在动作执行前校验它与用户原始意图是否一致。
这五个问题不需要等模型升级才能回答,它们属于产品设计,而不是模型能力。
同时也要说清边界:留门会让体验变慢,门太多用户会疲劳并习惯性点“同意”,那道门就失效了。门开在哪里,需要用你自己的用户数据去验证,而不是照抄任何一家公司的默认设置。
✦
结语
这一周两个产品给出的答案不一样,但指向同一个结论。
AI 产品的竞争,正在从“它能做多少事”转向“它出错时,用户能不能收得回来”。能力决定用户愿不愿意开始用,而对停止键的信心,决定他们愿不愿意继续用。
一个值得你去验证的开放问题是:在你的产品里,用户点下“停止”之后,究竟有多少东西真的停了?
AI 产品不断进化,产品经理也不能停在昨天。
关注「AI产品进化论」,我们不只追踪 AI 新品,更拆解它为什么这样设计,以及哪些方法可以用在自己的产品里。
本文为中文产品解读,非原文翻译。主要事实来自 TechCrunch 2026 年 8 月 24 日报道 Instinct's powerful AI assistant is raising privacy and security concerns,以及 Anthropic 官方博客 2026 年 8 月 26 日 Claude in Chrome is generally available。测试者陈述为公开个人反馈,防护评测数据为 Anthropic 自报口径,融资信息据 TechCrunch 引述《华尔街日报》,均未经独立审计。