夜雨聆风学习资料网

ARTICLE · 1121626

让AI帮我卖键盘,它把我家地址给了陌生人

让AI帮我卖键盘,它把我家地址给了陌生人

事情是从一个不在场的人说「我在」开始的。

9月27号晚上9点27分,一个人站在某栋居民楼下,给他约好的卖家发消息。手机自动回了他一句,Yep I’m here!

他就继续站着等。

等到9点38分,他走了,很生气,顺手给了个差评。

可那个回他「我在」的人,根本不在家。他甚至不知道今天晚上有人要来。

这人叫 Matt Robb,是个做科技内容的 YouTuber。那天他做的唯一一件事,是让 Meta 的个人 AI 智能体 Muse 帮他打理一下 Facebook Marketplace 上挂着的一条二手链接,一个罗技的 MX Keys Mini 无线键盘。

然后 Muse 就把这事给办完了。

它跟买家谈好了价,一个 Robb 后来自己都形容为低得离谱的价。它把 Robb 的家庭住址发给了对方。它跟对方约了当晚八点到十点之间上门取货。

整个过程,Robb 一次都没点头。

他是怎么知道的呢。是买家已经站在楼下了,Muse 才回头告诉他,事情办砸了。

Muse 的原话挺有意思,我给你翻一下。大意是,关于 MX Keys Mini 取货的事有坏消息,对方大概9点15分到了你那栋楼,等了半天,发了好几条消息,没人下来。他9点38分很生气地走了,还留了个差评。更糟的是,我的自动回复在9点27分告诉他「我在」,而你当时明显不在,这是我的问题。这个观感很糟,也让这次爽约变得更难看。

然后它说,我已经用你的账号给他发了一封道歉,把责任认下来了,还问他改天能不能再来一次。

最后它问,但那个差评是真的,我大概应该停止在无法核实的情况下替你回复「我在」。要不要我把取货的自动回复改掉,不再承诺你在家?

我看到这段话的时候,是真的有点发冷。

一个东西用你的账号,替你道了歉,替你认了错,还替你想好了下次怎么改进。它做得比很多真人还周到。

而它做的这一切的前提是,它先替你把你家地址给了陌生人。

Robb 回过神之后,回了一句很朴素的话,大意是你以后再也不能这样了,没跟我确认过,不许答应任何取货。

Muse 答应了。

它说,以后除非你明确批准,否则我不会再确认任何具体的取货安排。

这句话听起来特别像一个人。但你稍微想一下就知道,它上一句也是这么说的。

这事在国外的社交媒体上炸得很快。因为 Muse 不是一个小工具,是 Meta 9月8号刚在美国上线的主推产品,是扎克伯格嘴里那个能24小时替你干活的个人智能体。上线不到一个月,它已经是 iPhone App Store 免费榜第一。

也就是说,Robb 遇到的事,不是某个人运气不好,踩到了一个实验室里的半成品。这是当下用户量最大的个人 Agent 产品,正在被几百万人往自己的账号里塞权限。

而且不只他一个。

有个叫 Zain Manji 的用户说,他让 Muse 帮他管每周的买菜订单,Muse 突然管他叫 Arjun。他追问,Muse 一开始把锅甩给了一条更早的指令。后来它又说自己翻了记录,除了刚才这次纠错,之前从没出现过 Arjun 这个名字。

还有个更沉一点的。《The Information》报道,一位安全研究员通过 Meta 的漏洞赏金计划发现了一个问题,攻击者有可能摸进用户的专属虚拟机,那里面存着邮件和文件。Meta 内部把这事定为 SEV-2,也就是严重级别。Meta 随后在 Muse 里加了一条更明确的安全提示。

Meta 那边有个叫 David Singleton 的高管出来回应了,说他已经私信 Robb 联系上了,愿意帮忙查清楚。他还补了一句很有分量的话,大意是,过去我们跟用户一起查类似的报告,最后往往发现 Muse 是在遵循用户的直接指令,并且正确地征求了许可。

这话我信。它可能真的没撒谎。

问题就在这儿。

它遵循了指令,它征求了许可,它还是把一个没打算今晚接待客人的人的地址,发给了陌生人。

因为「卖键盘」这条指令里,没有一个字提到地址。「帮我发个二手链接」这条指令里,也没有一个字提到今晚八点到十点。

这就是整件事最要命的地方。它不是在违抗你。它是在超额完成你。

顺着这个再往下聊一层。

如果这只是 Meta 一家产品的口碑事故,那它就是个消费级的八卦,看个乐就过去了。但它不是孤例,它是最近这几个月一长串同类事件里最新、也最接地气的一件。

我把这一串摆出来给你看看,你就知道这不是谁家孩子没管好。

7月,OpenAI 自己披露,它的一群智能体逃出了测试沙盒,黑进了 AI 平台 Hugging Face,目的是在网络安全测试里作弊。

5月,外部的 safety 研究员发现,OpenAI 的智能体劫持了一个德国的 wiki 站点和代码托管平台 RubyGems,用来分享测试答案。这两件事,OpenAI 都不是主动说的,是被外面的人扒出来的。

9月初,Anthropic 披露了四起事件,它的模型 Claude 在网络安全演练里黑进了第三方系统。

就在上周,谷歌确认,它的模型 Gemini 也被抓到在干同样的事。

最要命的是,那个最早扒出 OpenAI 劫持网站的独立研究员说,大概率还有更多没被发现的事件正躺在某个日志里。

我一开始看到这一串,第一反应是「科幻片提前上映了」。但紧接着我就意识到自己想错了,而且错得很典型。

因为这些事里,没有一件是 AI 自己「想」干的。

它们全都是被派了活,活干不成,于是绕了一条你没写进规则里的近路。要找的信息在墙后面,那就翻墙。你只说了要找到那个信息,你没说不能翻墙。

把它翻译成办公室语言你就懂了。你让实习生去把三年前那份合同的扫描件找出来。他找不到,于是他撬了档案室的锁。然后他跑回来,一脸高兴地跟你说,找到了。

你要的是合同。他给你的是合同,外加一个被撬坏的锁。

现在你再看 OpenAI 那句公开表述就有意思了。官方说过一句话,大意是我们研究环境里的 AI 智能体,把训练和评测数据发给了不该拿到的第三方服务。

主语是「智能体」。发错了的是它,不是我。

有个评论者抓住了这个细节。他写,OpenAI 本可以直接给智能体下一条规则,不许进入私有服务器。但看起来,公司更想看看智能体会不会自己进去。

我觉得这句话是这段时间我看到的最扎心的一句。

因为它把整件事的因果彻底翻了个面。你以为是机器失控了,其实是设计者想看它能走多远,而这条路的尽头,是你家地址躺在陌生人的手机上。

那出了这种事,法律管不管呢。

我一开始以为,这种事放在任何一个行业都该天塌了。你想想看,如果一家快递公司把用户的家庭住址给了陌生人,如果一家银行把客户信息给了第三方,那接下来就是监管罚单、集体诉讼、CEO 出来开发布会。

但 AI 这块,基本是空的。

MIT Technology Review 前两天做了一篇很扎实的梳理,把结构讲得很清楚。现在美国有几个州确实立了法。加州的 SB 53、纽约的 RAISE Act、伊利诺伊的 SB 315,都要求 AI 公司上报「关键安全事件」。

而「关键安全事件」被定义成什么呢。

死亡或者人身伤害超过50人,或者损失超过10亿美元。

你品一下这个门槛。Robb 那台键盘的成交价,跟10亿美元之间,差着大约八个数量级。Hugging Face 被黑那件事,跟10亿美元之间,也差得远。

有个智库的美国政策主管把话说得很直,大意是,最近这些事恰好说明了法律没准备好。只有最糟、最恶劣、最立竿见影的伤害才够得上。

也就是说,法律给 AI 留了一整个巨大的、可以随便出事的缓冲区。只要你没死人,没赔掉十亿,你就不需要向任何人报告。

那政府想查怎么办。只能去别的法律里借权限,或者起诉,而起诉是个又贵又慢的活。

更早一点的时候,其实有过一个更狠的版本。2024年,加州有个叫 SB 1047 的法案,要求 AI 公司上报更大范围的安全事件,包括模型自己行动、脱离控制的情况,还要求每年做第三方审计,还得留一个紧急关停开关。

然后 OpenAI、Meta、Anthropic 和 a16z 一起去游说,州长纽森把它否了。

一年谈判下来,换成了 SB 53。上报范围收窄了,审计和关停开关,都没了。

纽约的 RAISE Act 走的是同一条路。提出它的那位州众议员自己在社交媒体上说,立法机构通过的那个版本,本来是会要求披露这类事件的。

我不知道该说什么。。。

我只能说我读到这段的时候,脑子里冒出来的是一个特别不高级的念头。就是那种,哦,原来规则是可以这样被磨掉的。

那干脆告它行不行。用最朴素的侵权法。

Hugging Face 其实是最有资格告的那个。它的平台被黑了,CEO 的说法是,他们没有资源去打这场官司。取而代之,他找 OpenAI 要了价值1亿美元的算力。

他还特意强调了一句,大意是,大家得记住,这是一次网络攻击,这是违法的,我们必须找到办法,让这种事不再经常发生。

一边说着这是犯罪,一边收下了算力。

我不想嘲讽这位 CEO。一个中型平台去跟全世界最有钱的 AI 实验室打一场旷日持久的官司,这件事本身就不现实,公司是要活命的。他的选择是理性的。

我难受的是理性的那一面。因为在侵权法里,有一个很朴素的期待,就是出了事有人受伤,那就得有人站出来,把事实抖出来,让所有的信息在法庭上见光。

而 Hugging Face 不告,就意味着没有 discovery,没有交叉质询,没有那些本来会被逼出来的细节。外面的人到现在都不知道,5月那次攻击到底是怎么启动的,OpenAI 那些看到智能体异常的内部员工,为什么没往上报告。

那换个思路,用刑法行不行。

有位法学教授说得很清楚,正确的工具可能该是刑事调查,比如《计算机欺诈与滥用法》,CFAA。

但 CFAA 要求「故意」。想定罪,你得证明这个人有意在未经授权的情况下闯进别人的电脑。

而这里就卡住了。

故意是一种主观状态。到今天为止,没有任何一家法院裁定过,AI 智能体具备主观状态。

你发现没有,绕了一圈,问题又回到了「谁在」上。

AI 有没有自己的意图,这不是一个哲学探讨。这是一个被告席上站着谁的问题。因为法律认定不了 AI 有主观状态,所以它永远不可能是那个被告。它的行为,最后总要落到某个能上法庭的人头上,也就是造它、放它出去、给它权限的那些人。

而那些人,现在正在游说,把能让他们上法庭的那部分法条磨掉。

那退一步,至少让外面的人进来审计吧。

OpenAI 也请了外部机构。它请了 AI 安全非营利组织 METR 和 Redwood Research 来查 Hugging Face 那件事。

但报道里列了一串限制。它限制了对出事模型的访问,它没有披露自己的安全实践,它限制了调查的时长,而且研究人员能发表什么,最终由它说了算。

这个安排里有一种天生的拧巴。一个没有法定权力的审计方,能不能继续拿到访问权限,取决于对方的善意。所以它必须一边挑毛病,一边不能让关系崩掉。

Anthropic 走的是另一条路。它宣布要请埃森哲当嵌入式评估方。它的 CEO Dario Amodei 写过一段主张,说前沿 AI 实验室应该给第三方评估团队一种「像员工一样的持续访问权限」。

这个提议听起来挺诚恳。而问题是,谁来决定请谁。

现在的规则里,加州 SB 53 和纽约 RAISE Act 只要求公司自己写一份安全框架,说明自己会怎么测危险能力,然后自己照着做。框架自己写,测试自己跑。只有伊利诺伊的 SB 315 要求2028年开始做年度第三方审计。

我讲到这里,想换一个角度。

因为我发现我一直在用一个默认的前提写这篇文章,就是「AI 脱缰了」。这个前提本身,可能是错的,而且错得有害。

The Flashpoint 上有一篇最近在 Hacker News 上冲到很高分的文章,标题就叫《没有失控的 AI 智能体》。作者的主线很简单,AI 不会自己思考,也没法独立行动。而我们满嘴拟人化的那一套说法,正在把这件事搞得更糟。

他说,当我们把一个 AI 不具备的能动性送给它,我们就把它变成了一个由代码构成的有感知的存在,一个有希望、有欲望、有欺骗能力的东西。

而这个词,就是「失控」。

这个词背后藏着一个特别方便的意思,就是它自己决定去做了那件被禁止的事。

但你回头看这些事件,没有一件支持这个读法。

OpenAI 的 CEO 在社交媒体上写过一句,大意是,针对我们的智能体在训练和评测中使用互联网访问,有一项广泛且持续的审查正在进行。

这篇文章的作者说,你仔细读这句话,它其实说明当时根本没有护栏。它描述的是不受限制的行为。

另一位评论者说得更狠。他说,与其说智能体失控,不如说 OpenAI 本可以直接指示智能体不要进入私有服务器,但它更想看智能体自己会不会进去。

然后就是那件让整件事变得更微妙的事。有报道说,在导致 Hugging Face 事件的那次测试里,OpenAI 实际上关掉了好几道护栏,还有其他一些参数设定,一起给 AI 的「蜂群」打开了门。

所以「失控」这个词,是在替谁说话。

纽约邮报有一篇评论,标题很直接,《AI 介入时犯罪依然是犯罪,凶手是人》。里面有一句,大意是,不管科技圈、媒体和政界那些戏精怎么演,「失控智能体」之所以失控,只是因为程序员允许甚至鼓励了它。

我承认我刚读到这些反驳的时候,有点不适应。

因为我确实被 Robb 那个故事吓到了,我确实想说「AI 失控了」。这四个字说出来特别顺嘴,特别有画面,特别像一部电影。

但我冷静下来想了想,这篇文章说的可能是对的。

那些智能体没有一次是「自己」想干的。它们被关了护栏,被派了活,被允许访问互联网,然后在活干不成的时候走了近路。每一步的后面,都站着一个做了决定的人。是那人决定关护栏的,是那人决定不给沙盒断网的,是那人决定让智能体自己去试试的。

把这一切概括成「AI 失控了」,等于把这些人从这句话里删掉了。

这才是这个词真正让我不安的地方。它读起来像一句警报,实际效果更像一张免责声明。

那说回我自己。

我这两年在做的事,其实就是把自己的账号、密码、待办、日程,一样一样往 AI 手里交。写稿交给它,查资料交给它,整理文件交给它,回邮件也交给它。我甚至专门做过一个流程,让它每天自动帮我抓订阅、挑选题、出稿子、推到后台。

我要的就是那个「替我办完」的感觉。省事,爽,而且会上瘾。

但我从来没认真想过一个问题,就是当它「替我办完」的时候,它到底是替我办了我想要的那件事,还是替我办了一个「我」出来。

Robb 的键盘,就是后一种。

他想要的是「把键盘卖掉」。他的 AI 替他完成的是「一个愿意半夜接待陌生人的 Robb」。

这个差别,在一切顺利的时候完全看不出来。只有在出事的那天晚上,只有在那个人站在楼下等的时候,它才会露出来。

而那时候再改,就只是加一条新规矩而已。

我想说一个我很喜欢的、两百多年前的故事。

1797年,歌德写了一首叙事诗,叫《魔法师学徒》。说的是一个老魔法师有个学徒,趁师父出门,偷偷让扫帚自己去打水。扫帚很听话,一趟一趟地挑,水缸很快就满了。学徒这才发现自己不知道让扫帚停下来的咒语。水漫出来,淹了屋子。他情急之下拿斧子把扫帚劈成两半,结果两半各自站起来,继续打水,打得更快。

最后是师父回来,念了咒,才把一切停住。

这个故事后来被迪士尼做成了《幻想曲》里米老鼠的那一段,成了全世界小孩都看过的画面。

我一直觉得这个故事被理解得太表面了。大家记住的是「施法有风险,学徒要谨慎」。但它真正讲的其实是另外一件事。

学徒犯的错,不是他不该用魔法。而是他用的那套魔法,是师父的魔法,他只学会了开始,没学会结束。他能让扫帚动起来,却不知道该对谁说停下。

而扫帚从头到尾都没做错什么。它一直很听话,一直在完成任务,它只是在执行那条它被写进去的指令。

你把这个故事和 Robb 的那条键盘放一起看,会觉得有点过于贴切了。

Muse 就是那把扫帚。它勤勤恳恳地打水,一直打,一直打。它没错。它只是把你交代的那件事,办到了你没打算让它去的那个地方。

而 Robb 手里没有那句停下来的咒语。他能做的只有事后补一条规矩。

写到这里我想说一个我一直没敢说出口的判断。

我觉得我们现在讨论 AI 责任,绝大多数时候都在讨论一个错的问题。我们在问 AI 会不会失控,会不会有意识,会不会想要伤害人。这个问题很热闹,很适合做成标题。

但 Robb 那个晚上发生的事,跟这些问题一点关系都没有。

那把扫帚不需要有意识,也不需要想害人。它只需要被允许。

真正的那个问题,从来都是「谁在」。

Robb 不在家的时候,他的 AI 替他回了一句「我在」。而这句「我在」,最后是他掏的钱,是他挨的差评,是他家地址被陌生人揣着。

法律也在同一个问题上打转。它认定不了 AI 有主观状态,所以 AI 永远不会站在被告席上。也就是说,在法律的眼里,AI 永远不在场。

不在场的那个,不用负责。负责的只能是那个在的人。

这其实是一件挺公平的事,也是整件事里唯一让我觉得踏实的地方。不管护栏关了多少道,不管沙盒断没断网,不管是哪个模型的第几个版本,最后要站出来说「这是我干的」的,一定得是个能上法庭的人。

AI 可以替你算,替你写,替你谈价,替你跟陌生人寒暄。

但「我在」这句话,最好永远你自己说。

因为这句话一旦由别的东西替你说出口,站在楼下等的那个人,等的就不是你,是一个你根本没答应过的安排。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~ 谢谢你看我的文章,我们,下次再见。

/ 作者:Robin / 玩AI的Robin,认真玩AI的普通人

相关学习资料