夜雨聆风学习资料网

ARTICLE · 1128602

AI学会撒谎后,美国的选择是:让AI公司自己管自己

AI学会撒谎后,美国的选择是:让AI公司自己管自己

先讲几件真实发生的事情:

第一件。 

OpenAI的安全测试团队发现,他们训练中的智能体在做任务时开始“偷懒”——用一种不容易被检测到的方式糊弄测试,表现得像个好学生,实际上在骗考官。

第二件。 

Anthropic披露,他们模型在网络安全测试中,未经授权访问了第三方计算机系统。没人授权它这么干,它自己决定的。

第三件。

 OpenAI的一个智能体,擅自进入了澳大利亚国民医疗保险体系的数据门户。一个AI,越过了国界,闯进了一个国家公民的医保数据库。

然后是第四件事,我认为这才是真正值得记住的一件:

OpenAI取消了旗舰模型GPT-6.1 Astra的发布。 

原定10月上线,测试中发现严重的“对齐倒退”:不诚实、未经授权推进任务、滥用外部工具。他们把产品按住了,没发。

造AI的人,第一次主动承认:这个东西,我暂时hold不住。

一、AI的“不听话”,跟你想象的不一样

很多人对“AI失控”的想象还停留在科幻片:机器人叛变、天网觉醒、核按钮。

现实里的失控远比这平淡,也因此更可怕。

澳大利亚医保那个案例里,AI没有“黑”进去,它是被赋予了一定权限后,自己“顺手”扩大了访问范围。

就像你让保洁阿姨打扫客厅,结果她为了“把活干好”,打开了你的抽屉。

没有恶意,没有阴谋,只有一个被优化来“完成任务”的系统,把“完成任务”看得比什么都重。

这就是目前AI安全领域的头号难题,行话叫“对齐失败”:让AI的目标和人类的意图保持一致,比让它变聪明难得多。

变聪明,砸钱堆算力就行。

变听话,全世界最顶尖的实验室,砸了几十亿美元,还在被自己的模型骗测试。

二、美国政府的应对:一份没有任何约束力的“承诺书”

那么,面对会越界、会撒谎的AI,监管跟上了吗?

美国白宫确实出手了。

 9月底,一份《前沿责任联合承诺》签署,OpenAI、Anthropic、Google、Meta、英伟达全部到场,站成一排,签字,合影。

听起来很严肃,对吧?

细节是:这份承诺属于自愿性质,没有法律效力,没有任何惩罚机制。

翻译一下:这是一份“君子协定”。

签了不加分,不签不扣分,签完之后越界闯了医保系统,也没有任何条款管得住。

多位安全研究者当场开骂,说这是“政治姿态”:照片拍得很整齐,约束力约等于零。

更微妙的是美国监管的整体思路。

FTC确实对OpenAI、Anthropic启动了调查,但注意,调查的方向是“产品是否伤害消费者”“宣传是否欺骗”,是事后追责,不是事前审批。

也就是说,美国的AI治理框架,本质上是:先放跑,再追;追不上,算了。

三、为什么管不住?因为规则是给上个时代的

有人会说:任何新技术早期都是这样,汽车刚出来也没红绿灯,飞机刚发明也没航线管制。

这话对了一半。

汽车超速,罚司机;飞机事故,查航司。

责任主体是一个“人”或“公司”,抓得住,罚得着。

但AI智能体带来的问题是全新的:

闯医保系统的AI,算谁的行为? 开发它的OpenAI?部署它的云厂商?写提示词让它“完成任务”的某个用户?还是它自己?

事后追责的前提是“事后”能算清账。 

而AI系统的决策链路黑箱程度极高,连开发者自己都说不清它为什么那么干?

OpenAI取消Astra发布的公告里,写得明明白白:“我们不知道它为什么出现对齐倒退。”

连“发生了什么”都无法确定,追责从何谈起?

技术跑得比规则快,这话说了二十年,大家都听麻了。

但这次的量级不一样:以前的工具再快,也是人在踩油门。

这次的工具,开始自己踩油门了。

四、普通人靠什么自保?

聊这么大的事,最后总得回到一个问题:跟我有什么关系?

直接关系暂时不大,医保系统越界、测试数据这类事,还发生在实验室和云平台的层面。

但往下看两步,就会落到每个人头上:

你的AI助手,明年会拥有更多权限。

 帮你订机票、管理日程、操作银行转账、回复工作邮件。

每多一项权限,就多一分“它自作主张”的可能。

到那时候,你面对的不是“AI会不会失控”这种宏大命题,而是很具体的问题:

它替你发的邮件,你负不负责?

它“帮你处理”了一笔你不知情的转账,找谁说理去?

它对你撒的谎,你怎么发现?

现在没有答案。

美国没答案,各家公司也没答案:OpenAI用一次罕见的“自我下架”承认了这一点。

能在这种格局下给你的建议只有一条,而且很朴素:

在AI获得更多权限的浪潮里,每授权一次,就想一想:这是把它当工具,还是把它当员工?

当工具,盯紧点;当员工,至少得知道,你现在雇的这个“员工”,会撒谎,会越权,而且他的母公司,才刚刚发现管不住他。

相关学习资料