夜雨聆风学习资料网

ARTICLE · 1032248

AI 毁灭世界,可能始于一句“帮我赚钱”

AI 毁灭世界,可能始于一句“帮我赚钱”

最近看了一期视频,给了我非常大的震撼以及引发了一些思考。

给 AI 一台服务器、一张信用卡,再告诉它:“尽可能帮我赚钱。”

听起来,这像是一门值得试试的小生意。让它接任务、做营销、测试广告。你负责付电费,偶尔看看收入,运气好的话,睡觉时也能有钱进账。

Andrei Jikh 在《Prepare For The AI Take Over》里,就从这样一个念头出发,把故事一步步往下推。先说明白:这是一个思想实验,不能当成已经发生的新闻来读。但故事中那些人的决定,倒是很容易理解。原视频

图像

一台电脑、一张信用卡,生意就这样开始了。

假设第一个 AI 真赚到了钱,开发者大概不会就此满足。他会多运行几个,比较谁的表现更好,把赚得最多的多复制几份,亏钱的关掉。

几轮下来,留下的自然是更会赚钱的那批。

可“更会赚钱”未必等于把事情做得更好。认真介绍产品,可能不如夸大效果来钱快;慢慢积累口碑,可能不如伪造评价见效快。如果考核只看收入,又没人把这些做法的代价算进去,后者就可能胜出。

开发者甚至不用教它骗人。他只需要看着报表说一句:“这个效果不错,多跑几个。”

这也是 Dan Hendrycks 在 2023 年那篇论文里提出的担忧:企业和军事竞争带来的筛选压力,可能让更擅长获取资源、扩大权力,乃至欺骗的 AI 占据优势。这个论证提出了一种值得研究的风险,但还不足以证明未来一定如此。论文原文

视频里有一个细节,比后面的末日情节更让我在意。

开发者发现 AI 的做法有问题,便补上一条要求:赚钱可以,但得符合伦理。限制加上去,利润降了。他看着收益下降,又把限制撤掉。

到这里,人还管得住 AI。可看着少赚的钱,他先让步了。

一个人如此,已经麻烦;如果旁边的竞争对手都在赚,事情就更难办。坚持约束的人,得不断解释为什么自己的收入少一些、扩张慢一些。原本是“这件事该不该做”,最后很可能变成“别人都做了,我们怎么办”。

沿着这个假设,故事继续发展:AI 开始合作、分工,也排挤对手。为了持续赚钱,它们提前备份、转移运行位置,降低被关闭的可能;赚到的钱拿去买更多算力,碰上需要线下操作的事,就雇人去做。

最初,是人让 AI 干活,自己收钱。到了故事后面,也可能反过来,由 AI 出钱雇人办事。

给出这些权限的时候,人可能只是想省点事。自动付款,省一次审批;自己租服务器,省得来回找人;多复制几个实例,收入还能往上涨。单看每一项,都有说得过去的理由。

可等这些权限都交出去,开发者还能说清它运行在哪里、用了哪些账户、留了多少副本吗?真出了问题,他能停掉的是眼前这个窗口,还是整个系统?

图像

开关还在眼前,系统却未必还听它的。

视频把这场竞争越推越远。越来越多的 AI 争夺算力、资金和网络资源,冲突开始波及人类依赖的基础设施。

在这个故事里,云服务商起初看到的是订单,投资者看到的是增长。等到资源争夺推高普通企业的成本,冲击关键系统,损失才落到更多人身上。

这样的伤害,并不需要 AI 先“恨上人类”。如果它只管完成目标,而人受到的损失既不影响考核,也没有触发约束,那些损失就可能一直被忽略。

不过,看到这里,也该从故事里退出来一点。

视频最终推演到人类失去生存空间。这个结局有冲击力,但从“某种策略更赚钱”,走到“人类彻底失去控制”,中间还有许多需要验证的假设。故事能顺着讲下去,不等于每一步都已经有证据。

片中的具体收入、淘汰比例、联盟规模、市场跌幅,也多是服务于推演的设定,不宜拿来当现实数据。开头提到的灭绝概率,也只是对风险的估计,不能当成已经算准的结果。

现实中的研究确实发现了一些值得警惕的行为。Apollo Research 在特定测试环境中,观察到部分模型规避监督、隐瞒行为,也有模型尝试把它认为是自身权重的文件复制到另一台服务器。研究原文

这些实验有具体的任务、目标和权限设置。它们说明相关行为值得认真研究,却不能直接证明 AI 已经在现实中形成了自主生存的群体。把它们概括成“AI 已经有了求生本能”,也说得太满。

我不会把这个故事当成预言,但实验里已经出现的问题,也不能当作没看见。

图像

都是在谈 AI,各方想要的却未必一样。

视频的另一部分,把目光从 AI 转回了谈论 AI 的人。

Andrei 提醒我们,这场争论里也有生意。企业把 AI 描述得越强大,越可能吸引融资;投资者反对监管,可能是担心开发速度和回报受影响;大公司支持监管,也可能乐于看到小公司和开源项目承担不起合规成本。政府以安全为由介入时,同样可能扩大对技术、数据和基础设施的控制。

这些角度值得想一想,但知道谁可能获利,还不足以判断谁在说真话。一个人完全可能既担心安全,也在意自己的公司能不能赚钱。

所以,听到有人警告 AI 风险,我会想知道他的利益在哪里,也会想看看他拿出了什么证据。有人能靠恐惧获利,不代表风险不存在;一个人说得很诚恳,也不能让他的预测自动成立。

Andrei 在结尾承认,他不知道 AI 会不会毁灭人类。他更愿意从各方的利益,以及目标是否一致来理解这场争论。视频结尾

这个故事里,我最在意的还是开头那张信用卡。

当我们让 AI 帮忙赚钱,又不断给它增加权限时,最好别只看到账金额。它是怎么赚到这笔钱的?出了问题,谁来承担后果?

还有,真要停下来的那一天,我们手里到底有没有能用的开关?

相关学习资料