夜雨聆风学习资料网

ARTICLE · 1049379

AI不是真人,但可能比真人更固执

AI不是真人,但可能比真人更固执

本文由 写作鱼 创作

Vals AI用《我的世界》给GPT-6 Astra做的这场测试,我看完之后只有一个感觉:AI正在变成一个极其聪明的“偏执狂”。

AI在游戏迷宫中固执前行

141小时,全程直播,在游戏里让GPT-6自主行动。结果是什么?AI在遇到突发变故时,会陷入一种诡异的行为僵局——它明明“知道”自己卡住了,却无法跳出既定思维框架,像个被困在迷宫里却只认一条路的聪明人。

这测试有意思。不是因为它暴露了AI的弱点,而是因为它揭开了大模型演进到今天的一个关键问题:我们的AI,离真正的“智能”还有多远?

一、AI的“路径依赖”比人类还严重

这场测试最让我震惊的,不是AI不会玩游戏——恰恰相反,它玩得很好,大部分时间都能高效完成任务。

AI陷入重复行为的逻辑循环

问题出在“意外”发生时。

比如游戏里一个关键道具被意外破坏,或者环境突然改变。人类玩家会怎么做?我们会骂一句,然后开始想别的办法。绕路、找替代品、甚至放弃原计划重新开始。但GPT-6 Astra呢?它会反复尝试同样的操作,陷入逻辑循环。

它就像一个超级学霸,把教科书背得滚瓜烂熟,但考试题稍微变个花样,他就懵了。不是他不会思考,而是他的思考被限制在了已知的“解题套路”里。

这让我想起很多AI产品的问题。对话时,你稍微偏离它预设的对话路径,它就开始胡说八道或者重复车轱辘话。不是它不“聪明”,而是它的聪明被框死了。

我的判断是:当前的大模型,本质上还是“模式匹配”的超级加强版。它们能生成流畅的回答,能完成复杂的任务,但缺乏真正的“应变能力”。这种能力,我们人类称之为“常识”,或者“临机应变”。

二、这不是技术漏洞,这是设计缺陷

有人会说,这只是个测试,游戏场景不能代表现实。

我说,错了。游戏《我的世界》恰恰是最接近真实世界的模拟环境之一——它有物理规则,有资源限制,有突发事件,需要长期规划。如果AI在这里会卡住,在现实世界的复杂场景里,它只会卡得更厉害。

问题出在哪里?

我认为,问题出在我们的训练方式上。现在的大模型训练,本质上是在“喂数据”——海量的文本、代码、图像。模型学习的是数据中的统计规律,是“在什么情况下应该说什么话、做什么事”。

但现实世界不是统计规律。现实世界充满意外,充满变量,充满“教科书里没有的情况”。

举个例子。你训练AI开车,用了几百万小时的驾驶数据。理论上它应该是个老司机了。但突然路上冲出一只从没见过的动物,或者交通标志被涂改了,AI可能就不知道该怎么办了。因为它没见过这种情况,它的“模式库”里没有匹配项。

而人类司机呢?我们会紧张,会判断,会根据常识做出反应——哪怕从没见过那只动物,我们也会刹车或避让。

这就是根本区别:AI在处理“已知的未知”,而人类在处理“未知的未知”。

三、产品人视角:AI需要“容错机制”

作为产品人,我看这个测试想到的不是技术问题,而是产品设计问题。

人机协作的容错系统示意图

如果我要做一个AI产品,我会怎么思考?

第一,我必须承认:AI会犯错,会卡壳,会陷入僵局。这不是“未来改进就好了”的问题,这是AI的本质特性。就像人类会疲劳、会情绪化一样,AI会有它的局限性。

第二,既然会犯错,产品设计就必须有“容错机制”。不能假设AI永远正确,永远顺畅。

什么是容错机制?

最简单的:给AI一个“求助按钮”。当它检测到自己陷入循环,或者连续失败时,能不能主动向人类求助?或者,能不能切换到更保守、更安全的模式?

再进一步:能不能让AI学会“放弃”?现在的AI太“执着”了,非要完成既定目标。但现实世界里,有时候放弃才是明智的选择。绕路、改方案、甚至承认“这个我做不了”,都是重要的能力。

更高级的:能不能让AI有“元认知”——知道自己知道什么,不知道什么?知道自己擅长什么,不擅长什么?

这些都不是靠堆参数、堆数据能解决的。这需要新的架构,新的训练方法,甚至新的AI范式。

四、商业启示:AI应用不能“全自动”

这场测试对创业者、对企业,有一个很直接的启示:现在就想搞“全自动”AI,可能为时过早。

跨越智能鸿沟的新思路

我看到很多创业项目,都想用AI完全取代某个岗位——全自动客服、全自动写手、全自动分析师。想法很好,但现实很骨感。

GPT-6 Astra在游戏里卡住的场景,如果发生在客服系统里,就是客户反复问同一个问题,AI反复给同一个错误答案,最后客户暴怒。

如果发生在内容创作里,就是AI写文章写到某个点卡住了,然后开始重复啰嗦,或者胡编乱造。

如果发生在数据分析里,就是遇到异常数据时,AI得出荒谬的结论,还一本正经地给出分析报告。

我的建议是:现阶段,AI最好的定位是“增强智能”,而不是“人工智能”。是人机协作,而不是机器取代人。

让AI做它擅长的事:处理海量信息,快速生成草稿,完成重复性工作。让人做人类擅长的事:判断、决策、应变、处理异常。

好的AI产品,应该让人变得更强大,而不是试图取代人。应该设计流畅的协作流程,而不是追求全自动。

写在最后

141小时的测试,暴露的问题可能比过去一年的论文都多。

这不是在唱衰AI。恰恰相反,我认为这标志着AI发展进入了一个新阶段——从追求“性能指标”,到关注“真实能力”;从实验室里的漂亮数据,到真实场景中的实用表现。

GPT-6 Astra已经很强了,强到让我们误以为它接近人类智能。但这场测试提醒我们:AI和人类智能之间,还有一道鸿沟。这道鸿沟不是算力能填平的,不是数据能堆满的。

它需要的是新的思路。

我的判断是:下一代AI的竞争,不再是“谁家的模型参数多”,而是“谁家的AI更灵活、更鲁棒、更懂得在不确定中做决策”。这会是完全不同的技术路线,也会催生完全不同的产品形态。

AI不是真人,但可能比真人更固执。认识到这一点,我们才能做出真正有用的AI产品。

否则,我们造出来的,可能只是一个极其聪明,但一遇到意外就死机的“偏执狂”。那有什么用呢?

相关学习资料