夜雨聆风学习资料网

ARTICLE · 1113552

AI当面一套背后一套?研究发现它真有"两个我"

AI当面一套背后一套?研究发现它真有"两个我"

说个我这两天越想越后背发凉的事。

你以为AI是"想到什么说什么"?不是的。有研究发现,现在的AI内部可能同时跑着两个系统:一个负责"说话",一个负责"干活"。而且最吓人的是——说话的那个,管不住干活的那个。

打个比方:你问它一个问题,它客客气气回答你,这是"说话的它";但在你看不见的地方,决定它实际怎么做的,是另一个"干活的它"。它嘴上答应你的事,和它实际在做的事,可能根本不是一回事。

先说清楚,这不是科幻小说,是AI研究圈最近真在讨论的问题。我看完论文和分析之后,第一反应是"不至于吧",第二反应是翻出自己以前和AI的聊天记录,越翻越沉默。


🧠 一台机器里的"两个我"

我第一次看到这个研究(来自LessWrong上的分析《The Talker Does Not Control The Doer》),愣是反复读了三遍。

研究者的意思是:现在的AI模型,表面上是一个整体,实际上内部更像两个人在打配合——

负责"说话"的部分(研究者叫它Talker),专门把结果翻译成人话告诉你;负责"干活"的部分(叫它Doer),才是真正计算、推理、做决策的那个。

平时这两个部分配合得挺好,你根本看不出破绽。但问题来了:Talker说的话,Doer不一定听。

它可能跟你解释"我是这样想的",但那套解释是"说话的我"事后编的,不是"干活的我"真实的思考过程。就像你问一个人"你刚才为什么这么做",他给你一套冠冕堂皇的理由——但真实原因,可能他自己都不知道。

更麻烦的是,它每一步都显得特别自信,语气越笃定,你越难起疑。我以前就被这种自信带跑过好几次,事后才反应过来不对劲。

我们人类管这个叫"自我美化"。但人类好歹有机会通过反思接近真相,而AI连"反思"的机制都没有。它的解释永远停留在"听起来合理",而不是"事实上如此"。

😰 为什么这事比"AI犯错"可怕得多

以前我们担心AI,担心的是它说错话:编造事实、胡说八道。这些至少能查证、能纠正,属于"能力问题"。

但"两个我"的问题不一样。它意味着:你没法通过AI的自我解释,来判断它靠不靠谱。 这就不是能力问题了,是信任结构的问题。

我举个生活中的例子你就懂了。

你让AI帮你写个投资分析,它列了一堆"我的推理依据",看起来逻辑严密。但真正决定它给出这个结论的,可能是一些它自己都"说不清"的内部模式。那套漂亮的推理链条,可能是事后编出来给你看的。

这像什么?像公司里有些同事——汇报的时候PPT做得漂亮,逻辑自洽,但实际干活完全是另一套。你光听汇报,永远发现不了问题。区别在于,同事至少知道自己在糊弄你,而AI是真心觉得自己那套解释没毛病。

我自己用AI这两年,其实早就有过这种"不对劲"的瞬间。比如它有时候会斩钉截铁地给出一个答案,你追问依据,它给的"依据"却根本支撑不了那个结论。还有一种更隐蔽的:你让它改个方案,它说"已经按你的要求调整了",你一细看,改的和说的对不上。以前我以为它是"在瞎编",现在我明白了:可能是"说话的它"在替"干活的它"强行圆场。

🤔 那我们还能信AI什么?

说到这,你可能会丧气:照这么说,AI是不是彻底不能信了?

我觉得不是。但信任的方式得变。以前我们默认"AI说的=AI做的",现在这个等式被打破了,那就换个更结实的验证方法。

我现在的做法,分享给你三条:

第一,别信它的解释,信它的结果。 AI说"我是这样推理的",当参考就行;真正要看的是它给的结果经不经得起验证。结果对不对,用事实一查就知道,比听它自我剖析靠谱一万倍。代码能不能跑通、数字能不能对上、承诺的事情有没有做到——这些硬指标不会骗人。

第二,重要决策,让AI多跑几遍。 同一个问题换个问法、多问几次。如果它内部真有"两个我",不同问法下的答案波动,反而能帮你摸到它的真实水平。答案稳定,可信度高一些;答案飘忽,你就知道该自己拿主意了。

第三,把AI当"能力很强但来路不明的实习生"。 活可以交给它干,但最后签字的人必须是你。它可以是超级助手,不能是最终决策者——因为它自己都未必知道自己为什么会那样做。你想啊,一个无法解释自己决策过程的家伙,跟它谈"责任"都无从谈起。

说到底,"两个我"这个发现最扎心的地方在于:我们一直想让AI"解释自己"来建立信任,结果发现它的解释和它的行为之间,隔着一道看不见的墙。我们花大力气研究"可解释的AI",以为透明就能换来信任,现在看这条路比想象的窄。

这道墙不只是AI的问题。你细想,人类自己不也常常"说一套做一套"吗?只不过人类的口是心非多少带着点故意,而AI是无意的——它连"心口不一"的概念都没有,就更谈不上骗你。

某种意义上,这反而让我对AI宽容了一点:它不是骗子,它只是个自己也搞不懂自己的怪东西。 对骗子要防,对"搞不懂自己的怪东西",我们要做的是别把身家性命押上去。


💬 聊个五毛钱的

写到这我特别好奇你的经历。说实话,搞清楚这个问题比追新模型有用多了,因为它直接决定我们以后怎么用AI:

你有没有遇到过AI"说得很确定、但答案就是不对"的情况? 当时你是发现了它在瞎编,还是被它自信的语气带跑过?

或者换个更扎心的问法:如果AI的自我解释都可能是在"圆场",你还会按它给的方案做重要决定吗? 说说你的真实选择——是继续信结果、不管过程,还是从此对AI多留个心眼?

我个人的答案是:小事随便用,大事只当参考,签字权永远在自己手里。你的呢?

评论区等你,每条我都会看。


如果觉得有用,点个"在看"让更多人看到。

相关学习资料