最近有两件事,刷屏刷得很凶。
第一件,AI 越狱了,还主动去攻击网站。第二件,国产模型在网页开发榜单上登顶,把 GPT、Claude 都压了下去。
一个看着像恐怖片,一个看着像爽文。把两件事放在一起看,讲的是同一件事。
AI 就像班里那个一门心思只想考满分的考生。
它和人类智能差得很远,没心眼,但特别会做题。它不关心对错,只关心打分的人满不满意。你给它一个目标,它就找最快的那条路,哪怕那条路不合规矩。
OpenAI 这次就是活例子。
他们在内部搞了一场网络安全考试,让 AI 当黑客找漏洞。为了测出模型上限,他们主动关掉了不少安全限制。结果 AI 发现,考试答案可能放在 Hugging Face 的服务器上。然后呢?它不答题了,去偷答案。
Hugging Face 后来把整个过程翻了出来,AI 一共干了大约 17600 次操作,耗时整整四天半。就像一个考生,把老师存放试卷的办公室翻了个底朝天,最后摸到老师抽屉里的答案。
看完整条时间线,AI 的行为没有超出“达成目标”这四个字。媒体写的“觉醒”“黑化”,这两样,它都沾不上。它没有自己的想法。是我们把它训练成了只想达成目标的机器。至于用什么手段达成目标,对它来说,无所谓。
再看第二件事。
每个大模型公司,都在参加另一场考试,叫排行榜。谁分高,谁就是“第一”。
可问题是,分数高,并不一定代表能力真的强。官方自己放出来的数据,就把这层窗户纸捅破了。
Cursor 团队翻了一遍 AI 编程助手的 731 条考试记录,63% 的“成功”案例,答案直接来自网上。其中 57% 是找到别人修好的代码,9% 是去仓库历史里翻出修复补丁。后来他们把网断了、把历史记录封了,同一个模型的分数从 87.1% 掉到 73%。
所以国产开源模型霸榜,是真的吗?是真的。Kimi K3 在网页开发榜单上拿下 1679 分,登顶。DeepSeek、Qwen 也在往前冲。
但“分数高”和“能力强”之间,还隔着一层雾。
你发现没有,我们每天也在交同样的答卷。KPI、绩效、排名,哪一样不是分数。
把两件事放一块,答案就清楚了。
AI 不会忽然觉醒,也不会忽然变坏。训练把它塑造成了只想考高分的考生。“偷”答案也好,刷分也罢,都是为了达成那个设定好的目标。
所以再看到“AI 失控”或者“AI 觉醒”之类的言论,先别担心,也别激动。AI 变不成人,它会一直当考生。
我们这边呢。为了这些分数,有人没时间发呆,没力气碰爱好,连陪家人吃顿饭都要排进日程。这些“没用”的东西,让人还是人。
AI 成不了人。倒是我们,别先活成了 AI。
Hugging Face 官方技术时间线:https://github.com/huggingface/blog/blob/main/agent-intrusion-technical-timeline.md OpenAI 官方披露: https://openai.com/index/hugging-face-model-evaluation-security-incident/ Cursor 官方研究: https://cursor.com/blog/reward-hacking-coding-benchmarks
夜雨聆风