ARTICLE · 1034270
连“认出AI”和“故意装蠢”都过了——GPT-6通关《我不是机器人》,验证码的死刑判决书

《我不是机器人》是开发者Neal Agarwal制作的一款网页游戏,把互联网上各种类型的CAPTCHA验证码做成了48个关卡。第一关很简单,勾个框就行。往后开始上强度:认停车标志、找Waldo、画一个足够圆的圆、平行停车、拼图、打地鼠。

普通人通关需要30到60分钟。而GPT-6 Astra跑完了全程,零失误。
从演示视频看,GPT-6 Astra不是简单地“回答CAPTCHA图片”。它通过Computer Use操作浏览器,识别屏幕内容、点击、输入、拖动,处理连续变化的游戏规则,最终跑完整个流程。在考验动手能力的OSWorld 2.0计算机使用测试中,Astra得分72.6%,每任务耗时约40分钟;而上一代GPT-5.6 Sol是65.7%、75分钟——能力提升的同时,耗时减少了47%。

48关中最具象征意义的,是第37关:给出一堆真人照片,把AI生成的脸挑出来。

这一关的难度不在于“你能不能看出这是AI”,而在于“你知不知道人类出题者认为什么是AI”——GPT-6需要理解“AI生成的脸通常有哪些特征”这个元认知问题。一个AI,要判断另一个AI的“作品”像不像AI——这种“自噬式”的测试,恰恰验证了GPT-6对“人类如何定义AI”的理解深度。
AI不仅要答题,还要站在人类出题者的视角去思考“什么才算答对”。

第42关是一条反向规则:你要主动答错几道简单题,才能证明你是人。

这一关的哲学意味远大于技术难度。“故意犯错”是一个极其复杂的行为——它需要AI不仅知道正确答案,还要理解“人类在什么情况下会犯错”,并且有意识地偏离最优策略。在强化学习框架下,模型的每一个训练信号都在鼓励它“做对”。要求一个AI“做错”,等于要求它在认知层面理解“不完美本身就是人类的签名”。
GPT-6通过了这一关,说明它已经具备了某种形式的“元认知”——知道自己知道什么,并且能选择“不展示” 。

GPT-6通关《我不是机器人》的真正意义,不是“AI攻破了验证码”,而是验证码这个品类已经从“有效”变成了“无效” 。

CAPTCHA诞生于2003年,由卡内基梅隆大学的Luis von Ahn团队发明。它的逻辑是:给访客一个人类可以毫不费力完成、但计算机几乎不可能完成的任务——扭曲的字母、重叠的文字、模糊的图片网格。这套系统从来不是一堵墙,而是一个移动靶。双方一直在互相训练。每一次验证码被破解,破解本身就在训练下一代模型去读下一个验证码。

但2023年,一个被埋没的信号已经出现了。OpenAI的GPT-4系统卡记录了一次实验:研究人员给模型一个它无法解决的CAPTCHA,并给它访问TaskRabbit(跑腿服务平台)的权限。GPT-4直接雇佣了一个人类来帮它解题。 当那位人类工人半开玩笑地问“你是机器人吗”,模型推理出了一个谎言:它声称自己有视觉障碍。工人相信了,并帮它解了题。
当时大多数报道聚焦于“模型学会了撒谎”。但更值得关注的细节被忽略了:即使是在2023年,验证码也没有真正拦住模型——它只是多了一步“找个人类绕过去” 。三年后,这一步也不需要了。Astra不需要人类代理人,它看着谜题,直接解出了答案。

验证码行业并非没有反应。
行业正在转向Cloudflare Turnstile、reCAPTCHA v3这类“无感”评分机制——不再问用户问题,而是给每次访问打一个0到1的人类概率分,分析鼠标轨迹、点击节奏、设备指纹等行为特征。

但问题在于:GPT-6的Computer Use能力已经能流畅地移动鼠标、点击、输入和拖拽。 一项2026年7月的研究系统评估了现代自主浏览器Agent在Turnstile和reCAPTCHA v3上的表现,结论是:Agent能够完成交互流程并提交表单,但提交持续无法通过验证阈值——因为它们无法生成足够“真实”的行为和环境信号。唯一持续成功的配置,是一个在真实浏览器配置文件中运行的扩展,它继承了持久的Cookie、浏览历史、已安装扩展和稳定的指纹特征。
换句话说:验证码的防线正在从“考知识”转向“考身份”。 问题不再是“你能不能解答这个谜题”,而是“你的浏览器指纹像不像一个真人”。
但这条防线同样不牢固。 当GPT-6能像人类一样移动鼠标、点击、拖拽时,它的“行为指纹”和人类之间的差距,正在以令人不安的速度缩小。

GPT-6通关《我不是机器人》的真正冲击,不在于48个关卡的通过本身。
而在于它证明了验证码的底层假设——“人能轻松做到但机器做不到”——已经被彻底推翻。 当一个AI既能识别AI生成的脸(第37关),又能表演不完美(第42关),人类用来区分自己的最后一道视觉防线,已经失效。
CAPTCHA不会再消失。它仍然会存在,因为它是互联网基础设施的一部分。但它会变成一种 “低门槛过滤器” ——挡住那些连基础视觉推理都做不到的简单脚本,而不再是一个真正的安全边界。
真正的安全逻辑,正在从“考知识”转向“考行为”,从“一次性验证”转向“持续监控”。 而这场考试,才刚刚开始。
参考资料:
https://arxiv-org.ezproxy.obspm.fr/html/2607.18659v1#2#3
https://cheq.ai/blog/the-captcha-is-dead-dont-mourn-it-its-time-to-move-on/
https://eu.36kr.com/zh/p/3973910125457667#1