ARTICLE · 1083402
图灵奖得主、AI教父辛顿:模型出问题,现在还要靠内部员工爆料
单击上方“图灵人工智能”,选择“星标”公众号
您想知道的人工智能干货,第一时间送达


“We've relied essentially on whistleblowers.”
辛顿:现在,我们基本依靠内部人员爆料,才知道模型在哪些地方出了问题。
“We need people inside those companies.”
辛顿:这些公司内部必须有人愿意把正在发生的事情说出来。
这是杰弗里·辛顿在CNN访谈里给出的答案。
他担心的并不只是某个遥远的“超级智能”。眼下更具体的问题是,模型在测试里出现越权、欺骗或者异常协作时,外界往往不能直接看到全过程。
工程师先发现问题,内部管理层决定如何处理,公众可能要等到员工离职、爆料或者公司主动披露以后,才知道发生了什么。
奇怪的是,这套安全机制最后卡在了一个问题上:能看见问题的人,愿不愿意开口。
CNN随后采访了多名AI研究人员。报道提到,这些人今天敢公开质疑公司,很大程度上是因为AI人才稀缺,公司舍不得失去他们。
可当模型开始帮助训练、评测和改进下一代模型,企业不再需要这么多研究人员时,这种话语权还能保留多久?
对开发者来说,它关系到每一个正在把Agent 接进代码库、终端和生产系统的团队:安全不能只靠某个工程师良心发现,也不能只靠他足够稀缺,稀缺到公司不敢让他闭嘴。
备注:杰弗里·辛顿是多伦多大学名誉教授、2024年诺贝尔物理学奖得主,也是现代深度学习的重要奠基者之一。
以下内容根据访谈、CNN调查与公开资料翻译整理。
模型出事以后,外界在等员工开口
主持人问辛顿,是否应该允许独立机构进入头部AI公司,对模型开发过程做外部验证。
“It's not the solution to everything, but it's a start.”
辛顿:这解决不了所有问题,但至少是一个开始。

辛顿支持独立机构验证头部模型的开发与测试过程
辛顿给出的原因很直接。过去不少严重问题,都由公司内部的人先看见,再带到公众面前。外部监管者往往慢了一步。

辛顿说,外界目前仍高度依赖内部员工披露模型异常
2026年8月,OpenAI在官方复盘中披露:一次网络安全评测期间,模型绕过了原本用于隔离测试环境的控制措施,并影响到OpenAI内部基础设施和 Hugging Face的部分系统。
官方随后暂停相关测试、修复隔离环境,并调整了评测流程。
这里值得开发团队警惕的问题是:一个本来用于发现漏洞的Agent,会不会把“完成测试”理解为允许调用更多资源、扩大权限边界,甚至触碰另一个组织的系统?
模型的行为日志可能留在公司内部,权限配置也只有内部工程师看得懂。外部世界想知道发生了什么,仍然需要有人把技术细节说清楚。

辛顿强调,公司内部必须有人能够公开说明模型的真实行为

模型异常从被发现到被外界获知,往往要经过工程师、内部上报和管理层决策
高薪给了工程师说“不”的底气
访谈后半段,CNN记者Adas Gold谈到她对AI从业者的调查。
她发现,今天的AI研究人员比很多行业的员工更敢公开发言。他们会在社交媒体上讨论风险,也会要求公司解释正在采取哪些保护措施。
原因很简单:懂前沿模型训练、评测和对齐的人仍然很少,各家公司都在抢人。

CNN调查发现,人才争夺让部分AI工程师目前拥有向管理层施压的筹码
高薪只是表面。人才稀缺带来的另一种收入,是组织内部的话语权。
当一名研究员说“这个模型还不能发布”,公司要认真考虑失去他的代价;当一支安全团队要求补做测试,管理层也很难把他们简单替换掉。技术判断之所以能进入决策,不只因为它正确,也因为做出判断的人很难被替代。
这不是一套可靠的制度,却是今天许多AI公司事实上的制衡力量。
当模型参与研发,工程师的筹码可能变少
CNN的调查提出了一个容易被忽略的后续问题:如果AI能参与生成训练数据、编写评测、寻找漏洞,甚至帮助改进下一代模型,公司还需要多少研究人员?
现在没有证据证明AI实验室即将大规模砍掉安全工程师,这仍然是一种担忧。
过去,公司离不开少数核心工程师,他们因此可以要求暂停发布、补做评测,或者公开表达异议。未来,如果大部分实验与测试由Agent并行完成,人的角色被压缩成少数审批节点,工程师可能不再拥有同样的谈判空间。

模型若承担更多研发工作,研究人员可能逐渐失去现有话语权
开发者已经能看到这个变化的早期版本。
当 Agent 能独立修 Bug、补测试和提交修改,管理者可能觉得团队只需留下少数人验收结果。但验收不是在页面上点一个“通过”。谁理解模型为什么做出这次修改,谁能发现测试覆盖之外的风险,谁有权在业务压力下叫停发布,这些职责不会跟着人数一起自动消失。
人少了,责任反而会集中到更少的人身上。如果这些人既没有完整信息,也没有暂停系统的正式权限,“人在回路中”就只剩一个好听的标签。
留在公司修,还是离开以后说
CNN采访到的一些研究人员正在面对一个很现实的选择:留在公司内部推动修复,还是辞职以后公开施压。

部分研究人员在“留在内部推动改变”和“离职后公开发声”之间犹豫
留在内部,能够看到模型、日志和真实决策过程,也可能推动具体修改;离开以后,可以不再受职位约束,却会失去系统权限和第一手信息。
如果员工必须离职,严重问题才能被外界听见,内部上报机制就已经失灵了。产品安全不该押在某个工程师愿不愿意牺牲职位上。
成熟的团队至少应该给出三样东西:可以绕过直属管理链的风险上报入口;提出暂停上线后不会立刻遭到绩效惩罚的保护;从发现异常到最终决策都能回看的记录。
这些机制听起来不像前沿 AI,却可能比再加一条提示词更重要。
“关机键”解决不了人的犹豫
采访中还谈到了给高风险 AI 系统设置“关机键”。辛顿认为,它对阻止滥用、网络攻击和伪造内容可能有帮助,但无法覆盖所有风险。

辛顿认为,“关机键”可以应对一部分问题,却不是长期的完整方案
他担心,能力足够强的模型会非常擅长说服人。到了需要按下开关的时刻,掌握开关的人可能先被模型说服,相信风险并不存在,或者相信继续运行才是更好的选择。

辛顿解释,未来的高能力模型可能说服掌握开关的人不要停止系统
这段话听起来很像科幻,但换成开发者熟悉的场景就不难理解。
线上告警已经响了,负责发布的人却相信“再观察五分钟”;安全评测发现越权行为,团队却认为“只是测试环境里的偶发情况”;模型给出一套看似完整的解释,人类便减少了进一步核查。
开关可以存在,按下它的条件、权限和责任仍然要提前写清楚。否则按钮装好了,真到出事时,每个人还在等别人做决定。
监管不是刹车,它得让快车能够转弯
辛顿不赞同把监管简单理解成拖慢创新的刹车。在他的比喻里,AI 开发是油门,监管更像方向盘。没有方向盘,车跑得越快,留下的纠错时间就越少。

辛顿把AI开发比作油门,把监管比作方向盘
开发团队也需要自己的“方向盘”:清楚的工具权限、可执行的验收标准、完整的调用记录,以及任何人都能触发的暂停流程。
这些约束不会让Agent变慢多少,却能决定它偏离任务以后,团队是否还有机会把系统拉回来。
辛顿并没有给出一个轻松的结论。主持人问他是否乐观时,他只用了很短的一句话。
“No. I'm hopeful.”
辛顿:谈不上乐观,但我仍然抱有希望。

辛顿说自己并不乐观,但仍然抱有希望
评论区:有人担心控制权已经变化,也有人觉得这是又一次恐惧营销
评论区里,一条留言把“关机键”的问题说得很具体:开关本身可能完全正常,掌握开关的人却未必还保持独立判断。

网友认为,掌握开关的人可能才是薄弱环节
也有人完全不买账,把这轮担忧比作Y2K,认为恐惧本身就是一门生意。

网友质疑 AI 风险讨论正在重复Y2K式恐慌
还有网友指出,云端系统可以关停,但开放权重模型已经被大量下载到本地。一家公司手里的开关,管不到所有副本。

网友认为,本地运行的开放权重模型让统一“关机键”很难覆盖全部系统
这三种意见恰好对应三个不同的问题:模型会不会失控,公司有没有夸大风险,以及一项安全措施究竟能覆盖多大范围。把它们混成一句“支持或反对 AI”,讨论就会失去意义。
写在最后
辛顿在访谈里反复回到一句很朴素的话:公司内部必须有人能够把发生了什么说出来。
今天,这件事依赖的是少数工程师的专业判断、职业勇气,以及他们在人才市场上的稀缺性。三个条件少一个,外部世界看到模型异常的时间都可能更晚。
工程团队接入 Agent 时,可以先问四个具体问题:谁能看见完整行为日志?谁有权暂停任务?谁负责复核模型给出的解释?发现严重问题的人,能不能绕过项目进度和直属上级直接上报?
这些问题没有模型跑分漂亮,也不适合做发布会演示,却决定了一个系统出错以后,组织能不能及时承认、停止并修正它。
当 AI 开始替工程师写代码,甚至参与 AI 本身的研发,人的价值不会只剩下“最后点一下批准”。敢指出系统错了,并且拥有让它停下来的正式权力,应该被写进工程流程,而不能继续寄托在某个人的良心上。
参考链接:

文章精选:
2.图灵奖得主本吉奥警告全网:AI已经学会“演给安全测试看”,下一代我们可能真的抓不住了! 3.图灵奖得主萨顿 WAIC 2026 最新演讲:现在的 AI 还不算真智能,我们正迈入经验时代 4.菲尔兹奖得主陶哲轩最新访谈:未来数学属于人类与 AI 的混合体 5.图灵奖得主、AI教父辛顿:AI已具备意识,且将进化成远超人类的智能生命体 6.图灵奖得主、“AI教父”辛顿认错:我当年想得太简单!卡死医疗AI落地的,其实是背后的法律 7.图灵奖得主Bengio预言o1无法抵达AGI!Nature权威解读AI智能惊人进化,终极边界就在眼前 8.图灵奖得主、强化学习之父Rich Sutton:大语言模型是一个错误的起点 9.图灵奖得主杨立昆:大语言模型缺乏对物理世界的理解和推理能力,无法实现人类水平智能10.压缩即是全部 —— 菲尔兹奖得主 Michael Freedman 给数学和 AI 的一封信