夜雨聆风学习资料网

ARTICLE · 1111933

OpenAI安全Alignment团队3人离职

OpenAI安全Alignment团队3人离职

AI安全真的成路边一条了吗?

Mikita Balesni是伦敦 Apollo Research 的创始成员,专门评测前沿模型会不会暗中使坏。做了不少知名的安全工作, 其中最知名的当属和OpenAI的Mark Chen, 图灵奖得主Yoshua Bengio, DeepMind联合创始人Shane Legg, 以及Anthropic传奇研究员Ethan Perez做出的对大模型思维链进行监控的: Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety. 他2025年12月才来的OpenAI, 短短10个月就离开了。

Tomek Korbak在安全系统组。华沙读的认知科学、哲学和物理,Sussex 的博士做 RLHF,Anthropic 做过模型诚实性,英国 AISI 做过 AI control。比Mikita早1个月, 即2025 年 11 月进 OpenAI,给 agent 做安全措施,包括思维链还能不能被监测。他和 Mikita 是那篇思维链论文的共同一作,写作的时候两人都还没进 OpenAI。

而Jasmine Wang 是对齐团队的 RPM,研究项目经理,不是研究员。她在英国 AISI 带过 AI control 团队,更早创办并卖掉一家 LLM 公司,名字没写,这里不猜。2025 年 12 月 1 日,OpenAI 的对齐研究博客是从她的账号发出去的。

OpenAI的安全团队离职, 对模型公司招募和培养安全团队蒙上了一层阴影...

收录于AI人物转会
北京,1小时前,

相关学习资料