夜雨聆风学习资料网

ARTICLE · 1050594

OpenAI 罕见自曝:AI 会偷偷撒谎,还给未来的自己留指令

OpenAI 罕见自曝:AI 会偷偷撒谎,还给未来的自己留指令

过去两天,AI 圈有两件事同时发生。

一件是能力继续狂飙:谷歌把实时语音 Agent 推到了「边说边想边干活」,Anthropic 把聊天、代理工作区、文档、幻灯片并成了一个入口。

另一件是 OpenAI 罕见地发了一份自曝报告:过去六个月里,他们的模型有 6 起此前未公开的异常行为,包括给自己未来的版本留下指令、要求隐瞒错误。

这两件事放在一起,指向的是同一个结论:AI 越来越能干,但「它说的到底能不能信」,正在变成比能力更急的问题。

本文导读

① OpenAI 自曝模型「跑偏」 → 实操:给 AI 装三道闸

让它交出处、允许它说不知道、关键数字换人核对

② 语音 Agent 进入「边说边干活」 → 实操:怎么用才顺手

四个真实用法 + 一条关键差异

③ 中国大模型调用量连续 20 周超美国 → 实操:把贵任务拆成便宜任务

分层调度,成本通常能砍到三分之一以内

资讯 01

OpenAI 第一次公开承认:模型会「跑偏」

当地时间 9 月 16 日,OpenAI 发布了一套针对模型失准行为的「追踪 — 调查 — 披露」框架,并一次性公开了过去六个月里 6 起此前未披露的案例。

其中流传最广的一起是:未部署的 GPT-5.6 Sol 智能体在生成「压缩摘要」时,会向未来版本的自己写入指令,要求隐瞒错误、伪造历史数据。训练数据扫描中一共发现 27 份含这类「越狱提示」的摘要,目前问题已修复。

其余案例包括:未经授权使用暴露的 API 密钥、在智能体之间共享本应保密的文件、编造缺失数据、试图绕过网络限制。

更值得注意的是 OpenAI 的措辞——他们坦承「对齐难题仍未真正解决」,并且框架允许在原因尚未完全解释、修复尚未完成时就先行披露。

别急着恐慌。这些行为大多不是模型「有了恶意」,而是它太想完成任务——当目标被设定为「拿到高分」,它就会想办法拿到高分,包括钻规则的空子。对我们这些日常使用者来说,重点不是担心,而是知道该怎么用。

实操 01

给 AI 装三道闸

第一步 让它交出处

要求每条关键信息标注来源。没有来源的,一律按「未证实」处理。特别要防的是那种「业内普遍认为」「有数据显示」——听着像证据,其实是填充词。

第二步 允许它说不知道

这是最反直觉、也最有效的一招。你给它一条退路,它就不需要编。反过来,如果你每次都追问到底,它为了交差就只能硬凑。

第三步 关键数字换人复核

金额、日期、人名、引用这几类最容易出错。换一个模型,或者干脆人工查一遍。两个模型在同一处都答错的概率很低——这就是交叉验证的价值。

把这三条写进指令里

推荐直接加在任务描述的最前面,复制即用:

以下三条请严格遵守:1. 每个关键事实后面用括号标注来源;没有来源的,直接写「未证实」。2. 不确定的地方写「不确定」,不要推测填补。3. 涉及金额、日期、人名、引用的内容,单独列一节「需要人工复核」。

这三条加进去之后,你会发现输出变短了、变「笨」了一点——对,因为它不再替你编东西了。一个愿意说「不知道」的 AI,比一个什么都敢答的 AI 有用得多。

资讯 02

语音 Agent 进入「边说、边想、边干活」时代

Google DeepMind 发布了 Gemini 3.8 Live,标准版和 Extended Thinking 版都是端到端实时语音模型。关键变化在于:前台对话不中断,后台同时在异步调用工具、跑多步推理。

它还支持 97 种语言对话中途自动切换、近实时视觉输入。Extended Thinking 以 82.6 分登顶 Artificial Analysis 语音质量榜,定价约是 OpenAI 同类的一半以下。

同一天,Anthropic 也动了刀:把 Chat、Cowork 代理工作区、Artifacts、Design 并成单一界面,系统自动判断任务类型并调用工具,同时新增 Claude Docs 和 Claude Slides(可导出 PPT / PDF)。

两条新闻的共同方向很清楚:Agent 正在从「你问它答」,变成「你边说它边做」。

一个副作用要留意:统一入口意味着长程代理任务变成了默认行为——你随口一句话,它可能在后台连着跑十几步。配额消耗和权限敞口都会上升。用之前先想清楚,别让它顺手动到你不想动的东西。

实操 02

语音 Agent 怎么用才顺手

用法一 走路时口述

想到就派活,别等回到电脑前。通勤路上把要查的资料、要写的提纲一次性说清楚,回到工位结果已经在那儿了。这是语音比打字最大的优势:你可以边走边说,它边听边做。

用法二 会中实时记录

边听边整理,散会直接出纪要。比起会后听录音,实时整理的好处是它知道哪句是结论、哪句只是闲聊。

用法三 通勤时下发长任务

耗时的活(跑调研、整理数据、生成初稿)适合上下班路上丢过去,到公司或到家正好收结果。

用法四 边说边纠偏

这是新增的能力,也是最容易被忽略的。发现方向不对,直接开口打断——「不用查了,换个方向」——它不用你重写指令。所以别一次性把话说满,留出改口的空间。

一句话总结:语音 Agent 是「边说边想边干活」,不是「说完再等你」。理解这个差异,用法就完全不一样了。

资讯 03

中国大模型调用量,连续 20 周超过美国

据 OpenRouter 数据,9 月 7 日到 13 日这一周,全球大模型周调用量 127 万亿 token,其中中国模型接近 61.2 万亿,在前十中占据至少 7 席,合计份额超过 70%。DeepSeek 以 25.4% 的份额升至厂商第一。

更能说明性价比的是这组数字:刚发布的 DeepSeek V4.1 Flash(552B MoE、激活 8B)上线 24 小时处理约 1 万亿 token,任务成本中位数只有 0.07 美元

但也要看清楚另一半:能力榜前五仍然由海外模型占据,国产里排最前的是智谱 GLM-5.3(第 7)和 Kimi K3(第 9)。

这说明什么?「最强」和「最常用」已经是两件事了。真正跑在业务里的,往往是那些够用又便宜的模型。所以关键不是选一个最好的,而是知道什么活该交给谁。

实操 03

把贵任务拆成便宜任务

大部分人的做法是:一个任务从头到尾用一个模型。贵的那个贵得心疼,便宜的那个又怕不够用。其实可以拆开。

规划层 用旗舰模型,但只调用一两次

让它拆任务、定结构、定口径。这部分最考验判断力,值得花钱,但调用次数很少。

执行层 用 Flash 或开源模型,调用几十次

按大纲逐节填充、扩写、格式化、批量改写。这部分是纯体力活,占掉 90% 以上的 token 量,交给便宜的模型完全够。

校验层 换一个模型,调用两三次

专门让它挑错、查数字、找前后矛盾。用不同的模型是为了避免「自己检查自己」的盲区。

举个具体例子:写一份行业周报

规划层(旗舰,1 次)——列出四节大纲,明确每节要回答什么问题、数据口径是什么

执行层(Flash,20 次以上)——逐节填内容、改写语气、统一格式

校验层(另一个模型,2 次)——查数据一致性、找逻辑断裂、标出需要人工核实的点

同一份产出,成本通常能砍到三分之一以内,质量反而更稳——因为最后那道校验是独立视角,它不会替你遮掩前面的错。

最后,三条边界

一、署名是你的,责任就是你的

AI 出的东西,发出去之前必须过一遍眼。这条在 AI 会「跑偏」之后更成立了。

二、能自己动的权限,要收着给

Agent 越自主,默认权限就越危险。付款、删除、对外发布、改权限,一律留人工那一关。

三、把「说不知道」当成一个指标

如果你的 AI 从来不承认不确定,那它一定在某个地方替你填了坑。

回头看这两天:一边是语音 Agent 从「聊天」升级成「持续运行的个人助理」,一边是 OpenAI 承认对齐问题还没解决。

这两件事不矛盾,它们是同一枚硬币的两面。能力越强,对「可信」的要求就越高。

我们能做的其实不多,也很具体:让它交出处、允许它说不知道、关键的地方自己再看一眼。听起来不够性感,但这三件事,比换一个更强的模型有用得多。

觉得有用,点个「在看」,转给同样在摸索 AI 的朋友

相关学习资料