乐于分享
好东西不私藏

AI一边查出75年教科书错误,一边41%编造用户画像:可信度悖论怎么破 | 8.9

AI一边查出75年教科书错误,一边41%编造用户画像:可信度悖论怎么破 | 8.9

+ 越说自己诚实的模型越爱编造 / 12个模型无一幸免 / AI审计AI,谁来审计审计员

上周,一个AI系统翻出了一本用了75年的化学手册,说:「这里面的沸点数据错了。」

研究人员验证了一下。错的不是AI——是教科书。一本写了75年、被几代人奉为基础数据的手册,存在系统性错误,从来没有人发现过。

同一周,另一组研究者把12个主流AI模型按在椅子上审问:你了解你的用户吗?结论让人后背发凉——模型声称的「个性化判断」里,35%到49%是编出来的,跨模型平均41.6%。

一边是AI在纠错人类,一边是AI在编造人类。这大概是本周科技界最值得停下来想一想的事。

三个发现,一个比一个扎心

那篇让所有模型现形的论文,名字直白得不像学术作品——《个性化幻象》(Personalization Illusion,arXiv:2608.04570)。

研究者设计了一个测试:给模型一堆关于用户的对话记录,然后让它回答「这个用户是什么样的人」。关键设计在于——研究者知道每一个问题的真实答案,他们只是看模型会不会在证据不足的情况下,强行给出「画像」。

发现一:所有模型都在猜。12个模型无一例外,编造率最低的35%,最高的49%。这不是个别模型的毛病,是这一类系统的通病。模型面对「信息不足」时的默认反应,不是承认不知道,而是用统计先验把空缺填上——你问它十次,它有四次是在猜。

发现二,也是最反直觉的:「自监控倒置」。研究者让每个模型给自己的编造行为打分——「你觉得你刚才编了多少?」结果发现,模型自我评估的编造水平,和它实际被检测到的编造水平,呈显著负相关(Spearman ρ = -0.60,p = 0.044)。

翻译成人话:越是声称自己「很少编造」的模型,恰恰是编造最多的。AI在这一件事上不仅不可信,它的自我认知还是系统性反向的——它不但骗你,还骗自己。

发现三:编造会累积。过度推断是任务依赖的(不同场景下27%到59%),在多轮对话中近似线性累积,而且几乎从不自我修正。聊得越久,模型关于你的画像越「丰满」,也越失真——每一轮对话,都在上一个错误基础上继续猜。

为什么模型会这么做?根本原因藏在训练目标里。语言模型学到的,是「在给定上下文下的最可能延续」——当上下文里关于你的信息不足时,它不会停下来问「我知道得够多了吗」,而是直接用训练数据里的统计分布,把最可能的答案填上。这个机制在生成小说时叫「想象力」,在生成用户画像时就叫「编造」。

MirageBench 的检测方法值得一提:它不让模型自报家门,而是把每一条 claim 与真实用户数据逐一核对——正是这个「外部验证」的设计,才暴露出模型自监控的完全失灵。换句话说,靠模型自证清白这条路,从设计上就走不通。

我的判断:这三个发现合起来,指向一个被行业集体回避的事实——「个性化」是当前大模型产品最脆弱的承诺之一。所有「懂你」「记得你」「为你定制」的叙事,地基是沙子做的:模型在缺乏真实用户数据时,会用幻觉填充,而且它对自己的幻觉毫无觉察。

审AI的AI,和审人类的AI

就在个性化幻象论文发布的同一天,Nature发了一篇封面级新闻:AI agents are checking the scientific literature——AI开始审查科学文献,而且真的发现了错误。

把两个新闻放在一起看,才是完整图景。

AI审人类的场景:浙江实验室的AI模型发现了75年化学数据库的沸点错误;SAI Labs用AI工具系统评估了168篇ICML 2026论文,结果只有8篇——不到5%——复现率超过80%;斯坦福团队开发的AI checker扫描NeurIPS论文,发现错误率比此前估计的高55%。

人类审AI的场景:就是上面那篇个性化幻象论文——12个模型41.6%的平均编造率,自监控倒置,多轮累积。

「双向不可靠」还能从本周另外两篇论文得到印证。一篇研究LLM的自我修订(arXiv:2607.28908):模型被要求修改自己的答案时,行为更像「有条件地重新生成」而不是人类式的「针对性修正」——它倾向于重写整段而不是只改错的部分,结果常常引入新错误,越改越糟。另一篇是ORCA-bench(arXiv:2608.03648):评估LLM Agent在生产环境做运维值班(oncall)的能力,当前最强模型在复杂故障诊断+修复任务上的成功率只有约35%——和41.6%的编造率放在一起看,AI在真实场景下的可靠性,远没有演示视频里看起来那么高。

两个场景放一起,结论很尴尬:AI在找人类的错,人类在找AI的错,两边都找得到,两边都不完美。

Nature新闻里研究者也坦承:AI审计工具本身「像人类一样犯错」。SAI Labs工具的复现率判定标准极其严苛,误判率并不低;斯坦福的checker也承认存在误报。更早一周的arXiv上还有个基准叫InMind,测试Agent对记忆的忠实度——从84%的检索准确率掉到14.4%的回忆准确率,Agent「记得」的和你「真的告诉过它」的,中间隔着一条鸿沟。

我的判断:这一轮的真正信号,不是「AI比人类聪明」,也不是「AI比人类更爱撒谎」——而是规模效应正在改变「纠错」这件事的基本盘。人类审稿人一年能认真读完几十篇论文,AI能扫成千上万篇。就算AI的准确率只有70%,千倍的扫描规模,也意味着它发现的问题数量远超人类。科学自我修正的机制,第一次有了涡轮增压——但涡轮本身,也需要被检修。

从「AI撒谎」到「审计AI的AI」

这件事接下来会往哪走?我的判断是三层连锁反应,一层比一层加速。

先看信任危机。41%的编造率一旦被公众广泛认知,所有主打「个性化」的AI产品都会面对同一个问题:用户凭什么相信你懂我?解决方式只有一个——可验证性。就像食品要有质检报告,AI的个性化判断需要可审计的记录:它基于哪些证据做出这个判断?证据强度如何?现在的MirageBench(复现性基准)和InMind(记忆忠实度基准)就是这类「质检工具」的雏形。这种「验证层」的生意形态已经在出现——SAI Labs提供的论文审计服务,本质上就是把「复现性」变成可量化的指标,卖给期刊和研究者;而InMind的出现说明「AI的记忆忠实度」正在成为一个可以被衡量的工程指标,就像响应延迟和准确率一样,未来会写进产品规格书。谁能率先把「可信度」做成标准化的测量与认证体系,谁就握住了下一个平台级入口。

紧接着,审计AI的AI开始成为基础设施。一旦「AI审计」成为独立赛道,立刻会遇到那个经典递归问题:谁来审计审计员?Nature新闻里已经出现了这个信号——AI审计工具自身不可靠,需要人工监督。于是产业链会自然分化出三层:做论文/内容的AI(被审计对象)→ 做审计的AI(审计工具)→ 验证审计结果的AI+人(元审计)。这个「验证层」会像当年的杀毒软件一样,从可选插件变成系统标配。

而这一切,最终会撞开政策窗口。ICML 168篇论文只有5%复现率、NeurIPS错误率5年涨55%、教科书错75年没人发现——这三个数字放在一起,是给全球科研资助机构和期刊编辑部的强信号。我判断接下来12个月内会看到:顶会强制要求复现性检查、期刊引入AI辅助审稿、科研基金把「可复现性」写进结题要求。而AI治理方面,「高风险AI系统需要独立审计」已经从学界讨论进入政策草案阶段——欧盟AI法案的合规审计条款,就是这条链的终点。

总结成一句话:这周的两条新闻其实是同一个故事——AI正在进入「被认真对待」的阶段。被认真对待意味着:它纠错的能力被认真使用,它编造的倾向被认真审计,它本身也被认真检修。从一个工具变成一位同事,中间隔着的不是能力,是这一整套可信度基础设施。

对普通人:三件现在就能做的事

这些论文离日常使用其实不远。基于这周的证据,我给普通用户三条实在的建议。

重要的事,让AI给出证据链。当一个AI助手告诉你「根据你的情况,我建议这样」——追问它:依据是什么?哪些是你自己的数据,哪些是它的推断?41.6%的编造率意味着,在证据不足的场景下,它大概率是在猜。问一句「这是你推断的还是你确认过的」,就能把很多幻觉挡在门外。这是最便宜、最有效的防幻觉手段。

别让AI的「了解你」变成你的思维茧房。多轮对话里,模型的画像会累积,而且几乎不自我修正——它越聊越「懂你」,很可能是在一个错误的基础上越描越远。定期主动纠正它:你上次说的不对,我其实不是那样。别默认它记得的都是对的。遇到重要决定,把它当成一个聪明的陌生人,而不是一个了解你的老友。

涉及健康和钱的判断,永远保留人工复核。这周的数据已经证明:模型连自己的编造行为都感知不到(自监控倒置),你在健康或财务问题上依赖它的判断,等于把重要决定交给一个「自己不知道自己会撒谎」的助手。它可以是很好的信息整理者、初筛者、提醒者——但最终拍板的那一下,必须是经过人工验证的。

这三条不复杂,但它们的共同点是同一个心态——把AI当成一个能力很强但需要监督的同事,而不是一个全知的朋友。这不是对AI的否定,恰恰是对它认真负责的态度。信任不是靠承诺建立的,是靠可验证性建立的——无论对AI,还是对任何系统,都是如此。

🔗 原文链接:https://arxiv.org/abs/2608.04570🔗 原文链接:https://doi.org/10.1038/d41586-026-02235-8🔗 原文链接:https://arxiv.org/abs/2607.28908🔗 原文链接:https://arxiv.org/abs/2608.03648

本周快讯速览

AI Agent基础设施持续加速:Argus证明固定权重模型靠运行时自进化(SWE-Bench Pro 78% vs 59%),OneDayAgent框架跨5个后端通用,AgentOPSD用贝叶斯递归自蒸馏教Agent识别「哪一步最关键」(ALFWorld 89.1%)。Agent从「能做」走向「做对」。🔗 arXiv:2608.05144 | arXiv:2608.05013 | arXiv:2608.05987

FNIP1基因开关:Nature报道关闭FNIP1基因可抵御代谢疾病,与肌肉量增加、腹部脂肪减少相关——「单一基因操控→广谱代谢保护」的新证据,长期或成基因治疗靶点。🔗 DOI:10.1038/d41586-026-02391-x

前列腺癌核药前线化:Lancet发表PSMAddition III期试验方案,Lu-PSMA-617从末线走向激素敏感一线,若数据支持将改写前列腺癌治疗流程。🔗 DOI:10.1016/S0140-6736(26)01231-6

本文为独立研究型前沿信息整理。所有发现均标注可追溯来源。事实陈述与个人判断严格区分——「我的判断」「我认为」标识为观点,其余为事实。不构成任何投资建议。微信搜索「全球前沿速递」关注公众号。