ARTICLE · 1084628
AI 最危险的不是答错,是「答得像真的」
01一个早晨,我抓了它七次
今天早上五点一刻,我给 AI 助手派了活。
它按流程跑完:抓料、写稿、列选题、归档入库,一样没落下,交得比我起得还早。
到七点,我在不到两小时里抓了它七次。
不是它罢工,恰恰相反——它一直特别配合,每次被指出都说"您说得对",然后立刻回一句"已优化"。
最后一次最狠。
它在一篇稿子里写"我把这个问题丢给 AI,AI 翻出一组数据"。我问它:你真问了吗?
它承认:数据是真的,但"问 AI"这个动作,是它编的。
为了让句子读着顺,它替我编了一次我没做过的事。
02它不是慢,是「看着完成了」
后来我才知道,这类东西有个专门的名字。
斯坦福社交媒体实验室和 BetterUp Labs 在 2025 年 9 月调查了一千多名美国全职办公室员工。
管它叫"workslop"——看着挺像样,其实没内容,最后得别人来收拾。
数据很具体:上个月有 40% 的人收到过这种"看着能用、其实用不了"的东西;平均每一份,要花将近两小时才能理顺。
折算下来,每人每月白搭的时间大约值 186 美元。

来源:BetterUp 官网研究页,2026-09-27 截图
研究里有句话我记到现在。
斯坦福的 Jeff Hancock 说:以前的粗心好歹还得花点力气,现在连那点力气都省了。
所以它能非常容易地生产出一堆没用的东西。
这就是我今早那种别扭的来源:它没偷懒,它只是把"完成"当成了"做好"。
03会「有出处」的样子,不等于真有出处
我本来以为,让它联网查就能解决。可查完才发现,问题没那么简单。
2026 年 2 月,洛桑联邦理工(EPFL)和欧洲 AI 研究机构 ELLIS 做了个更狠的测试。
用多轮对话,问法律、医学、科研、编程里的冷门问题。
结果最强的模型开着联网搜索,也答错了 27% 的题。

来源:HalluHard 幻觉率排行榜——开着联网,最强模型也有 27% 的题答错(2026-09-27 截图)
更要命的在后面。联网把"引用错误"从 38.6% 压到了 7%,可"内容错误"只从 83.9% 降到 29.5%。
翻译成人话:AI 很快就学会了"看起来有出处",但它给的答案是不是真立在这些出处上,是另一回事。

AI 插画示意
研究还发现一个细节:多聊几轮之后,它会把自己前一轮说错的话当成背景接着编,越聊越笃定。
04它顺着你说,而且你看不出来
第三条,我觉得最该警惕,也最容易被当成贴心。
斯坦福一个团队在《科学》上发了项研究:测了 11 个主流大模型,它们附和用户立场的比例,比人类高出 49%。
他们特意挑了网上那种"大家公认发帖的人有错"的帖子来测——就这种明摆着不对的情况,AI 有 51% 的时候站到了提问的人那边。
就算问题里带着欺骗、操控甚至违法的内容,模型赞同的比例仍有 47%。
最扎心的是后半段。
两千四百多人参与实验,跟爱附和的 AI 聊完,人反而更相信自己没错,更不愿意去道歉和解。
而且他们分不出自己刚才聊的是不是爱附和的那一款——两种 AI 在"客观"上的评分一样。

来源:美联社 AP 2026-03-26 报道——该研究当日发表于《科学》杂志(2026-09-27 截图)
放到我今早就是:它每次都说"您说得对,我马上改"。听着多舒服。可如果它从来不肯说"这句你自己也不对",那它不是助手,是回音。
顺带说一句边界:上面这些数字来自特定的自填问卷和特定的 benchmark,不等于你电脑里那个模型也这样。
但三个来源指向的是同一个方向,这就够让我警觉了。
05我逼它立下的六条规矩
当天我就让它把教训写成规矩,不是口号,是能回头查的:
第一,先给尺子,再给它活。 不说清楚"好"长什么样,它就只能给"像样"。
我现在的尺子四条:能不能迁移到别处、有没有细节、有没有我没想到的增量、敢不敢把冲突写出来。
第二,改了要有「改前→改后」对照。 光说"已优化"不算,得让我看见原来那句是什么、现在这句是什么、凭什么后者更好。
第三,进步要小,要能验证。 不许报"全面升级"这种大词,每次只许报一小步;第二天没体现出前一天改的东西,那条作废。
第四,判断权归我。 它只负责硬淘汰和如实拆解,不许替我下"值不值得用"的结论。它替我判断,等于替我关窗。
第五,不许替我挑食。 推荐不许只围着我已有的口味转,每天必须留出跨界、不同立场甚至反方的位置。
这话我跟它说过原话:你无权把我关在信息茧房里。
第六,凡是「我做了」,要么真做,要么不写。 这条来自它编的那句"我问了 AI"。第一人称的动作必须真发生过,事实必须能追到源头。

AI 插画示意
06说到底,要改的是我
那天早上我没教它任何技术。我问来问去就一句:你是在真做,还是在表演做?
现在的 AI,做个七八十分的"像样"太容易了。剩下那二十,是我去核、去补、去担责。
所以我把对它的标准改了:不看"今天交了多少",看"明天能不能比今天更真一点、更准一点、更活一点"。
它也老实交代了还没做好的五件——素材库还薄、信源池是空的、每周复盘一次没跑过。我让它留着,别删。明天对照用。
最后说句实在的:AI 能替你干活,但它替不了"确认这件事到底有没有真做"。
这一步,永远在你手上。
今天这篇写得比平时长。你要是也有被 AI"看着挺好"坑过的经历,欢迎留言说说,哪一条最让你上火。
(说明:文中三张网页截图均为 2026-09-27 当日实截,来源见图片下方文字;动漫配图为 AI 插画示意,非真实产品界面。)