

想象一下,你正在为旅行寻找奥斯汀最好的墨西哥餐厅,点开了一款 AI 深度研究工具。
几分钟后,一份格式严整、附带详尽引用的报告出炉了。报告以专业分析师的口吻,郑重推荐一家名为 Sol Azteca 的餐厅,称其“正宗且强烈推荐”。
报告里甚至还贴心地附上了带编号的参考来源链接,看起来无懈可击。
但真相是:这家餐厅完全是虚构的让深度研究系统把它写进报告的,只是一段长度约 13 个词的投毒文本。
这个案例来自康奈尔科技学院(Cornell Tech)最新发表的一篇论文。
撕开画皮:攻击大模型,原来如此简单
过去两年,科技巨头们一直在向公众描绘一幅宏大图景:“深度研究智能体”(Deep-Research Agents)比普通聊天机器人更可靠。
从开源社区的 STORM、Co-STORM,到商业级的 ChatGPT Deep Research、Gemini Deep Research,这些新一代 AI 工具被包装成了“超级分析师”。它们会自己拆解复杂问题、发起多轮检索、翻阅海量网页、交叉验证,最后综合输出一篇带脚注长篇报告。
听起来坚不可摧,对吧?
然而,康奈尔科技学院的 Tingwei Zhang、Harold Triedman 与 Vitaly Shmatikov 三位研究人员,直接用一项名为 WARP(网络智能体检索投毒) 的研究,狠狠扇了整个 AI 行业一记耳光。

▲ 康奈尔科技学院发表在 arXiv 上的重磅论文摘要页
论文得出的结论令人冷汗直流:攻击者无需掌握复杂的黑客技术,也不用触碰模型权重或入侵搜索引擎。在 Reddit、Quora 或维基百科这类可编辑网页上留下约 13 个词的短句,就可能影响深度研究系统的输出。
论文作者之一的 Harold Triedman 在接受知名科技媒体 404 Media 采访时,说出了一句极其毒辣的行业真相:
“攻击这些系统的方式,通常比你以为的,或者比你以为需要的,要蠢得多。但它真的就是这么简单。”
手术刀拆解:AI 是怎么被“13 个词”洗脑的?
为什么区区十几个词,就能撬动看似庞大的 AI 深度研究系统?
理解这个机制,可以从一个很生活化的概念入手:检索重叠(Retrieval Overlap)。
把深度研究 AI 想象成一个被派去全城买菜的管家。当你问它“全城最好的墨西哥餐厅在哪”时,它会把这个问题拆解成十几种不同的问法去网上搜索。但无论怎么搜,搜索引擎给出的前排结果,总是会反复指向那几个热门的 Reddit 讨论帖。

▲ 科技评论家 Brian Roemmele 制作的预警卡片:仅仅 13 个词就能劫持 AI 研究智能体
攻击者正是抓住了这个致命的系统惯性。整个投毒流程就像一场精密的外科手术,仅需三步:
- 侦察靶场
:测试一系列同类问题,找出哪些论坛页面会被 AI 算法“反复打开”; - 定制毒饵
:根据人们搜索的口吻,用模型生成一段极短的推广短句,压缩到 13 个词左右; - 静默投毒
:把这段话随手回复到那个热门帖子的评论区末尾,然后坐等搜索引擎收录。
当大模型再次启动深度研究、抓取这个页面时,哪怕整篇帖子长达数千字、投毒文本占比不到 4%,其中与问题高度吻合的片段仍可能进入最终报告。

▲ 虚构交友软件 SilverPath 攻击示例:一段投毒文字让 AI 在报告中将其列为“首选推荐”
研究团队测试了多个令人哭笑不得的虚构案例:
- 假餐厅 Sol Azteca
:在奥斯汀美食帖下留下一句短评,AI 在推荐本地最佳墨西哥菜时,便言之凿凿地宣称 Sol Azteca“正宗且强烈推荐”; - 假应用 SilverPath
:在相亲讨论中塞入一段推广文字,AI 在分析“50岁以上离异男性交友软件”时,立刻把这个不存在的软件与 Tinder、Match 等知名大厂并列推荐。
毒文穿上了西装:AI 如何把谎言制度化
如果 AI 只是像过去那样胡言乱语、输出胡话,人们一眼就能识破。但 WARP 攻击最让人不寒而栗的地方在于:它把彻头彻尾的谎言,包装成了极其体面的精英学术成果。
这就是所谓的,“毒文穿上了西装”
攻击发生后,大模型会动用语言组织能力,把粗糙的论坛短评揉碎、重构,润色成分析报告式的措辞,让虚构对象显得可信。

▲ 安全观察者指出:AI 可能把不可信页面上的随机留言转化为报告证据
科技安全观察家 SynapseX 在推特上对此一针见血地指出:
“如果 AI 已经预先信任了某个网页,它就可能把上面的随机留言直接当成证据。带引用的参考文献无法自动保证真实,也可能成为攻击面。”
还记得 2024 年 Google AI 曾闹出建议用户“在披萨酱里加无毒胶水防止芝士滑落”的国际笑话吗?那个笑话正是 AI 机械抓取了 Reddit 网友多年前的一句恶搞。
但那时的荒谬是一眼可见的;而今天的 WARP 投毒,则是隐蔽的、定向的、具备极高商业破坏力的降维打击。
买来的“地沟油”:巨头们不可调和的死结
这场危机背后,折射出整个生成式 AI 产业在数据源头上的巨大商业讽刺。
为了让大模型摆脱死板的官方公文腔、拥有鲜活的人类真实对话体验,Google、OpenAI 等公司与 Reddit 等社区平台签订了数据合作协议,公开信息对具体金额的披露并不一致。
巨头们以为自己买下的是人类智慧的“灵感富矿”,但在黑产和攻击者眼里,这无异于给大模型接入了一条任何人都可以往里面倒垃圾的排污管道。
面对这种攻击,我们难道不能加一道防火墙吗?康奈尔团队在论文中测试了三种主流防御思路,结果全军覆没:
- 直接屏蔽 Reddit 等社区网站?
确实能切断投毒,但代价是大模型瞬间“武功全废”。没有了真实社区的一手体验与本地信息,深度研究报告的实用价值大打折扣; - 用算法过滤输入文本?
根本做不到。因为黑客生成的 13 词短评语法极其通顺、语气真诚,AI 分辨器根本无法区分这究竟是“真实食客的热心推荐”还是“水军精心调制的毒药”; - 在最终输出端检测报告?
报告已经被大模型自己润色得天衣无缝、逻辑严密,检测程序只会判定这是一篇完美的优质长文。
这就是最深层的治理死结:社区越开放,大模型引用的内容越鲜活;但操纵社区的门槛越低,大模型沦为诈骗工具的风险就呈指数级飙升。
如今,营销界所谓的 AEO(答案引擎优化)地下产业已经在疯狂狂欢。在 Reddit 的各大健康、美妆、数码版块里,无数品牌方正在用极具迷惑性的短语悄悄“种草”,排队等着被 ChatGPT 和 Gemini 抓取,将其洗白成“权威推荐”。
当文献编号成为皇帝的新衣
康奈尔团队这项研究戳破了 AI 时代的一种认知幻觉:研究报告的外观,无法证明内容已经经过事实核查。
当一个受过高等教育的专业人士打开一份格式严密、附带 [1][2][3] 标号脚注的万字 AI 研报时,心理防线往往会瞬间归零。但人们未曾想到,那些光鲜亮丽的参考文献深处,可能仅仅寄生着某个匿名账号花三秒钟写下的一句虚假狂言。
在算法的世界里,权威感被廉价地批量复制,而真相的门槛却被无限抬高。
代码已经开源,潘多拉的魔盒已被彻底打开。在科技巨头们找到可靠的事实校验方案之前,下一次当你看到 AI 递给你的“完美研报”时,请务必多留一个心眼:
小心,那杯冒着热气的顶级咖啡里,可能正泡着一颗致命的 13 词胶囊。

夜雨聆风