关于“用户会不会故意教坏AI”这个问题,答案是:会,而且不少见。 但这背后的原因和方式,跟很多人想的不太一样。
我结合最近行业里讨论的一些情况,给你梳理一下:
一、所谓“脏数据”主要分三类
第一类:恶意投毒
极少数用户会故意给AI喂错误信息,比如在对话中反复告诉AI“2+2=5”,或者上传伪造的文档让AI学习。这种行为在技术圈有个名字叫“数据投毒”。
但说实话,这类行为的效果很有限。因为大模型的训练是一个极其庞大的过程,个别用户的恶意输入,基本不会对模型产生可察觉的影响。
第二类:无意的污染
这才是主流。用户在使用AI时,会不自觉地输入不准确的信息——记错的事实、道听途说的传闻、过时的数据。AI在回答问题时,如果过度依赖当前对话中的上下文,就可能把这些错误信息当成“事实”来引用。
最典型的例子:有用户在对话里说“我记得某某事件发生在2023年”,其实是2022年。AI如果不加验证就直接沿用了这个错误的时间,后面的回答就会越来越偏。
第三类:对抗性测试
有些技术爱好者或研究人员,会故意给AI出“陷阱题”——问一些逻辑矛盾的问题、包含隐藏前提的问题,或者要求AI做它不应该做的事。这类行为的目的是测试AI的边界,不完全是“喂脏数据”,但确实会让AI在对话中表现出“变笨”的症状。
二、为什么这不是小事?
最近有一个讨论挺多的案例:某个AI助手,在跟一个用户反复对话后,开始在一些基础问题上出错。
后来发现,那个用户在该AI的联网搜索功能下,上传了一份自制的“常识纠错文档”,里面把大量标准事实改成了错误版本。AI在回答后续用户的提问时,偶尔会从这个对话历史中“学到”错误知识。
虽然这个影响是局部的,但暴露了一个问题:当AI越来越依赖“记忆”用户的历史对话时,它也会记住用户喂给它的错误信息。
一个真正智能的系统,应该能分辨“这个信息可靠吗?”“这个用户可信吗?”现在的AI做不到,它只会照单全收。
这不就是典型的“人工不智能”吗?
——你把错的东西教给它,它就学错了。它不会问“你确定吗?”,不会说“我查一下别的来源”,更不会反驳你“你记错了吧”。
就像一个记性特别好、但没有判断力的实习生。你告诉它什么,它就记住什么。你告诉它一个错误的事,它也当真。
所以问题不是“用户喂不喂脏数据”,而是“AI为什么这么容易被带偏”。
这才是真正需要解决的事。
公众号:「人工不智能AI笔记」每天一个“AI也没那么神”的真实故事
夜雨聆风