ARTICLE · 1043309
复核一遍不算核验:AI 结果的四道关
匿名 · 电力电子方向在读博士 · IEEE 期刊审稿人
AI 有一个共同特征:它失败的时候大多不报错。数字错一位不报错,引用张冠李戴不报错,文档里写的做法和代码里真实的做法不一致也不报错。既然错误是静默的,「它看起来很确定」就不能当成通过依据。
我最后沉淀下来的判断只有一句:能不能核验,取决于手里有没有第二个独立来源。 这篇把实际在用的四道关写出来,每一道都给出可以照做的动作。
把同一份材料再看一遍,是复核。把同一个问题再问一遍同一个模型,也是复核。这两种动作的通过率很高,但信息量为零,因为它和原来的判断来自同一个来源。
- 同源复核的「通过」是虚的。
一份材料不会指认自己哪里错。 - 证据要正交。
三个检查如果都出自同一次生成,那只是一条证据重复了三遍。 - 能核验的前提是有产物。
看不到产出物的环节,「检查」无从下手,也就不该外包出去。
让 AI 写数值实现时,最不可靠的证据恰恰是最常被当证据的两样:跑得通,和曲线看着对。
前面写过一类很典型的失败:一段解析推导落地成代码,公式原样搬进去,结构无可挑剔,跑起来也不报错,只是其中一个输出量偏了 27.8%,另一个完全正确,而人最先核验的正好是后者。还有一类是校验点全部落在分支之外,某条特殊分支一次都没跑到,里面的系数被写错了也没人发现。
这两次的共同点是:问题不是靠「再看一遍代码」发现的。 它要么靠解析极限对不上,要么靠第二条独立实现走不到同一个值,才暴露出来。所以这道关的动作只有两条:动手前先写下至少一个可解析验证的极限当守门人;参数区间与分支的覆盖范围由人来划,并且覆盖点必须落在你真正使用的那一段里。
AI 生成的关系型事实,也就是谁写的、发表在哪个卷、哪一年、作者顺序,有一个很稳定的特征:主标题几乎总是对的,卷年、页码、作者顺序经常错。 标题对上了会让人整体放松,剩下几项就不再看了。
核验的做法是分层取证:先查注册机构的元数据,再找一个独立的数据源,最后回出版方原文。三层里只要有一层对不上,就把两个值都记下来,不要静默挑一个。这一点在写综述和核引用时尤其重要,因为错的那一项通常不影响读者读懂,所以也没人会去纠正它。
这一道关最容易被跳过,因为它看起来最不需要技术含量。但我真实踩到的坑,几乎都集中在这里。
这三条指向同一个动作:凡是会生成实物的环节,抽检实物本身。 图片扫文字,表格扫数字,文档扫署名与单位。
顺带一条经验:同类文件做一致性检查时,哈希比对比「看起来一样」快得多,也硬得多。镜像、副本、导出件这种成套存在的东西,值得全部过一遍哈希。
- 改动不一定全部生效。
在同一个文件里连续改多处时,我遇到过只有一部分改动落盘、而操作返回成功的情况。之后的动作变成:每处改完立刻回读那一处,不攒到最后一次性检查。 - 长文档有自己的体积上限。
一份工作笔记写到某个体积之后被上游截断,前半段还在,后半段安静地消失了。所以笔记要量体积,细节下沉到独立文件,主文件只留那份「必须懂的最小集」。
还有两条边界要说清楚。
第一,当核验成本高于收益时,正确的动作是缩小使用范围,而不是加更多检查。 一个环节如果每次都要花两小时才能核完,它就不适合进日常流程。把它限定在「只做草稿、不进定稿」的位置上,比加三层检查更划算。
第二,拿不到产物、或者内容本身不能外传的环节,不要外包。 没有产物就没有核验入口,这时候「先交给 AI 试试」只是把不确定性往后推了一步。
- 每个 AI 产物先问一句:我用什么独立来源能推翻它。
答不上来就别直接采信,先缩小它的用途。 - 可解析的极限先定下来,再让 AI 写代码。
它是每次改动之后第一个要看的守门人。 - 校验点的覆盖范围由人划
,且必须覆盖你真正使用的那段参数与每一条特殊分支。 - 生成的实物一律肉眼抽检
(文字、数字、署名、单位),不要只看日志和返回值。参数与产物一起留档。 - 改文件后立刻回读,长文档量体积。
返回成功不等于生效,写得长不等于都在。
四道关加起来其实只回答一个问题:这个结论,除了 AI 自己,还有谁能替我复算一遍。 有,就可以放心用;没有,就只做到「草稿」为止。
你手里最管用的一条核验动作是什么,欢迎说说。