夜雨聆风学习资料网

ARTICLE · 1043309

复核一遍不算核验:AI 结果的四道关

复核一遍不算核验:AI 结果的四道关
匿名 · 电力电子方向在读博士 · IEEE 期刊审稿人

AI 有一个共同特征:它失败的时候大多不报错。数字错一位不报错,引用张冠李戴不报错,文档里写的做法和代码里真实的做法不一致也不报错。既然错误是静默的,「它看起来很确定」就不能当成通过依据。

我最后沉淀下来的判断只有一句:能不能核验,取决于手里有没有第二个独立来源。 这篇把实际在用的四道关写出来,每一道都给出可以照做的动作。

核心判断:复核和核验不是一件事

把同一份材料再看一遍,是复核。把同一个问题再问一遍同一个模型,也是复核。这两种动作的通过率很高,但信息量为零,因为它和原来的判断来自同一个来源。

核验是换一个独立来源重新得到一次结论,再回头看两次是否一致。由此有三个推论:
  • 同源复核的「通过」是虚的。
     一份材料不会指认自己哪里错。
  • 证据要正交。
     三个检查如果都出自同一次生成,那只是一条证据重复了三遍。
  • 能核验的前提是有产物。
     看不到产出物的环节,「检查」无从下手,也就不该外包出去。
第一道关:数值与代码,看独立来源,不看结果

让 AI 写数值实现时,最不可靠的证据恰恰是最常被当证据的两样:跑得通,和曲线看着对

前面写过一类很典型的失败:一段解析推导落地成代码,公式原样搬进去,结构无可挑剔,跑起来也不报错,只是其中一个输出量偏了 27.8%,另一个完全正确,而人最先核验的正好是后者。还有一类是校验点全部落在分支之外,某条特殊分支一次都没跑到,里面的系数被写错了也没人发现。

这两次的共同点是:问题不是靠「再看一遍代码」发现的。 它要么靠解析极限对不上,要么靠第二条独立实现走不到同一个值,才暴露出来。所以这道关的动作只有两条:动手前先写下至少一个可解析验证的极限当守门人;参数区间与分支的覆盖范围由人来划,并且覆盖点必须落在你真正使用的那一段里。

第二道关:事实与元数据,两层不够就三层

AI 生成的关系型事实,也就是谁写的、发表在哪个卷、哪一年、作者顺序,有一个很稳定的特征:主标题几乎总是对的,卷年、页码、作者顺序经常错。 标题对上了会让人整体放松,剩下几项就不再看了。

核验的做法是分层取证:先查注册机构的元数据,再找一个独立的数据源,最后回出版方原文。三层里只要有一层对不上,就把两个值都记下来,不要静默挑一个。这一点在写综述和核引用时尤其重要,因为错的那一项通常不影响读者读懂,所以也没人会去纠正它。

第三道关:成品要亲眼看,日志和返回值不作数

这一道关最容易被跳过,因为它看起来最不需要技术含量。但我真实踩到的坑,几乎都集中在这里。

遇到过的静默错误
表现
唯一能发现它的方式
模板里一个文字字段漏填
出图完全正常、不报错,但成品上印着一句与本文无关的旧句子
看成品
文档写法与实现脱节
文档、脚本清单、定时任务配置共五处还写着「复用某个通用脚本」,而实际脚本早已另建
文档与实现对读
产物参数没有留档
隔了几天按印象重建,三项参数全错
重建前先回读旧产物

这三条指向同一个动作:凡是会生成实物的环节,抽检实物本身。 图片扫文字,表格扫数字,文档扫署名与单位。

顺带一条经验:同类文件做一致性检查时,哈希比对比「看起来一样」快得多,也硬得多。镜像、副本、导出件这种成套存在的东西,值得全部过一遍哈希。

第四道关:改动有没有真的落盘,长文档有没有被截断
上一道关管的是输出的内容,这一道管的是「我以为已经变了的那些东西」。
  • 改动不一定全部生效。
     在同一个文件里连续改多处时,我遇到过只有一部分改动落盘、而操作返回成功的情况。之后的动作变成:每处改完立刻回读那一处,不攒到最后一次性检查。
  • 长文档有自己的体积上限。
     一份工作笔记写到某个体积之后被上游截断,前半段还在,后半段安静地消失了。所以笔记要量体积,细节下沉到独立文件,主文件只留那份「必须懂的最小集」。
坑与边界:哪些动作是假核验
假核验(做了等于没做)
真核验
再问一遍同一个模型,看它答得是否一致
换一个独立来源,重新得到一次结论
看日志显示成功
看产物
抽一个点验证通过
覆盖每条分支,并落在实际使用的参数区间内
三个检查都过了
三条检查来自三个不同来源,才算三条证据
按印象重建旧产物
先回读旧产物,照抄参数

还有两条边界要说清楚。

第一,当核验成本高于收益时,正确的动作是缩小使用范围,而不是加更多检查。 一个环节如果每次都要花两小时才能核完,它就不适合进日常流程。把它限定在「只做草稿、不进定稿」的位置上,比加三层检查更划算。

第二,拿不到产物、或者内容本身不能外传的环节,不要外包。 没有产物就没有核验入口,这时候「先交给 AI 试试」只是把不确定性往后推了一步。

可执行清单
  1. 每个 AI 产物先问一句:我用什么独立来源能推翻它。
     答不上来就别直接采信,先缩小它的用途。
  2. 可解析的极限先定下来,再让 AI 写代码。
     它是每次改动之后第一个要看的守门人。
  3. 校验点的覆盖范围由人划
    ,且必须覆盖你真正使用的那段参数与每一条特殊分支。
  4. 生成的实物一律肉眼抽检
    (文字、数字、署名、单位),不要只看日志和返回值。参数与产物一起留档。
  5. 改文件后立刻回读,长文档量体积。
     返回成功不等于生效,写得长不等于都在。

四道关加起来其实只回答一个问题:这个结论,除了 AI 自己,还有谁能替我复算一遍。 有,就可以放心用;没有,就只做到「草稿」为止。

你手里最管用的一条核验动作是什么,欢迎说说。

相关学习资料