转载自“中国新闻出版传媒商报”公众号
一本几万字的书稿,交给AI审校,它到底能找出多少问题?今年7月,12本书稿被同时送进8款AI工具进行审校测试,工具涵盖通用大模型和出版专业工具,原错误总数统一设定为1292处,考察检出率、误报率和参考答案核查能力。结果出来,通用大模型的差距比预想的大。
检出率不是问题,误报率才是
测试里的通用大模型,检出率的数字看起来并不难看,但误报率几乎让这个数字失去意义。某短视频平台旗下AI检出率18.03%,误报率71.34%——它检出的问题里,超过七成是不存在的错误。某推理大模型检出率13.54%,误报率71.64%。某电商平台旗下AI检出率13.62%,误报率57.79%。误报率最极端的是某传统出版技术厂商AI,检出总数高达13195条,误报率97.52%,几乎把整本书都标成了问题,编辑拿到这份报告根本无从下手。
对编辑来说,一份误报率七成的审校报告,意味着要花大量时间逐条核实排除误报,反而比自己从头审更费事。通用大模型的问题不在于它找出了多少,而在于它误报了多少——这两个数字必须放在一起看,才不会被一个看起来还行的检出率带偏。同一批稿件,墨宝检出率47.62%,是这组测试里检出率最高的工具,比通用大模型高出一倍以上。误报率52.81%,在检出率同等靠前的工具里也是最低的。差距从数字上已经看得很清楚。

“出版专用”四个字,不是贴个标签就够了
定向面向出版场景的工具,表现普遍好于通用模型,但彼此之间的差距同样值得正视。有的工具误报率控制得不错,检出率却偏低;有的检出率提上去了,误报率又随之攀升。两个指标同时做好,并不容易。

差距最清楚的地方,是参考答案核查。教辅编辑都知道这件事的分量:一套练习册,正文审完,题目审完,参考答案还要重新核一遍。这不是查错别字,是要真正理解题目和答案之间的关系,涉及知识准确性。这次测试里其他AI产品在参考答案核查一栏全部空白——这项能力,它们根本没有。有工具答对率在55%至75%之间,墨宝1534条期望做题数答对1320条,答对率86.05%。
墨宝在这组测试里成绩相对突出,背后有几个原因。它的训练语料来自大量真实出版书稿,覆盖少儿、教辅、社科等多个品类,模型对出版规范、行业惯例和格式要求的识别,建立在这些真实数据之上,而不是通用文本。针对出版场景的特殊需求,拼音、公式、图片说明、参考答案等专项能力也经过定向训练。此外,过去一年多时间里,墨宝持续参与真实书稿的审校实测,每次比赛暴露的问题,都会在下一个版本里修补——这种在真实业务里打磨的过程,通用大模型很难复制。
对教辅编辑而言,参考答案核查能力的有无,比检出率高低更先决定工具值不值得打开。“出版专用”四个字不是贴个标签就够了——深耕哪类书稿、积累了多少行业语料、对出版格式和专业知识建立了多细的识别能力,才是真正的门槛所在。

效率的账,要放在误报率里一起算
检出率和误报率之外,还有一组数字同样值得关注。今年7月的审校实测中,同样完成一份少儿读物、同样达到万分之六以内的质量标准,使用墨宝完成用了122分钟,使用其他工具的编辑完成同一份稿件用了356分钟,少儿读物组单独测算提效2.92倍。234分钟的差距,比一句“效率提升”更容易理解。
但这234分钟的前提,是误报率在可接受范围之内。如果误报率超过七成,编辑还要花时间逐条排查,效率的账就完全不一样了。工具真正能省时间,不只看它找出了多少,还要看它是否制造了新的麻烦。这也是这次横向测试最直接的结论:出版审校不是通用大模型套个出版外壳就能做好的事,行业数据、专业知识和格式规范的积累,才是让工具真正进得了编辑流程的东西。
通用大模型不是不能用,而是用错了地方
让一个从未系统接触过出版规范的工具去审一本教辅,它能找出错字,却不知道这道题的答案印错了;它会标出异常,却不知道这个破折号在这里是对的。误报率九成、七成,不是工具不够聪明,是它根本没在出版这个语境里待过。
出版审校需要的,是真正在这个行业里磨过的工具。磨过,意味着见过足够多的真实书稿,见过少儿读物里的拼音陷阱,见过教辅答案里藏着的知识性错误,见过格式规范里那些只有编辑才懂的细节;也意味着犯过错、被指出来、改了再来。这个过程,不是调一次参数就能跳过的。
1292处错误,8款工具,答案已经摆在那里。

*推广
校 对:马 葵
编 辑:林 晨
复 审:张维特
终 审:倪 成
夜雨聆风