ARTICLE · 1114116
AI已经开始评价论文:九个平台,谁真正读懂了创新?
一篇论文写完,上传PDF,等几分钟,AI就送来一份审稿意见:创新性如何,方法有什么漏洞,适合投什么期刊,甚至给出一个分数。
这件事已经发生了。
吴恩达和合作者推出了 Stanford Agentic Reviewer。西湖大学张岳团队开发了 DeepReview、DeepReviewer。国内的维普、万方也把智能评审和科研诚信筛查做成了产品。
乍看之下,论文评价似乎终于可以摆脱“等审稿人等三个月”的日子。
但我更想问一句:机器究竟在评价什么?
我梳理了九个代表性系统。它们都与“论文评价”有关,做的却是几种不同的工作。
第一类:像审稿人一样提出意见
1. Stanford Agentic Reviewer:给作者一轮快速反馈
这是吴恩达与 Yixing Jiang 推出的免费工具。作者上传英文论文PDF,填写邮箱,还可以指定目标会议或期刊;系统检索 arXiv 上的相关研究,生成审稿意见和修改建议。网站目前标明:文件不超过10MB,只分析前15页。团队报告,在一项针对 ICLR 论文评分的测试中,AI与人工评分的相关性接近两位人工审稿人之间的相关性。
它的优势是反馈快,能把论文放到相关文献中讨论,而不只是凭模型记忆“点评”。局限也写在官网上:目前只支持英文,arXiv 文献覆盖较好的AI领域更适合它;评价可能出错。评分相关性接近人工,并不等于已经能够取代同行评审。
访问:paperreview.ai。
2. DeepReviewer:把批评指向论文中的具体位置
西湖大学团队的初版 DeepReview,把审稿拆成创新性核验、多维评价、可靠性核验等环节,并公开了论文、代码和模型。2026年发布的 DeepReviewer 2.0 更强调可追溯:先梳理论文主张、证据与风险,再检索文献,把批评意见锚定到具体内容,提出后续核查事项。团队明确将其定位为辅助工具。
它值得关注的地方,是试图回答“你凭什么说这篇论文有问题”。但模型的训练和测试主要围绕计算机领域会议论文,跨学科表现仍需检验;一条有出处的批评,也可能建立在不恰当的比较对象上。
访问:团队的 AiraXiv在线演示可上传PDF体验AI评审;DeepReviewer 2.0代码及技术报告可供研究者进一步查看。在线演示提供多个审稿选项,使用时应留意所选版本。
3. Sakana AI Automated Reviewer:让机器参与研究循环
日本 Sakana AI 的 The AI Scientist 能提出研究想法、运行计算实验、撰写论文,并用 Automated Reviewer 评估生成的稿件。其公开方案综合多份模拟评审意见形成判断,代码已经开放。
它的价值在于展示一种完整的“研究—评价—修改”循环。问题也随之而来:如果系统越来越擅长写出自己的评价器喜欢的论文,分数提高能证明知识真的前进了吗?已有独立研究指出,该系统早期版本在新颖性判断、实验执行和引文准确性方面存在明显缺陷。
访问:项目代码。这是需要自行部署的研究系统,不是打开网页即可上传任意论文的公众审稿服务。
第二类:告诉作者论文适合投哪里
4. PASS:把稿件放回它所属的文献脉络
近期公开的 PASS 面向论文理解与期刊推荐。它提取稿件的研究问题和主要贡献,检索邻近文献,再给出投稿期刊建议及新颖性、影响潜力等分析。研究团队在16个生物医学领域的预印本样本上报告:系统首位推荐命中最终发表期刊的比例为50.3%,前五位为86.1%。
它比只拿标题、摘要匹配期刊范围的工具更进一步:先看论文与已有研究的关系,再谈投稿位置。但请记住,猜中论文最后发在哪里,不等于判断出论文有多大创新。期刊归宿还受选题范围、编辑选择和投稿策略影响。
访问:ratemypaper.ai;网页提供稿件分析入口,也支持粘贴题目、摘要等内容。
第三类:检查质量与诚信风险
5. 维普斟知智评:给投稿前的论文做多维预评
维普官网的“AI智评—期刊版”面向投稿作者,分析论文合规性、研究质量和论文要素,提供不同形式的评价报告,并区分实验研究、理论思辨、文献综述等论文类型。维普斟知公开介绍的技术路线是“数据+模型+指标”,用于辅助稿件筛查。
它的优势是贴近中文论文与国内投稿场景,作者可以在送审前发现论证、结构和规范问题。局限在于:多维报告容易让人觉得“分数很全面”;每一维的判断依据、跨学科有效性,还需要更多公开检验。官网也明确提示:智评不等于查重或AIGC检测。
访问:维普官网期刊版入口。
6. 万方文察:更擅长发现需要复核的风险线索
万方文察把文本相似、图像复用、AI生成文本、参考文献和作者风险等检查放在同一平台。其公开资料介绍了文本比对、图像特征匹配以及科研诚信信息关联等技术。
它的强项是批量、持续地发现人工容易漏看的异常,尤其适合期刊和机构的前置筛查。但“图片相似”可能有合法解释,“检测到AI文本风险”也不能直接证明作者造假。系统给出的是核查线索,认定仍需原始材料和专业调查。
访问:万方文察;网站列有机构与个人服务入口。
第四类:只评价论文质量的某个侧面
7. SciScore:检查方法报告是否足够透明
SciScore 主要服务生命科学论文。它用文本分析识别方法部分是否交代随机化、盲法、样本量等信息,也检查抗体、细胞系等研究资源能否被准确识别,并生成报告分数。
它很适合发现“实验也许做了,但写得让别人无法复核”的问题。它的分数衡量的是方法报告的完整程度,不能证明实验真的发生过,更不是创新性等级。
访问:sciscore.com;官网提供个人报告入口,并说明可注册试用一次报告。
8. Scite:查看一篇论文后来怎样被引用
Scite 的核心是“智能引文”:分析引用语句,将其归为支持、相反或一般提及,并提供引文上下文、撤稿提醒和参考文献检查。它回答的是一个很有价值的问题:这项研究发表以后,别人如何讨论它?
优势是把“被引多少次”推进到“被怎样引用”。但引用分类仍可能误判;被广泛支持,不自动证明原始数据可靠;刚发表的原创论文,也没有足够的后续引文可供判断。
访问:scite.ai;官网提供试用入口,完整功能的使用条件以网站说明为准。
9. Frontiers AIRA:嵌入期刊流程的AI守门员
出版商 Frontiers 的 AIRA 是一组供其编辑出版流程使用的AI工具。官网介绍,它开展语言、图像等多项质量与诚信检查,并向编辑和审稿人提供辅助提示;最终决定由人作出。
它的优势在于AI发现问题后,能够进入编辑复核流程,而不是生成一份没人负责的分数。它的局限同样清楚:主要服务 Frontiers 的出版工作流程,普通研究者不能把它当作独立开放的通用论文评价平台。
访问:Frontiers AIRA介绍页;具体功能通过其投稿与评审流程使用。
九个平台看完,最需要警惕什么?
这些系统已经证明,AI可以做不少有用的事:查找相近研究,指出方法描述的缺口,提示可疑图片,核查引文,帮助作者提前听到一轮批评。
但目前的产品也很容易混淆四句话:
“写得规范”,不等于“研究真实”;
“像已发表的好论文”,不等于“提出了新知识”;
“适合某本名刊”,不等于“学术价值更高”;
“AI与人工评分一致”,不等于“人工原本就评对了”。
最后一句尤其重要。如果训练目标只是学会复现既有审稿分数,机器可能连旧评价体系的偏见一并学去:偏爱熟悉的问题、成熟的写法、容易被认可的方法。那些真正陌生、暂时说不清收益的新问题,反而可能吃亏。
下一代论文智能评价系统,应当更认真地做三件事:把评价落到论文的具体创新主张;分别判断它相对已有知识推进了多少、证据又支撑到了哪一步;让每个关键判断都能指向可查的文献、数据或论证,并允许专家提出反证和修正。
机器可以帮我们读得更快、查得更广、问得更细。
但一篇论文究竟改变了我们对什么问题的认识,仍需要经得起证据、同行争论和时间检验。
别急着给AI穿上审稿人的袍子。先看看它手里拿的是证据,还是一张制作精美的评分表。