乐于分享
好东西不私藏

Harvey把1200道法律真题扔给AI,最强也只拿14.2%,这次真不是演示了

Harvey把1200道法律真题扔给AI,最强也只拿14.2%,这次真不是演示了

7月刚放出来的一张榜,最好看的数字不是90%多,而是14.2%。

这事为什么有冲击力?因为这次考的不是“你懂不懂法条”,而是“你能不能像律所新人一样,把活完整干出来”。一句模糊指令、一个塞满文件的资料室、最后交一份能直接进deal team的正式文档,少一条关键点就算整题作废。Harvey给这套题起名 LAB,5月6日公开,首版就做到了超过1200个任务、覆盖24个执业领域,评分还是最狠的 all-pass:不是大部分对,而是一条不落才算过。

我说实话,这套玩法一出来,味道就完全不一样了。

以前很多法律AI测试,本质上还是“单题问答”。你问它一条合同、一段判例、一个违约点,它答得像那么回事,看起来就挺强。LAB直接把题目升级成真实工作流:自己找材料、自己判断哪些文件有用、自己起草交付件。这一下,AI是不是“会背书”,立刻变成AI能不能“把活干完”。

这一点很关键。

Harvey 5月26日先公布过一版内部初始成绩,已经不太好看:当时 Claude Opus 4.7 全通过率只有 7.1%,Sonnet 4.6 是 5.4%,GPT-5.5 只有 2.1%。Harvey自己当时就把话说透了:前沿模型离真正完成完整法律工作,还差得远。

真正把这件事砸实的,是7月7日 Artificial Analysis 的独立复现。它拿 Harvey 私有的 120 道任务子集,用自己的 Stirrup 框架重跑,还把一些条件收得更严:文件名匹配更严格,工具链也更简化。结果第一名 Claude Fable 5 也只拿到 14.2%,第二名 Claude Opus 4.8 和 GLM-5.2 并列 7.5%,MiniMax-M3 6.7%,Claude Sonnet 5 5.0%。

这机器有点东西。

最值得看的一刀,其实不是谁第一,而是“单项通过”和“整题通过”的断层。头部模型单条评分标准的通过率普遍都过了90%,听着已经像优等生;可一旦要求整份 memo、整份清单、整份报告每一项都不出错,通过率就直接掉到10%出头。28个参赛模型里,有13个是0分,一整道题都没完整拿下。

说白了,AI现在最像的不是资深律师,而是那种“每句都懂,整活容易漏”的高智商实习生。

这也解释了一个很多圈外人容易误会的点:为什么平时用着挺聪明,一到真业务就不稳。因为真实工作不是答一道题,而是几十个小判断串起来,中间还要检索、引用、格式、日期、金额、附件名全部对上。你单点能力有90分,不代表端到端交付也有90分。法律场景尤其这样,差一条,整单重做。

而且这套榜单还顺手把另一个趋势捅破了:系统设计开始比单纯堆模型更重要。Harvey自己在初始结果里就提到,那些会先通读材料、写完再验证、发现问题真会改稿的模型,分数明显更高。Fireworks后面做的切片实验也很有代表性:让便宜模型干大部分活,只在关键节点叫贵模型来把关,成本压到 Opus 单跑的四成左右,题还多过了几道。

所以我个人的判断很明确:法律AI的拐点不是“某个模型突然神了”,而是评测终于从演示视频,走到了真实工位。这个方向我很看好。因为一旦有了这种公开、严格、可复现的 benchmark,行业就能月月盯着进步,而不是听厂商讲故事。

当然,14.2%也别小看。Harvey 5月内部最强还是 7.1%,到7月独立榜首已经翻到 14.2%;Harvey后来还披露,Fable 5 在其自家 LAB 上能到 13.3%,Opus 4.8 也已经摸到 10.4%。这说明端到端知识工作虽然远没解完,但进步速度是真快。

所以这篇的结论,我给得很直接:如果你把AI当“副驾驶”,它已经能干不少活;但你要把它当“签字交件的人”,现在还早。法律AI最真实的状态,不是取代律师,而是先把律师的底稿时间,狠狠干下来。

别急着下结论,真正的赛点,才刚开始。

⚠️ 文中数据与排名整理自网络公开信息,可能会随版本更新变化,最终仍以官方发布和实际结果为准。