ARTICLE · 1041793
「OpenAI发布Astra for Law」没改一个参数,法律成绩从38.7%涨到54%
OpenAI 在 9 月 17 日发布了一个叫 Astra for Law 的东西,名字看着像「法律版大模型」,实际上 GPT-6 Astra 一个参数都没动。他们只是把模型接上了一个 2.3 亿网页规模的法律检索索引,配上法律分析与写作的专门指令,再加一层为律所保密义务设计的权限治理。
就靠这些「模型外面」的东西,同一个模型在 Vals AI 法律研究基准上的成绩从 38.7% 涨到 54.0%,相对提升 40%。
这组数字其实在宣布一件更大的事,决定专业领域能力的,已经从模型本身转移到了模型外面那套检索、指令和治理配置上。 而这一次,OpenAI 亲自下场,把这套东西做成了产品。
发布物拆解,四层基础设施
模型侧一个字节都没改,发布的是模型外面的一整套东西。先把发布物拆开看。Astra for Law 的官方定位是「面向法律行业的 AI 基础」,一共四层。
最底下还是 GPT-6 Astra,OpenAI 现役最强模型,没有任何针对法律的再训练。第二层是法律搜索索引,覆盖 2.3 亿个网页,内容是美国判例法、制定法、行政法规、法院规则和行政决定,每天继续添加新来源。第三层是专门指令,教模型怎么把检索结果用在客户事实上,发展论点、起草交易条款、识别薄弱环节,公告里特别点了几种能力,区分法院裁判要旨与附带论述,主动寻找对己方立场不利的判例,比较事实模式,分析合同例外条款如何重新分配风险。第四层是治理,接入 ChatGPT Enterprise 的权限体系,API 提供 Zero Data Retention 零留存,企业版默认排除人工审查,还与 Latham & Watkins 律所合作设计了信息权限、道德墙和客户指令管理。
四层里真正值钱的是第二层。判例语料来自与 Free Law Project 的合作,就是 CourtListener 背后的非营利组织,覆盖超过 99.9% 的已发布美国判例法。

这个数字是给法律人看的通行证,判例引用造假是法律 AI 的历史污点,索引必须先立得住。
发布形态也透着谨慎。产品先通过 Trusted Access 计划向选定律所开放,在 ChatGPT 和 Codex 里以「GPT-6 Astra Law」出现,API 版本 gpt-6-astra-law 随后上线,定价至今未公布。
成绩单上的四个数字
测试基准选的是 Vals AI 的 Legal Research Bench,200 道美国法律研究题的私有验证集,同时考察来源检索和答案质量。OpenAI 做的对比很讲究,两边都用 GPT-6 Astra、都用最高推理强度,唯一变量是检索配置。
裸模型加普通网页搜索,总体正确性检查通过率 38.7%。换成 Astra for Law 完整配置,54.0%。判例法聚焦的题目上,参考案例多找到 24%。在被审计的目标段落集里,从正确法院意见中检索到的相关段落最多多出 54%。

OpenAI 还附了一段与 Claude Fable 5.1 的对比演示。诉讼示例里,Fable 5.1 返回的裁判要旨已经被上诉法院推翻,Astra for Law 找到了匹配的在先判例。交易示例里,Fable 5.1 报告没有找到相关案例,Astra for Law 同样命中。两个演示都是官方博客自述,胜在具体。
有一篇外部评测观察到,Astra for Law 的答案长度约为裸基线的两倍,这个细节很合理,一个真在翻法条和判例的系统,能引的东西当然比凭记忆猜的多。
54.0% 本身要读诚实。它意味着 200 道题里还有近一半过不了正确性检查,法律研究远没有被解决。OpenAI 自己也清楚,所以同步推出零留存的 API 条款,用邀请制小范围发放,而不是直接开一个公共开关。及格线上的一大步,距离让人放心还很远。
律所拿它做出了什么
公告里最有信息量的部分是四家律所的成品。
Sullivan & Cromwell 做了协议分析器,把律所自己的谈判手册和精选历史先例带进新交易审查,系统识别不同条款组合叠加后的风险,生成修订建议和客户意见草稿,最后由律师挑战和确认。Ropes & Gray 做了交易尽调系统,按律师实际做尽调的方式运行,哪些问题真正影响交易、结论来自哪份原始文件、重要客户合同是否触发通知或同意义务,全部追溯到源头。Cooley 的 GO Public 把 IPO 流程做成完整工作流,交易事实一变,变化会传导到申报文件的其他部分。Skadden 设计了帮客户评估监管风险的工具套件。Wachtell, Lipton, Rosen & Katz 在合作探索诉讼与公司业务的 AI 支持。
三个方向殊途同归,法律 AI 从回答一个问题,走到了运行一项法律工作。
外围还有生态。26 个合作伙伴插件接入 Relativity、Clio、iManage、Intapp、DeepJudge、Thomson Reuters 等行业工具,9 个社区插件由法律工程师搭建,内含 47 个自定义技能。ChatGPT for Word 当天全面可用,管校对、建议编辑和格式标记。
这份榜单该怎么读
传统模型榜单比的是谁家模型强,这次 OpenAI 比的是同一模型的两种系统配置。38.7% 到 54.0% 的差距全部来自检索索引、专业指令和上下文设置,模型侧零改动。
这个对比方式本身就是行业信号。基础模型能力早已溢出,专业任务的天花板卡在信息供给和方法配置上。投行圈 3 月就出现过类似的调研结论,OpenAI 与 Anthropic 都没有专门的金融垂类模型,靠企业版加行业方案服务客户,Astra for Law 是这条路第一次走到「专门索引加专门治理」的深度。
邀请制加零留存的小心翼翼,背后是行业一团糟糕的历史记录。全球已有超过 2000 份法院判决记下了虚假案例引用,律师因为提交带幻觉引用的辩护状被制裁,最早可以追溯到 ChatGPT 问世的头一年。法律 AI 的信任门槛是全行业垫底的,任何新玩家都得先回答「你的引用能不能点开看原文」这个问题。
54% 的成绩单还配不配得上生产力工具的名头,答案在每一家律所的核验流程里。检索快了一截,最后一英里的验证一点没少。
牌桌上各怀心思
最微妙的位置留给了 Harvey 和 Legora,两家被公开点名的 API 客户。
它们是法律 AI 行业融资最猛的公司,Harvey 9 月初刚以 155 亿美元估值完成 5.5 亿美元融资,1 月年收入 1.9 亿美元,如今年化已过 4 亿,覆盖八成的 Am Law 100 百强律所。它们的产品之所以存在,恰恰因为此前的 GPT 不够懂法律。现在,模型供应商把法律配置、法律索引、律所级权限全用自己的品牌发布了,而这两家的客户随时可以通过 Trusted Access 直接找 OpenAI。
短期看这个结构是稳的。OpenAI 需要 Harvey 和 Legora 攒了多年的工作流知识和律所关系,卖给 Am Law 200 首席法务官一个裸 API,远不如 Harvey 那套白手套产品好卖。Harvey 和 Legora 则拿到一个明显更强的底座,Legora 用新模型在财务报表审查任务里拿到约 40% 的提升,41 份文档的勾稽核对一次跑完,测试集里预埋的 4 处错误全部抓出,包括收入线里一处隐藏缺口。但长期的问题摆在那里,垂直 AI 创业公司押注「工作流和信任是护城河、模型是大宗商品」,这个赌注正在最赚钱的垂直行业里被直接检验。
Harvey 的动作也说明它看清了形势。9 月的融资公告里同时宣布收购 Agent 安全公司 Guardrails AI,发布基于 Kimi K3 后训练的开源权重法律模型 Harvey Tenet,以及自建的法律 Agent 基准 Harvey LAB。控制自己的模型路线,控制自己的评测标尺,都是在降低对任何单一实验室的依赖。
另一边的数据也在提醒大家别把「垂直模型」想得太神。行业技术调查覆盖 500 多家律所 14 万律师,94% 在使用或探索生成式 AI,但使用率第一的是 Microsoft 365 Copilot 的 76%,通用模型 Claude 以 44% 与法律专属的 CoCounsel 持平,压过 Harvey 的 43%。律师们要的先是顺手,专业排在后面。
老牌法律出版商则选择脚踩两条船。Thomson Reuters 一边作为插件伙伴接入 Astra for Law,一边在 8 月底发布了投资 4000 万美元的自研法律模型,新一代 CoCounsel Legal 又构建在 Anthropic 的 Claude Agent SDK 上。模型层可以是别人的,索引和 citator(判例效力引证库)才是它守了百年的资产。
结语
Astra for Law 这一步,OpenAI 把模型公司能替垂直行业做的事做了一遍,建索引、写方法指令、定治理规范、派前向部署工程师进律所。这些事的共同点是,全都不涉及训练模型。
垂直 AI 的价值链正在被这样切分,模型和领域配置归基础设施层,工作流和机构判断归应用层,中间的检索资产成了新的竞争高地。Clio 花 10 亿美元收购拥有 110 个辖区编辑文档的 vLex, Thomson Reuters 死守引证库, OpenAI 现在自建 2.3 亿网页索引,都是在囤同一种东西。
对法律服务市场,还有一个现成的空档,这套索引只覆盖美国法。欧洲律所今天用它,得到的只是一台好用的美国法研究助手,德国法和法国法一概不知。谁先把多辖区的法律语料基建补上,谁就握住了美国之外的另一半市场。

对其他垂直行业,这份样本给出了一个可以直接抄的作业结构。领域索引加方法指令加权限治理,三层配齐,通用模型就能在专业任务上跳升 40%。医疗、财税、合规都值得照着做一遍,问题只剩一个,谁愿意出这个建索引的成本。
公告里有一句很容易被划过的话,律所可以把自己的先例、方法和判断,转变成符合自身标准的 AI 工具和工作流。翻译一下,资深律师脑子里那些说不清道不明的经验,第一次有了一条进入系统的路。检索会越来越便宜,判断会越来越贵。