夜雨聆风学习资料网

ARTICLE · 1155714

用了三个月 AI,收走工具那天才是验收

用了三个月 AI,收走工具那天才是验收

上周 Google 的研究团队放出一篇工作论文,作者里有 MIT 的劳动经济学家 David Autor。题目问得很直接:AI 辅助到底是在养专业能力,还是在吃专业能力。

他们找了 133 名执业专利律师做实验,来自 11 家美国知识产权律所,随机分组,事先注册,整整做满三个月。

答案分两段。第一段人人爱听,第二段只有一部分人爱听。

前三个月,账面很好看

律师用的是 Google 内部做的 AI 撰写助手 InFlow,这个工具现在已经并进 Gemini Notebook。打分的人不知道谁用了 AI——请的是外面律所的资深专利律师,盲评。

10 天时,用 AI 那一组交出来的稿子质量高出 0.34 个标准差;到 90 天,拉到 0.38 个标准差。两次的 p 值分别是 0.03 和 0.01,站得住。

初级的提升尤其大。他们不光稿子变好,平均还快了 18 分钟。

如果实验停在 90 天,这就是一条标准的「AI 提效」新闻。

真正的测试,在把工具收走之后

三个月到期,研究者做了一件不太常见的事。他们把 AI 收走,让所有人徒手改一份现成的专利申请,全程不许碰 AI。

这是专利这行最核心的动作,考的是判断力,不是手速。

结果是:用过 AI 的人整体比对照组高 0.32 个标准差。听上去还是好消息,拆开看就变味了——这 0.32 全部来自资深律师,他们高出 0.45 个标准差。

初级律师呢?平均零提升。

而且不是「有人高有人低、平均一下抵消了」那种零。是分数两极分化:中庸的分数明显变少,同时变差的和变好的都变多了。原来那批不好不坏的人,被推去了两头。

论文里有一句话我建议原样记住:从 AI 中得到最大收益的,恰恰是最不需要它的律师。

差在哪一步,研究者给的说法很具体。

资深律师把 AI 当逻辑审计器:让它挑毛病,然后自己把每一处改动挂回法理,重新走一遍论证链。AI 在这里是另一个视角的对手,不是代笔。

初级律师也看出了问题。论文里管这个叫 diagnose-without-execute——诊断了,但没执行。他们常常已经发现稿子里有严重缺陷,然后写了一条评论,就没下文了。

看出问题,是本事。改写问题,才是练本事。这一步的分野,三个月后才显出来。

同一篇论文的结论句是这样写的:基础专业能力,可能是从 AI 辅助实践里提取出可持久技能的前提。

落到你自己身上

这几位律师的职业离你很远,但「怎么用 AI」这件事,不分行业。

第一个该改的习惯是:别让它替你交付,让它替你挑错。

写方案、写代码、写报告都一样。先自己把骨架搭出来,再让 AI 对着骨架翻漏洞,然后你亲手把每一处补回去。补的那个过程是你的。整套外包出去,快的只是这一次。

第二个要盯的动作更隐蔽。工作里最常见的场面是:AI 给了一版,你看得出哪儿不对,但改起来麻烦,就顺手在群里丢一句「这段逻辑有点问题」,然后把东西交上去了。这跟初级律师那条评论是同一个动作——省下的是当下,欠下的是能力。

第三个:底子越薄,越要留神。论文的意思不是新手别碰 AI,是说新手从 AI 里拿到的,更多是「这一版的产出」,不是「下一次你自己也能」。

手里那点判断力,才是决定 AI 是杠杆还是拐杖的东西。

有几件事必须说清

不讲清楚,上面全都要打折。

论文是单篇工作论文,没有经过同行评审。样本是一个职业、三个月,能不能推广到程序员、分析师、写作者身上,作者自己没下结论。

最后那场徒手测试,真正参加完的只有 91 人,其中初级律师 24 人,样本不算大。研究者还承认,「测试时不许用 AI」这条要求没法强制执行——真有人偷偷用了,也查不出来。

还有钱的关系:实验的直接经费由 Google 出,工具是 Google 造的,7 名作者里 6 人与 Google 有关(5 名全职员工、1 名付费承包商)。这些论文里都写着,我照原样转给你。

结论信多少,你自己定。

我的看法是,这份研究的价值不在它证明了什么,而在于它把问题问对了——「用 AI 的时候更强」和「不用 AI 的时候是不是也更强」,本来就是两件事,以前没人这么干净地测过。

你手上有没有那种「本来准备整个丢给 AI」的活?在评论区说一句是哪种,我按类型给你排一份清单:哪些可以直接交出去,哪些必须先自己上手、再让它来挑错。攒够一批我就整理出来。

· · ·

我是三日轩。

只写 AI、科技、商业里跟你有关系的那部分——不谈参数,谈它会怎么落到你的账单、饭碗和选择上。关注「三日轩」,热点不用自己扒。

相关学习资料