乐于分享
好东西不私藏

AI为什么在专业场景里"掉链子"?因为它学的是答案,不是过程

AI为什么在专业场景里"掉链子"?因为它学的是答案,不是过程

一个让我耿耿于怀的场景

去年做一项II期临床试验的方案设计,我把入组标准、终点指标、既往同类研究的背景,一口气丢给某个通用大模型,让它给我一版样本量估算的思路。

它答得很漂亮:引用了公式,给了假设参数,甚至列出了脱落率的校正方式。看起来无懈可击。

但我盯着屏幕看了几分钟,心里凉了一下——它给的效应值假设,来自一项开放标签、单臂的探索性研究。而我们这个试验是随机双盲对照。用单臂研究的效应值去估算随机对照试验的样本量,这是审评会上最容易被专家一句话问倒的地方。

AI不是不知道公式。它知道得比我熟。它不知道的是:这个数字能不能用、在什么条件下能用、以及当年为什么有人这样用过然后被否掉了。

那天之后我一直在想一个问题:AI的短板到底在哪儿?

结论是廉价的,通往结论的路径才是昂贵的

我的判断是:通用大模型学到的,绝大部分是"结论态"的知识,而不是"过程态"的知识。

打开任何一本教科书、任何一篇指南、任何一篇发表的论文——你看到的是什么?是一个已经被打磨光滑的成品。

指南告诉你"推荐使用A方案(1A类证据)",但它不会告诉你:

  • 制定组当年在A和B之间争论了什么
  • B为什么在亚洲人群数据里表现更好却最终没进推荐
  • 那句"推荐"背后的投票比例是11:9还是20:0

论文告诉你"我们采用了协变量校正的ANCOVA模型",但它不会告诉你:

  • 统计师最初想用重复测量方差分析,为什么放弃了
  • 中期看数据时发现基线不平衡,是怎么在盲态下讨论并修订SAP的
  • 哪个版本的模型跑出来结果不显著,团队是怎么判断"这是模型问题还是药物问题"的

科研写作的整个规范体系,本质上就是一套"删除过程"的规范。我们被训练成要写得干净、简洁、无懈可击。而所有的犹豫、返工、被推翻的假设、深夜里那个"要不要换个终点"的争论——统统留在了聊天记录和废纸篓里,从来没有进入过任何语料库。

AI吃的是我们端出去的菜。厨房里那些失手打翻的锅、试错了七遍的火候,它一口没吃到。

这件事,和你自己成长的困境一模一样

写到这儿我必须说一个更扎心的类比。

回想你刚入行的时候。你拿着一个搞不定的问题去找主任,主任看了三秒钟,说:"这个病人先把血钾纠了再说别的。"

你照做了,问题解决了。

然后呢?大多数人到这一步就结束了。

但真正的知识在哪儿?

在主任那三秒钟里跑完的、他自己都没意识到的推理链条上:他扫了一眼心电图、心里过了一遍这个病人的用药史、想起五年前有个类似病人在这个环节出过事、判断出当前所有指标里哪个是"会杀人的"、哪些是"可以等的"。

这一整套东西,他没说。不是不愿意说,是他已经把它压缩成了直觉,说不出来了

这就是"专家知识的隐性化悖论":一个人越是专家,他的知识越是内隐、越难言传。

而我们训练AI用的语料,恰恰是这些专家写下来的、已经被压缩过的成品。

所以你会发现,那些成长最快的人,都有一个共同的动作——追问

"主任,为什么先纠钾不先处理心衰?"

"如果这个病人同时有肾功能不全,还是这个顺序吗?"

"有没有哪种情况下您会反过来做?"

问这三个问题的人,和只是照做的人,五年后不是一个量级。

AI的成长逻辑,和人一模一样。它现在的困境,就是那个"照做但不追问"的年轻医生的困境。

那么,我们该给AI喂什么?

如果上面的诊断成立,那处方就清楚了:不是把数据搞得更多,而是把数据搞得更"厚"。

一条真正有训练价值的专业数据,至少要包含四层:

第一层:这么做(What)。

这是我们现在唯一在给的东西。

第二层:为什么这么做(Why)。

决策依据是什么、权衡了哪些因素、这个选择的代价是什么。

第三层:为什么不那么做(Why not)。

这一层价值最高,也最稀缺。

有哪些看起来合理但错误的做法?错在哪里?错误的后果长什么样?

——负样本的信息密度,常常高于正样本。

一个知道"这里有坑"的模型,比一个只知道"路在这里"的模型可靠得多。

第四层:换个场景怎么变(When not)。

也就是边界条件。这条经验在什么条件下失效?

我举个具体的例子,你就明白这四层的差别有多大。

同样是一位2型糖尿病患者,用SGLT2抑制剂:

  • 合并心衰(HFrEF)→ 强适应证,这药几乎是首选,还能减少住院
  • 合并eGFR 25的CKD→ 降糖效果已经很弱了,但肾脏保护的证据仍在,用药目的完全变了
  • 合并反复泌尿生殖道感染→ 相对禁忌,得掂量
  • 即将接受手术、需要禁食 → 必须提前停药,否则可能出现正常血糖性酮症酸中毒——这个坑非常隐蔽,因为血糖是正常的,不查酮体根本发现不了

你看,"2型糖尿病用SGLT2i"这七个字是同一个结论。但在四种合并症下,它背后的推理、目的、风险、执行细节完全不同。

一个只学了结论的AI,会在这四种情况下给你同一个答案。而真正能用的AI,必须知道这四条岔路。

科研场景比这还要苛刻。同样是"要证明A优于B"这一个目标:样本量受限时你可能得考虑交叉设计;伦理上不允许安慰剂时你要走非劣效;主要终点是时间事件时你的检验方法和样本量逻辑全变了;如果预计会有大量竞争风险事件,用Kaplan-Meier就是错的,得上Fine-Gray。

这些"如果……那么……"的分支,从来不会完整出现在任何一篇已发表的论文里。它们只存在于统计师和研究者的会议室里。

一个反直觉的结论

所以我想说的是:在专业领域,AI的天花板不是算力,是我们的表达能力。

我们能不能把自己脑子里那套隐性的、被压缩过的、说不清楚的判断逻辑,重新展开、写下来、结构化——这才是决定专业AI能走多远的真正瓶颈。

这件事最有意思的地方在于:当你为了训练AI而被迫把"为什么"写清楚的时候,你自己的认知会先被升级一遍。

我现在做方案,会写一份"决策日志":每个关键选择,记下选了什么、为什么、否掉了什么、否掉的理由、以及什么条件下会重新考虑。

一开始大家觉得是负担。三个月后,两件事同时发生了:新人上手速度快了一倍——因为他们读到的不再是结论,而是推理;而这批日志,成了我们内部模型最值钱的语料。

训练AI和训练人,从来就是同一件事。

你把过程写清楚,AI变强了,你也变强了。你只交出结论,AI是个复读机,你也停在了原地。

这大概是这一轮AI浪潮里,最容易被忽略、却最值得琢磨的一个悖论。

推荐阅读

PS: 我的新书《AI赋能医生》,对于学医的人来说,这是一本非常好的AI入门和实操指南,被清华大学出版社评价为"AI时代医者必读书目"。

本书特点

  • 传授的技巧和思路,适用于 ChatGPT、DeepSeekGemini、元宝、豆包 等所有主流AI
  • 即使不是学医的人,书中关于AI应用的基本原则也很有启发性
  • 如果你有医生朋友,赠送这本书将非常有价值
  • 即使不是学医的人,书中关于AI应用的基本原则也很有启发性
  • 如果你有医生朋友,赠送这本书将非常有价值
  • 购书优惠