从「只管上传」到「告诉AI要读什么」
我一开始以为,知识库是AI。所有资料上传进去——论文、教材、行业报告、BD材料、产品资料——AI会自动识别它们、自动提取关键信息、自动建立关联,我只需要坐在那里「问」就行
我一开始以为,知识库就是AI。所有资料上传进去——论文、教材、行业报告、BD材料、产品资料——AI会自动识别它们、自动提取关键信息、自动建立关联,我只需要坐在那里"问"就行。
我想多了……
你问它"萎缩性胃炎的患病率是多少",它倒也能答——从某个上传的文档里翻出一段相关文字拼凑给你。
但如果你问它"这个市场规模有多大?医生目前怎么处理?我的产品有没有机会?",它就答不出来了。
不是它懒。是它不知道你要什么。
那时候我开始意识到一件事:AI不会自动知道你要从资料里读什么。你得告诉它。
第一次尝试:分类型
我做的第一件事是分类。
发现论文和教材是两种完全不同的东西。论文是知识晶体——一个结论、一个效应量、一个P值。教材是知识河流——一个体系、一片逻辑、一套框架。
用处理论文的方式处理教材,关键词写了一堆,但整本书想说什么完全丢了。用处理教材的方式处理论文,大题小做,还把精确的效应量给稀释了。
所以我定了一个规则:处理之前先分类,论文走八字段原子化模板,教材走书籍级处理模板。这是最早的"二分法"。
效果比以前好——至少论文能精确提取结论了,教材能保住体系了。
但我很快遇到了新问题。那些既不是论文也不是教材的资料怎么办?一份行业研报、一份BD尽调材料、一份产品上市策略文档——它们没有DOI也没有章节编号,但它们是最需要处理的那种资料。
二分法不够用了。
第二次尝试:给AI搭骨架
分类的问题是解决了"按什么格式处理",但没解决"AI知不知道自己在看什么"。
我试过拿着BD材料问AI:"这标的值不值得买?"AI说"根据上传的材料,该药物在XX适应症上显示了YY%的有效率……"它说了一堆事实,但做不了判断。
为什么?因为AI没有BD的知识骨架——它不知道在BD场景下,一份标的评估要看哪几个维度:靶点验证性够不够?未满足需求真实吗?竞争格局里谁是真正的对手?BD时机对不对?
它不是不想帮你评估,它是不知道从哪些角度进行评估。
所以我在做分类的同时,开始给AI搭各种场景的知识骨架。
BD场景下,我建了一套18个要素的评估框架,分成P0/P1/P2优先级,每个要素写清楚"要看什么、怎么判断、什么算好"。后来发现这还不够——BD交易有时机问题,现金充裕的时候和现金紧张的时候策略完全不同。又补了一套四级BD时机模型。
医学-市场场景下,我不只让AI提取数据,还让它知道提取出来的数据要串成三段证据链:流行病学共同分母有多大 → 现有治疗为什么不覆盖 → 新方案填补缺口的逻辑。
AI知道的知识骨架越多,它从资料里读出的东西就越有深度。这不是"调参数",这是"建认知"。
第三次尝试:不靠分类,靠清单
做了分类、搭了骨架之后,我以为差不多了。
但新问题又冒出来了:同样的资料,不同人看,要提取的东西完全不一样。
一份"萎缩性胃炎流行病学数据"——
研究者看它:样本量多少?人群特征?诊断标准是什么?
BD经理看它:对应多少患者?市场空间多大?目前有谁在做?
产品经理看它:医生知不知道这个数据?我能用它说服什么类型的医生?
AI不可能自动猜到你要哪个视角。你必须告诉它。
所以我放弃了"一个通用模板处理所有资料"的思路,转而在每个场景下设计专门的采集清单。
每份清单的开头都有一行字:本次要回答的商业决策是什么?没有这个开头,清单就是一堆字段。
回头看:三段进化
现在回头看,这段路其实就三件事:
第一阶段,我以为知识库就是AI。上传就行。结果不行。
第二阶段,我发现得分类、得告诉AI用什么模板。论文/教材分治、各种技能于是诞生。效果好了不少,但还是浅——AI能提取信息,但做不了判断。
第三阶段,我发现AI需要知识骨架,需要知道从什么角度分析、为了回答什么商业问题去提取信息。各种场景清单、评估框架、证据链模型纷纷建立。
这三个阶段解决了三个问题:
每份资料的处理,起点不是"这是什么资料",而是"谁在用这份资料做什么决策?"
但还有第四个问题,是我最近才意识到的。
现在的生态
分类、骨架、清单都到位后,业务场景越来越多:BD需要评估标的,MA需要分析证据,MSL需要沟通策略,产品经理需要市场判断,研发需要技术路线验证。每个场景都要一套独立的技能和清单——学得过来吗?维护得过来吗?
我回头看了一下这些场景,发现它们共用一套底层能力:
都用到流行病学数据——怎么读、怎么校验、怎么加权
都需要评价证据等级——Meta和个案报告不能等量齐观
都在做机制链推理——从A到B的因果逻辑不能跳步
最终都要把数据翻译成决策含义——"所以……"这个环节谁也绕不开
这不是六个场景,是六个角色共用同一个底座。
所以我做了两件事。
第一,把处理器升级了。
尤其是书籍处理器。原来只是简单拆成"元数据→结构→深度"三步法,但我发现工具书的价值远不止于"提取信息"。它是AI的认知底座——读过的书和不读的书,AI回答问题时深度差一个量级。
我给它加了四层能力:
一个知识索引层——告诉AI这本书怎么跟已有知识体系对接
一个多粒度提取器——整书、章节、段落、句子,四个层级都标好位置
一个表格解析器——书里的数据表不会因为排版复杂就漏掉
一个后置发布流——每本书处理完自动把核心概念扩散到知识网络中
书不再是"处理一次就归档"的静态资产,它变成了AI持续引用的动态底座。
第二,拔了一个共享技能层出来。
把六种角色(BD、MA、PM、医学负责人、MSL、研发)都需要的9个核心能力模块抽出来,建了一个共享底座:
这个底座之上,六个角色做分析时不再各自搭一套技能,而是共享同一套引擎。唯一的区别是视角不同——BD和产品经理看同一个流行病学数据,问的是"市场多大";而MSL问的是"跟KOL怎么对话"。
现在的生态长这样:
中间还有一个编排层在做路由——识别资料类型、选择引擎、调度执行顺序、融合多个引擎的输出、检查数据矛盾。
这6个引擎没有一个是一次性设计出来的。它们都是"遇到问题→打补丁→发现补丁不够→重建"这个循环的产物。
速查卡 · 三问法
资料拿到手,先问三个问题:
① 这是什么类型的资料?(论文/教材/报告/BD材料/市场材料)
② AI需要什么知识骨架才能读懂它?(BD要素框架 / 证据链模型 / 市场分析框架 / 共享技能底座)
③ 谁在用这份资料做什么决策?(研究者 / BD经理 / 产品经理 / 医生 / MSL / 研发)
分类 → 搭骨架 → 定清单,三步走完才算处理完成。
★ AI不会自动知道你要什么,你得告诉它★ 不是资料难处理,是你没给它分析的角度★ 清单的开头不是"提取以下信息",是"本次要回答的商业决策是什么"★ 六种角色的底层能力是共享的——别重复造轮子
作为一个产品,AI和传统的产品很不一样,
以往的产品都是“成品”,有说明书,
但AI没有说明书
按照自己的理解和需要,跟她说,我需要这样,那样……


夜雨聆风