乐于分享
好东西不私藏

AI 工具不好用,很多时候不是模型问题

AI 工具不好用,很多时候不是模型问题

很多 HR 用 AI,第一反应是想找一个“更好用的工具”。

这个工具不准,就换一个。 这个模型不好,就试另一个。 这个回答太泛,就再换一种问法。

但我最近越来越觉得:

AI 工具不好用,很多时候不是模型问题,而是数据、标准和上下文问题。

换句话说,不是 AI 不够聪明。

而是我们没有把业务信息讲清楚。


01|为什么这个问题对 HR 很重要?

最近看到 AI 圈里两个很有启发的判断。

一个是关于 AI 进入组织后的分工

Agent 会改变产出方式,但人不能退出判断。

另一个是关于 Agent 落地的底层问题

很多 Agent 战略问题,本质上是 Data Strategy 问题。

翻译成 HR 能听懂的话就是:

AI 能不能真正跑起来,不取决于模型有多聪明,而取决于我们有没有给它稳定、清楚、可判断的业务信息。

这句话对 HR 很重要。

因为我们现在很多 AI 应用,表面上看是在做工具。

比如:

  • AI 筛简历;
  • AI 生成面评;
  • AI 辅助初面;
  • AI 生成 JD;
  • AI 做人才盘点;
  • AI 帮 HRBP 准备绩效面谈。

但本质上,这些事情都不是简单的“生成内容”。

它们背后真正依赖的是 HR 的判断标准。

如果标准不清楚,AI 只是帮我们更快地产出一堆看起来完整、但不一定能用的内容。


02|很多 AI 输出不准,不是因为 AI 差

我们现在用 AI,很容易把问题归因到工具上。

比如:

  • 这个 AI 不够聪明;
  • 这个模型不稳定;
  • 这个回答太泛;
  • 这个结果不能直接用;
  • 这个工具离真实业务太远。

这些感受都可能是真的。

但继续往下拆,很多问题不一定是 AI 本身不行。

而是我们给它的输入,本身就不够清楚。

比如让 AI 帮忙筛简历。

如果岗位画像不清楚,AI 只能按关键词猜。

如果业务真正看重什么没有讲清楚,AI 只能按通用标准判断。

如果我们没有告诉它:

  • 什么样的人是 A 类;
  • 什么样的人是 B 类;
  • 什么样的人只是可以看看;
  • 什么样的人应该直接淘汰;
  • 哪些经历是强信号;
  • 哪些表达可能只是包装;
  • 哪些风险必须 HR 追问。

那 AI 最后生成的,大概率就是一堆看似专业但不一定准的判断。

所以,AI 不是凭空变聪明。

AI 的质量,很大程度取决于我们给它的上下文质量。


03|过去我们容易问错问题

过去我们做 AI 工具时,很容易先问:

“这个工具能不能做?”

但真正应该先问的是:

“我们有没有把业务判断讲清楚?”

比如一个 HR 初面工具,不是把简历丢进去就完了。

它至少需要知道:

  • 这个岗位到底解决什么业务问题;
  • 这个岗位最核心的能力门槛是什么;
  • 哪些经历是强信号;
  • 哪些经历只是包装;
  • 哪些风险必须追问;
  • 什么情况下可以推荐业务面;
  • 什么情况下应该直接淘汰。

这些东西如果没有沉淀,AI 就只能靠泛化能力工作。

泛化能力可以做 Demo。

但很难支撑稳定交付。

这也是为什么很多 AI 工具一开始看起来很惊艳,但真正放到业务里,会出现两个问题:

第一,输出很完整,但不够准。 第二,表达很专业,但不能直接决策。

因为 AI 不知道你的业务场景。

也不知道你的判断边界。

更不知道你们团队过去是怎么判断“好”和“不好”的。


04|AI 落地的第一步,不是多试工具

对 HR 团队来说,接下来真正要补的,不是工具数量。

而是三类基础资产。

第一,数据资产

这里说的数据,不一定是大数据。

而是我们日常工作里真实产生的信息。

比如:

  • 候选人简历;
  • 电话沟通记录;
  • 面试记录;
  • 面评结论;
  • 业务反馈;
  • 淘汰原因;
  • 入职后表现;
  • 招聘项目复盘。

这些东西如果是散的,AI 就无法学习我们的真实判断。

比如我们每次都说:

“这个人不太合适。”

但没有记录为什么不合适。

那下次 AI 也不会知道:

到底是不够聪明? 经验不匹配? 表达不清楚? 项目深度不够? 业务理解太浅? 还是文化适配有风险?

数据不沉淀,AI 就没有可学习的材料。


第二,标准资产

标准资产,就是我们到底怎么判断“好”。

比如:

  • 什么是高潜?
  • 什么是 AI Native?
  • 什么是专业能力达标?
  • 什么是文化不适配?
  • 什么样的候选人值得业务投入面试时间?
  • 什么样的人即使简历好看,也不应该推进?

这些标准如果只存在于某个人脑子里,就无法变成 AI 能调用的能力。

很多时候,一个资深 HR 判断候选人很快。

但这个判断如果没有被写下来,就很难被团队复用。

更难被 AI 放大。

所以,AI 不是替代标准。

AI 是放大标准。

前提是,我们真的有标准。


第三,上下文资产

AI 要想判断准,必须知道背景。

同样是产品经理,不同业务阶段的标准完全不一样。

0 到 1 阶段,可能更看重:

  • 定义问题;
  • 快速试错;
  • 需求判断;
  • 资源有限情况下的推进能力。

成熟产品阶段,可能更看重:

  • 结构化;
  • 协同推进;
  • 数据分析;
  • 稳定交付。

AI 产品阶段,还要额外看:

  • Prompt 理解;
  • Agent 意识;
  • 数据意识;
  • 人机协同理解;
  • 对模型边界的判断。

如果我们不给这些上下文,AI 就会把所有岗位都按一个普通模板评估。

这就是为什么很多 AI 输出看起来完整,但用起来不准。

不是因为它没写东西。

而是因为它不知道该按什么场景判断。


05|这件事对 HR 团队真正的启发

所以,接下来我们做 AI Native HR,重点不是让每个人都去试一堆新工具。

而是要开始做一件更底层的事:

把 HR 的判断标准、业务上下文、复盘数据沉淀下来,让 AI 有东西可用。

具体到我们的工作,可以先从三个动作开始。


第一,每个岗位都要有一版清晰的画像标准

不是只写 JD。

而是要写清楚:

  • A 类人长什么样;
  • B 类人可以看什么;
  • C 类人为什么不推进;
  • 哪些经历是强信号;
  • 哪些信息必须追问;
  • 哪些风险不能放过。

如果岗位画像没有沉淀,AI 筛简历就只能看关键词。

但招聘判断真正难的地方,不是看关键词。

而是判断一个人是否真的匹配这个岗位的核心任务。


第二,面评不能只写结论,要写依据

比如不能只写:

“候选人潜力较好。”

这句话看起来像判断,但对 AI 来说没有太多价值。

更好的写法是:

  • 判断来自哪段经历;
  • 候选人原话是什么;
  • 这段经历体现了什么能力;
  • 这个能力和岗位要求有什么关系;
  • 还有哪些信息需要继续验证。

这样后续 AI 才能学习我们的判断逻辑。

否则面评只是结果记录,不是组织资产。


第三,每次 AI 出错,都要沉淀成规则

比如 AI 把一个不合适的人推荐出来,我们不能只说:

“这个 AI 不准。”

更重要的是追问:

  • 它为什么判断错?
  • 是岗位标准不清楚?
  • 是简历信息不完整?
  • 是提示词没有写清楚?
  • 是某类风险信号没有定义?
  • 是我们没有给它足够的业务上下文?

如果每次 AI 出错,都能沉淀成一条规则,工具才会越用越准。

如果只是抱怨工具不准,那下一次大概率还是会重复出错。


06|AI 不是替 HR 判断,而是放大 HR 判断

这件事的关键,不是让 AI 变成一个“自动 HR”。

而是让 AI 帮我们把过去靠经验完成的判断,变成可以复用、可以校准、可以规模化的组织能力。

过去,一个资深 HR 的判断,可能只能长在自己身上。

他知道什么人适合。 知道哪些简历是包装。 知道业务真正要什么。 知道哪些风险不能放过。

但如果这些判断不沉淀,团队就很难复用。

AI 也很难学习。

所以,AI+HR 的真正价值,不是让每个人少写几段话。

而是让组织的判断能力被结构化。


最后说一句

AI 落地不是先拼模型。

而是先拼组织有没有把自己的业务判断结构化。

对 HR 来说,真正的分水岭不是谁会问 AI 问题。

而是谁能把招聘、面评、绩效、人才盘点里的判断标准沉淀成资产。

如果我们没有标准,AI 只是在帮我们更快地产出一堆不稳定的内容。

如果我们有标准,AI 才能变成放大团队能力的工具。

所以,接下来我们做 AI,不是为了“显得先进”。

而是为了把 HR 过去靠经验完成的判断,变成:

  • 可复用的标准;
  • 可校准的方法;
  • 可沉淀的数据;
  • 可规模化的组织能力。

AI 工具不好用,很多时候不是模型问题。 是我们还没有把数据、标准和上下文准备好。