乐于分享
好东西不私藏

你问 AI 要个数,它敢说,你敢信吗?

你问 AI 要个数,它敢说,你敢信吗?

这几年和不同公司的数据团队接触下来,大家的主要精力已经从复杂的数据加工转向了智能问数,也希望用数据智能驾驶坐仓替代传统的 BI 大屏。从公司效率上讲,需求是实在的,因为以前要个数得提需求、排期、分析师写 SQL、跑数、核对、出报表,快则半天,慢则两天。现在对着屏幕打一行字,几秒钟数就出来了。

技术上这早能做到,所以让大家内心都有一个冲动,实现它,给公司提升效率。我想聊的是另一半:它给你的那个数,你敢信吗。 特别在无约束的环境下它大不了最后说这个数是它编的,你又能怎样,总不能给它断电吧。

先看一个数字:智能问数正确率 42%

有个公开基准叫 BIRD,专门测自然语言转 SQL 准不准。现在最好的系统,受控条件下能到 82% 左右。

但"受控"有前提:数据干净、schema 提前建好模、还得给模型喂不少提示。换成企业里那种没怎么整理过的数据,准确率就掉到 42% 上下了,这是 LiveSQLBench 测出来的。

42% 什么概念。问十个问题,将近六个数是错的,而且它不告诉你哪个对哪个错。就算是受控下最好的 82%,也还有近两成是错的。而业务要的,是接近 100%。

LLM 的胡说比较难克服

人算错了会心虚,会补一句"这个我不太确定你再核核"。AI 不会,会一本正经的胡说。

你问它华东区销售额,它可能 join 错表,可能把下单金额当成实付金额,也可能忘了过滤退款。然后甩给你一个格式工整、看着挺像回事的数字,眼都不眨。你就拿着它去开会了。

没数的时候,你知道自己不知道,会去查。错数最坑的地方是,你以为自己知道了。所以一个什么都敢答、还答得特别肯定的问数工具,我是真不敢往生产上放。最经典的案例是 2023 年美国的 Mata 诉 Avianca 航空案。原告律师图省事,用 ChatGPT 找判例支撑辩护,ChatGPT 一口气给了 6 个看着有名有姓的"历史判例"。律师追问"这些是真的吗",ChatGPT 反复咬定是真的,还煞有介事地给出了判决全文。结果开庭时被对方和法官戳穿:6 个判例全是 ChatGPT 编的,压根不存在。两名律师被罚了 5000 美元。 LLM 乱说感觉也是通病了。

真实测试案例

近期我拿一张真实的用户购买记录的行为表测试,将近一亿行。两个测试用例也让我看到 AI 的真实能力。

第一件,让它自动给这张表建模。它扫一眼字段,痛快地把 user_id 定成了主键。名字带 id 嘛,看着是那么回事。可这张表 9891 万行,去重用户只有 98.8 万。一个用户上百条行为,user_id 怎么可能是主键。它就是照着字段名猜的,根本没去数据里数一下这列唯不唯一。我要真信了,后面凡是跟"用户数""按用户去重"沾边的口径,全得跟着错,还错得不吭声。

第二件更典型。我问它复购率,三秒给了个数,还配了句"复购健康"。可我根本没跟它说清"复购"算什么。买过两次算,还是一个月内买两次?退款那单扣不扣?它自己脑补了一套。更要命的是结构就算错了:复购率得先按用户汇总每人买几次,再看买两次以上的人占买过的人的比例,是两层。它上来想在明细表里一把梭。后来把口径一条条摊开、问清楚,固化成一条写死的指标,再跑,真实复购率是 65.81%。跟我绕开这套东西、自己手写 SQL 查的结果,一分不差。

数对不对,跟 AI 算得多快没关系。就看口径有没有人拍板,系统记没记住。指标和口径的统一非常重要。

做不好总抱怨模型不给力

有人会说,那是模型还不够强,再聪明几代就好了。我不这么看。这两年模型强了多少大家都看得见,可 BIRD 受控分一直涨、一碰真实数据就崩,光用智商解释不通。

还拿订单表说。里头有个字段 o_totalprice。模型看到它,怎么知道这是下单金额还是实付?含不含税,扣没扣退款,什么币种,能不能直接加起来当 GMV?

它不知道。因为这些压根不在表结构里,在财务脑子里,在一份没人维护的口径文档里,在老员工口口相传的约定里。模型能看见的只有字段名和类型,别的全靠猜。前面那两个坑,主键也好复购率也好,说到底是一回事:该人定的口径没人定,它就替你定了,它是没有上限的 LLM。 BIRD 42% 的错误可能就是这么来的。后来 dbt 2026 的 benchmark 也印证了这条路:裸问 SQL 对付轻度建模的 schema 大概 70%,一旦配上语义层,在它覆盖到的范围内准确率能冲到接近 100%,而且超出范围的问题它直接拒答,不硬编。这才是我想要的:答得准,或者老实说不知道。所以要补的不是把模型搞得更聪明,是得把那些只在人脑子里的业务口径,变成机器能读的东西喂给它。这东西业界叫语义层。

语义层业界现状及展望

让 AI 读懂数据,现在全行业都在做,但路子不一样,分歧还不小。后续我想通过一个小的系列和大家一起探索交流一下。

目前 Snowflake 和 Databricks 这两个巨头,是把语义层做进自家仓库里,Snowflake 因为今年 summit 宣扬 AI 的引入,也让股价大涨。刚拿了黑石领投的 1700 万美元 A 轮融资的 TextQL,直接掀桌,说语义层只是打补丁,本体(ontology)才是解药。还有老牌语义层王者 Cube 这类,做的是不绑任何仓、能到处搬的独立语义层。

谁对谁错,现在没定论,大家都在尝试, AI 这个路上,现在大家都是 Builder。但把这几条路捋明白,你大概能看清"让 AI 读懂数据"到底难在哪,也能想清楚一件事:什么样的 AI 问数,才是你敢信的。

这个系列我一家一家讲。下一篇先看家底最厚的两个巨头 Snowflake 和 Databricks,它俩几乎给了同一份答卷:把语义层焊进自家平台里。

你现在用的 AI 问数,敢信它给的数吗?评论区聊聊。


阿炳数记 · AI 读得懂你的数据吗 · 预热篇下期 Vol.1:《AI 问数,Snowflake 和 Databricks 是怎么做的?答案意外地一致》该系例大概 5-6 篇。如果对这个系列感兴趣,也欢迎添加作者 wx 入群交流,后续有 PDF 总版本提供。

参考来源

  • • BIRD-SQL 基准:https://bird-bench.github.io
  • • LiveSQLBench(真实企业数据 42%):https://livesqlbench.ai
  • • dbt 2026 benchmark(语义层内近 100%、覆盖外 0%):https://docs.getdbt.com/blog/semantic-layer-vs-text-to-sql-2026
  • • Mata v. Avianca 案(律师用 ChatGPT 编造 6 个判例被罚):https://www.reuters.com/legal/new-york-lawyers-sanctioned-using-fake-chatgpt-cases-legal-brief-2023-06-22/
  • • TextQL 完成 1700 万美元 A 轮融资(Blackstone 领投):https://www.textql.com/blog/textql-raises-17m-blackstone
  • • TextQL 檄文《Semantic Layers Are a Patch. Ontologies Are the Fix.》:https://www.textql.com/blog/semantic-layers-are-a-patch