乐于分享
好东西不私藏

当你向AI提问,它是怎么"懂"你的?

当你向AI提问,它是怎么"懂"你的?

打开手机,在AI对话框里敲下一句:"明天北京会下雨吗?"

不到一秒,答案出现了。

再问:"苹果公司是谁创立的?"AI依然毫不犹豫。

然后你问:"巴黎在哪个国家?"它回答了法国。你紧接着问:"那里的官方语言是什么?"——它知道"那里"是巴黎,没有让你再解释一遍。

这三个问题,表面上都是"问答",但背后发生的事情完全不同。AI是真的在"理解"你,还是只是在用某种方式凑出了一个像样的答案?

从"写死答案"到"自己推断":机器经历了什么

第一阶段:把答案提前写进去

上世纪60、70年代,工程师想让计算机回答问题,用的办法很直接——把所有可能的问题和答案对应关系,提前写进一张表格里。

用户输入"日本的首都是什么",程序识别到"日本"和"首都"两个关键词,查表,返回"东京"。

这个方法清晰,但问题也清晰:覆盖范围只有表里写过的内容,问题换个说法,程序就不认识了。这不是在理解问题,只是在做匹配。

第二阶段:让统计数据替代人工规则

90年代,随着可用的文本数据大量增加,工程师换了一个思路:不再手动写规则,而是让程序扫描大量文章,通过统计词语共同出现的频率来推断答案。

用户问"谁写了《哈利·波特》",程序统计在海量文本里,"哈利·波特"和哪个名字同时出现的次数最多——J.K.罗琳自然浮出来了。

这是真正意义上的"从数据中学习",而不是靠人去一条条定义。但它的局限在于只能抓住字面上的统计关联,遇到语义复杂、表达多变的问题,错误率就上来了。

第三阶段:深度学习让机器学会"理解结构"

近十年,神经网络尤其是Transformer架构的出现,让机器处理语言的方式发生了根本变化。程序不再只统计词与词的共现频率,而是学会了理解句子结构、词语之间的语义关系,乃至上下文中隐含的意图。

在此基础上,BERT、GPT系列等大语言模型进一步把这个能力推到了新高度——它们先在超大规模文本上做预训练,积累起通用的语言理解能力,再来处理具体问题。这就是今天你用的AI对话产品背后的核心逻辑。

四种问答系统,四种不同的"解题方式"

即便都叫"智能问答系统",不同产品内部的工作方式可能完全不同。理解这一点,才能明白为什么有的AI"记性好",有的AI"爱瞎编"。

知识库问答:结构化事实的精准调取

这类系统背后存放的是一个人工整理好的结构化知识库,里面记录了大量实体和它们之间的关系。用户问"巴西的首都是哪里",系统在知识库里找到"巴西→首都→巴西利亚"这条关系,直接返回答案。

它的优势是准确、可验证,特别适合医疗、法律等容不得模糊的场景。代价是知识库必须由人工维护,覆盖范围之外的问题无法回答,更新也慢。

检索式问答:在大量文本里找最相关的段落

这类系统不依赖预先整理的知识库,而是把用户的问题和候选文本都转换成向量,通过计算相似度,找出与问题在语义上最接近的段落,作为答案返回。

它的覆盖范围远比知识库系统广,能处理各种开放性问题。但答案质量直接取决于原始文本数据的质量——如果候选文本本身就有问题,检索出来的答案也不会好到哪里去。

对话式问答:记住上下文,跨轮次理解意图

前面提到的例子——先问"巴黎在哪个国家",再问"那里的官方语言是什么",AI能把"那里"对应到巴黎——这就是对话式问答在处理的核心问题:跨轮次维护对话上下文。

它需要模型在每一轮回复后,持续追踪整个对话状态,而不是把每句话当成独立问题来处理。这也是为什么今天的AI助手在多轮对话时越来越"聪明"——它在动态积累你们的对话历史。

生成式问答:直接造出一个答案

前三种问答系统,本质上都是在"找答案"——从知识库、文档或对话历史里取用现成的内容。生成式问答不同,它直接输出新的文本,而不是从任何预设来源里调取。

这让它能够回答那些没有标准答案的问题,比如"如果莎士比亚生活在现代,他会怎么看智能手机"。检索系统找不到这个答案,但生成式系统可以基于对语言和知识的理解,给出一个逻辑自洽的回答。

代价是:生成式系统可能产生听起来合理但实际上错误的内容。如何控制生成内容的准确性,至今仍是这个领域最核心的挑战。

技术在跑,但有些问题不能被甩在身后

从硬编码的规则表,到能进行多轮对话、自主生成答案的大语言模型,智能问答系统走过了几十年的演进。每一次技术跃迁,背后都是对"机器如何理解语言"这个问题更深的一次逼近。

但越往前走,一些根本性的问题就越难回避:

AI给出的答案,是真实可信的吗?它在回答问题的过程中,是否在收集和利用你不知道的信息?它那些看似中立的回答里,是否夹带着训练数据中积累下来的偏见?

技术可以持续迭代,但这些问题不会随着技术进步自动消失——它们需要被认真对待,和技术发展并行推进。

这或许是智能问答留给我们每个人的,真正值得思考的那道题。

感谢阅读,喜欢就关注我,持续更新