企业 AI 产品从原理到落地 · 第9篇
2025.07.29
AI 是一页一页翻 PDF 找答案的
为什么 AI 能在几十万份 PDF 中几秒钟
找到最相关的一段内容?
Embedding(向量化)的真正作用
AI · 原理 · 落地
EmbeddingRAG
💡 四个核心概念
AI 并不是一页一页翻 PDF。
AI 会先把文字转换成一串数字,这个过程叫Embedding(向量化)。
意思越相近,两段文字在数字空间里的距离越近。
Embedding 是 RAG 能够快速检索知识的基础。
一家制造企业,拥有 30 万份设备维修手册、15 万份售后工单、8 万份产品说明书和数千份技术规范。
售后工程师输入:"空调显示 E13 怎么处理?"
几秒钟后,AI 不仅找到了维修手册中的对应章节,还总结出了处理步骤。
很多人都会疑惑:AI 真的是把几十万份 PDF 全都读了一遍吗?当然不是,否则可能几分钟都找不到答案。
01
PART
AI 是怎么找资料的?
COORDINATE · 坐标类比
我们先来看一个生活中的例子。假设你第一次来到北京,想去故宫。导航软件为什么能立刻规划路线?原因很简单,因为每一个地点都有一个坐标。
...text
故宫
(39.916,116.397)
地图不会去翻每一条道路,而是根据坐标快速计算距离,找到最优路线。AI 查找知识,也是类似的思路。
02
PART
文字也能有"坐标"吗?
VECTOR · 向量化原理
答案是:可以
AI 不会直接理解文字,它真正理解的是数字。
例如一句话:"苹果手机充不了电。"经过 Embedding 模型后,可能变成:
...text
[0.182,-0.714,0.562,……]
这不是密码,也不是加密,而是一句话在数学空间里的位置。这组数字就叫向量(Vector),而生成这个向量的过程就是Embedding(向量化)。
03
PART
为什么意思相近的句子距离会更近?
SEMANTIC · 语义距离
来看三句话:
"苹果手机充不了电。"
"iPhone 无法充电。"
"手机一直充不上电。"
虽然文字不同,但表达的是同一个意思。Embedding 模型会认为它们的向量距离非常近。
而下面这句话:"今天深圳下暴雨。"向量距离就会非常远,因为它讨论的是天气,不是手机故障。
AI 并不是在匹配文字,而是在匹配语义。
04
PART
为什么关键词搜索做不到?
KEYWORD VS EMBEDDING · 搜索对比
传统搜索更多依赖关键词。例如搜索"苹果手机充不了电",如果文档写的是"iPhone 无法充电",关键词可能完全匹配不上,于是搜索失败。
而 Embedding 关注的是意思是不是一样。即使表达方式不同,它依然能够找到。
所以,企业 AI 的搜索体验远远好于传统全文检索。
05
PART
Embedding 是谁完成的?
MODEL · 模型与流程
很多人以为 ChatGPT 自己负责向量化,其实不是。通常都会有专门的Embedding Model(向量模型)。
一句话进入系统,第一步不是问大模型,而是先经过 Embedding 模型转换成向量。然后去知识库中寻找距离最近的内容,找到之后最后才交给大模型生成答案。整个流程往往只需要几百毫秒。
06
PART
Embedding 与 RAG 是什么关系?
RAG · 导航系统
上一篇我们讲过,RAG 的核心思想是"先查资料,再回答"。那么 AI 怎么知道应该查哪份资料?答案就是Embedding。
它负责把问题和知识库里的文档都转换成向量,然后比较距离。距离最近的,就是最相关的内容。
所以,Embedding 就像RAG 的导航系统。
很多企业上线知识库后,发现效果并不好,于是第一反应就是"模型太差"。其实很多时候,真正的问题并不在模型,而在Embedding。
如果向量没有正确表达语义,AI 就会找到错误的资料。即使后面的模型再强,回答也一定会出错。
所以,企业 AI 的效果不仅取决于模型,更取决于知识能不能被准确找到。
☕ 咖啡时间
为什么明明资料就在知识库里,AI 却没有找到?
很多时候并不是资料不存在,而是 Embedding 没有认为你的问题和那份文档足够相似。因此,提升企业 AI 的效果,很多时候不是换模型,而是优化知识切分、优化 Embedding 模型、优化检索策略。
///
LAST
写在最后
ONE SENTENCE · 一句话理解
很多人第一次接触 Embedding,都会觉得这是算法工程师研究的内容。其实,你只需要理解一句话:
「Embedding 的作用,就是把"文字"变成"意思"。」
AI 不再通过关键词寻找答案,而是通过语义寻找答案。也正因为如此,今天的企业 AI 才能够在几十万份文档中,几秒钟找到真正相关的信息。
📚 延伸阅读:如果你对今天的内容感兴趣,可以继续了解:Semantic Search(语义搜索)、Similarity(相似度计算)、Cosine Similarity(余弦相似度)。
《AI 产品经理必须懂的大模型基础》系列持续更新中。
上一篇:《为什么 ChatGPT 不知道你的公司资料?企业为什么都在做 RAG,而不是重新训练一个大模型?》
下一篇:为什么 AI 能在几亿条知识中,瞬间找到最相关的一段?向量数据库(Vector Database)的真正作用
《AI 产品经理必须懂的大模型基础》系列持续更新中。
可以保存这个图片,有事没事拿出来看看可以加深印象!
申明这个图片是AI生成,我觉得总结得还蛮好

夜雨聆风