
先澄清一下:不出书,不卖课,不融资,不起号,单纯写着玩儿,也没有稿费(想有)。
情况是这样,昨晚有个朋友微信我:"你天天发 AI 的水文,能不能用大白话讲讲到底什么是 Token?想想在这个AI时代能干点什么。。。"
我说巧了,我在5月份就写了个名词解释的稿子,一直没润色完,要不发你看看。。。
然后,就没有然后了。。。。。我想了想,大概是稿子写的太差,无从吐槽。
(对不起。)
那好,撕了重来。
第一节:Token 到底是个什么玩意儿
"你们这些搞 AI 的,每天说 Token Token,Token 到底是什么?是钱吗?"
不完全是钱,但确实耗钱(确信!)。
Token 最简单的理解方式:文字在被模型吃掉之前,会被切成小块块。
可能是一个词、半个词、一个汉字,也可能是一个符号。
怎么切?看模型心情——不对,看它自带的 tokenizer 怎么设计的。
举个例子,"我爱吃苹果",可能切成"我/爱/吃/苹果"四个块。如果是 "I love transformers",可能就切成 "I/love/transform/ers"。
看到最后一个没?transformers 被拦腰截断了。
为什么?不为什么,人家的分词器就这么定的。工程产物,没有哲学意义。
你可能会问:那为什么不干脆按字切?或者按完整词切?
答案是——全是工程妥协。按字切词表小但序列太长,模型要自己拼词义,效率低。按完整词切,光英语就几十万个词,新词(比如 "deepseek"、"agentic")天天冒,词表根本装不下。
子词切分就是在词表大小、序列长度和覆盖能力之间找一个平衡点。
跟 Token 相关的还有一件事:不同模型对同一句话切出来的 Token 数可能不一样。
所以你说"我买了 100 万 Token",在不同模型那里,能聊的内容量是不一样的。
钱也是不一样的。
(是的,这句话才是重点。)

所以 Token 不是什么玄学概念。它是模型读写信息时用的基本计数单位。
第二节:Embedding(向量化)——把文字变成数学
好,现在文字被切成了 Token,每个 Token 被分配了一个编号。
比如"帅哥"是 3746,"大叔"是 9812,"赖赖"是 3666。
问题来了:3746 和 3666 在数字上相邻,但"赖赖"和"帅哥"在语义上也靠近吗?
不一定。编号只是身份证号,不代表位置远近。叫赖叔—。— 。
于是 Embedding 出场了。
它的工作就是把 Token 的编号,变成一串数字——也就是向量。
"投资" → [0.23, -0.45, 0.67, …, 0.12]
如果这串数字有 768 位,那"投资"就处于一个 768 维的空间里。
你问 768 维空间长什么样?我不知道。。。我这脑子想不出来。
大家只需要知道:数学上,它和二维、三维坐标系是同一种东西。只是人类的眼睛看不到 768 维而已。
这里有两个细节:
第一,向量里的某一维,通常不能直接叫"金融程度"或"动物性"。语义分布看的是数组,而不是某一个轴。谁要是跟你说"第 520 维是情感指数",你可以保持礼貌的微笑,让他滚蛋。
第二,Token 刚进模型时有一个初始向量。但在经过几十层 Transformer 运算后,它会变成跟上下文有关的另一个向量。同一个"苹果",在"吃苹果大赛新闻稿"和"苹果公司财报"里,最终向量是不一样的。
(这大概就是 Context 的数学意义。)

还有个容易混淆的事:企业知识库常说的"Embedding",往往是专门做检索用的句子向量,那个是用来做RAG知识库的,不是一回事。这个是路牌,之前那个是发动机零件。
第三节:Transformer——怎么让上下文真正生效
在 Transformer 出现之前,处理文字的主流方式是 RNN 类的模型。
它们有一个特点:像看小说一样,一个字一个字顺着读,读完前面才能读后面。
(不能跳到后面去看结局。)
这就导致两个问题:一是很难并行运算,训练速度慢;二是离得远的信息容易记不住。
Transformer 的突破在于"注意力机制"——序列里任意两个位置之间,可以直接通信。
读这句话:"这家公司的收入增长了,但利润下降了。"模型在处理"下降"的时候,可以直接参考"利润"这个词,而不需要顺着"收入增长了但"一步一步摸过来。
听起来不复杂对吧?但就是这句话,让 2017 年的那篇《Attention Is All You Need》开启了整个大模型时代。
不过也别把 Transformer 神话了。 它解决了并行问题和长距离依赖问题,但没解决所有问题。上下文越长,计算成本越高,注意力也还是会被分散——跟人类一样,书看厚了也会忘前面的。
而且它生成回答的时候,仍然是一个 Token 一个 Token 往外蹦的。这个没变。

第四节:LLM 到底怎么工作的?一句话说清楚
整个流程总结一下:
文本 → 切成 Token → 变成初始向量 → 几十层 Transformer 反复运算 → 预测下一个 Token 是什么 → 挑一个输出 → 继续预测 → 继续输出…
是不是看起来有点像"一直猜下一个字是什么"?
是,也不是。
从训练目标看,LLM 确实是"下一个 Token 预测器"。但这个目标可以催生出很多超出直觉的能力——语言理解、代码生成、多步推理、写诗、写合同、甚至写代码写到自己都看不懂。
这不是"背诵"能达到的。
现代模型通过三个阶段的叠加才走到今天。
你可以这么理解:
预训练——就像一个人读完了整个图书馆的书。什么都看,来者不拒,不知道将来会用到哪本,先装进脑子里再说。体现的是知识量。
后训练——读完了书,还得有人告诉你面试时怎么说比较讨喜。别把全场气氛搞僵,别在简历上写"我没读过",该引用谁、不该提什么,这些都靠后训练来调教。体现的是表达能力和工具调用能力。
推理时计算——碰到真正难的题了,考官说"别急着交卷,验算一遍"。这是模型自己多花点算力来检查、纠错、想清楚再答。
所以谁再说"LLM 不就一个猜字游戏吗",你可以回:是的,但人类的本质也就是复读机。
(当然,对方可能觉得你在装逼。那就算了。)

第五节:模型是不是越大越厉害
前几年有一种风气——拼参数量。
百亿、千亿、万亿,一个比一个大。大厂不搞个千亿级模型都不好意思亮相。
这背后有一个客观规律叫 Scaling Law:在合理范围内,模型变大、数据变多、算力变强,效果通常会变好。
但这不意味着"越大越牛"。
2026 年的竞争已经不是"谁参数多"了。大家可以扳着指头数一数:
后训练好不好,决定模型听不听话 推理时计算强不强,决定难题解不解得开 数据质量高不高,决定基础能力上限 效率优化行不行,决定成本能不能打 MoE(混合专家模型)好不好,决定你花一次钱能激活多少能力
通俗地说:从比块头,变成比谁用得聪明。

还有一个有意思的现象:涌现。
有些能力在小模型上完全不行,模型大到一定程度突然就出现了。比如三位数加法,小模型是 0 分,大模型突然 80 分。
这被一些人解释为"智能相变"。
但也有研究发现:这个"突然"可能是评分方式造成的。如果你只给"全对/全错",平滑进步也会看起来像跳变。换成连续评分,有些能力就变得不那么"涌现"了。
(学术界还在吵。我们吃瓜的看着就好。反正我也没懂,我就是个用户,哪个模型大碗便宜好用我就用谁。)
第六节:模型到底会不会推理
这可能是 AI 圈吵得最凶的问题之一。
一派说:会。都解决数学竞赛题了还不会?
一派说:不会。它只是看起来会,实际上在模仿推理的样子。
我的判断:站在 2026 年,说"完全不会推理"已经不太站不住了。
现在的前沿模型可以完成相当复杂的数学证明、编程任务、科学推理。而且碰见难题放慢节奏、检查多遍之后,表现确实会更好。
这不太像"只是在模仿"。
但说"它跟人类一样会推理"也别急着点头。
它的推理有几个特点:
同样的问题,每次答案可能不一样 中间步骤看起来合理,但可能是错的 任务链条越长,错误越容易累积 提示词好不好、上下文全不全,效果差很多 没有天然的"正确性保证"
所以最稳妥的说法是:
LLM 能表现出很强的推理能力,但这种能力是概率性的、跟任务相关的。需要通过工具、验证和评价机制来提高可靠性。

翻译成人话:怀疑怀疑的怀疑(最近在看低智商犯罪)。
第七节:RAG、Workflow 和 Agent 到底什么关系
到了真刀真枪做产品的时候,混乱就来了。

"我们上了 Agent!" ——实际是接了一个知识库的聊天机器人。
"我们做了 RAG!" ——实际是把文档扔进去然后问问题。
"我们用的是 Workflow!" ——实际是写了几个 if-else。
停一停,我们把这几个概念排清楚。
RAG:先找资料,再回答
全名叫"检索增强生成"。流程是:
用户提问 → 去数据库/知识库翻资料 → 把结果塞进上下文 → 模型基于这些材料回答
像开卷考试。
但开卷考试不等于不会错。RAG 可能有以下翻车姿势:
没查到正确资料 查到了过期信息 两篇文档互相矛盾 模型看了一眼资料,然后无视了它
所以 RAG 能有效降低幻觉,但不能彻底消灭幻觉。最终结论还是需要人工核对。

Workflow:人是导演
读文档 → 提取字段 → 算指标 → 套模板 → 生成报告
每一步干啥,人已经定好了。模型只是某一环节的执行者。
优点是稳定、便宜、好审计。
Agent:模型自己当导演
接目标 → 自己制定计划 → 选工具 → 动手干活 → 看结果 → 不行就换个方式 → 继续干或找人类
模型在这套循环里,是决策核心。
所以 Agent 不是"接了个知识库的聊天机器人",而是一个能观察环境、选择行动、调用工具、检查结果并不断调整的系统。

什么时候用哪个?
规则清楚、风险高的 → Workflow。稳定可控。 路径写不死的、需要多轮尝试的 → Agent。灵活但有不确定性。
有些人把 Agent 吹得神乎其技,有些人嫌 Workflow 不够高级——都不对。选工具看场景,不看时髦程度。
第八节:Agent 会不会越用越聪明
好问题,也是最容易被问到的问题之一。
答案:不会自动变聪明。
一个Agent跑三个月,不会自己变成超级智能。原因很简单:每次推理用的都是同一套固定的模型权重。 它没有“记忆”这个功能——昨天犯的错,今天不会自动记住;处理过一万个客服工单,也不会自动积累经验。
你感觉它“变聪明了”,通常只有两种可能:
你换了更好的模型(或者模型厂商升级了版本) 你改进了外围的Harness——加了更多知识文档、优化了检索、调了系统提示词、修了工具参数
后者本质上不是模型变聪明,是外部信息供给变好了。要让它变好,必须建立明确的优化闭环:
记下运行记录 → 评价结果好不好 → 分析为啥翻车 → 更新知识库/工具/提示词/流程 → 回归测试 → 再上线
每一步都要人参与。
可以改进的部分很多:
模型可以换版本、换小模型、换擅长不同任务的模型 知识库要加新资料、删过期内容、优化检索方式 工具要接入更多系统、写好参数说明、做好错误提示 工作流要根据翻车案例持续调整 最重要的是——要有测试集和评价指标
没有评价机制,你只会觉得"这系统好像越来越对你胃口"。
日子过久了,你们只是熟悉了而已。
总之:变聪明靠人,不靠魔法。模型不动,动的是周围的一切。

第九节:终极一问
现在来回答朋友最后一个终极问题:
"所以到底怎么搞?搞钱。"
这个问题我也不知道。。。价值么,总是体现在为人民服务上的。AI时代,别盲目自high就行。
顺便把常见 Q&A 也做了:
Q:模型是不是越用越聪明? 不,单次对话不改权重。感觉变聪明了,通常是因为上下文多了、记忆存了、知识库更新了、或者产品升级了。模型变强要靠持续的训练和新版本。
Q:是不是接个知识库就叫 Agent? 不一定。知识库解决"知道什么",Agent 强调"自己决定下一步做什么"。只会检索后回答的可以是 RAG 应用,但不一定是 Agent。
Q:RAG 能解决幻觉吗? 不能彻底解决。可以提供最新资料减少错误,但检索和生成都还可能出问题。
Q:越自主越先进? 不一定。规则清楚的任务,Workflow 更稳定、更便宜、更好审计。把灵活性加到不需要的地方是一种浪费。
Q:模型、数据、系统哪个更重要? 三者都重要,没法单选。强模型提上限,好数据给依据,好的 Harness 决定能不能落得了地。目前看来,大众能参与也能产生价值的部分在数据。
Q:企业怎么让 AI 越用越好? 不是无限堆文档。是记录运行数据、定义评价标准、分析失败原因、针对性优化、回归验证。这是个工程问题。

这个就有点接近最近的新词儿Loop了。AI圈子造不完的新词儿,等我学习学习再来掰扯~~
最后一句话
本文没有最后一句话。
这篇稿子最早是计划写给内部分享的。后来没用上,觉得不分享出来有点可惜,就改了稿子公开算了,还有不少图其实是上次生成的。。。有些地方用了夸张的写法来让内容好咽一些,但稿子还是认真写的。
欢迎转发。不用问我。
夜雨聆风