ARTICLE · 1029651
AI必须知道的术语
AI必须知道的术语大模型层概念 Token 定义:Token是大语言模型处理文本的基本单位。模型不是一个字一个字地处理,而是把文本切分成Token(可以是一个字、一个词、一个词的一部分),每个Token对应一个数字ID。 通俗解释:就像读书时,你不是一笔一画地读,而是一个词一个词地读。Token就是模型的“词”。比如“人工智能”可能是一个Token,也可能被切成”人工”+“智能”两个Token,取决于分词器。 关键点: 1个英文单词大约是1-1.5个Token - 1个中文字大约是1-2个Token - 模型的上下文窗口大小就是用Token来衡量的(如128K Token) - API的计费也是按Token计算的。 常见的分词方法:BPE(Byte Pair Encoding)、WordPiece、SentencePiece 
上下文窗口(Context Window) 定义:上下文窗口是模型一次能处理的最大Token数量。包括输入的Prompt和输出的回答加起来不能超过这个限制。 通俗解释:就像人的短期记忆。你一次能记住多少内容,上下文窗口就是模型一次能“看到”多少内容。窗口越大,模型能参考的信息越多,就能处理更长的文档、更复杂的对话。 发展历程: - GPT-3:2K Token - GPT-3.5:4K → 16K - GPT-4:8K → 32K → 128K - Claude 2:100K → 200K - Gemini 1.5:1M → 10M Token - 2025-2026年:百万级甚至千万级上下文逐渐普及。 注意:上下文窗口大不代表模型能有效利用所有信息。“大海捞针”测试发现,很多模型对长上下文中间部分的信息利用效率较低。 预训练(Pre-training) 定义:预训练是大模型训练的第一阶段。用海量的无标注文本数据,让模型学习语言的基本规律、世界知识和推理能力。预训练的任务通常是”预测下一个Token”。 通俗解释:预训练就像一个人读了万卷书。通过阅读海量的书籍、文章、网页,他学会了语言、积累了知识、培养了逻辑思维。这个阶段不需要特定的任务目标,就是广泛阅读、打基础。 关键点: - 预训练是大模型成本最高的阶段(需要数千GPU运行数月) - 预训练数据通常是互联网上的公开文本,规模达万亿Token - 预训练完成后,模型就有了基本的语言能力和知识 - 预训练好的模型叫”基座模型”(Base Model) 
微调(Fine-tuning) 定义:微调是在预训练模型的基础上,用特定领域或特定任务的数据继续训练,让模型更适应具体场景。 通俗解释:预训练是读万卷书打基础,微调是针对某个专业方向深入学习。比如一个预训练模型什么都懂一点,但你想让它专门做法律问答,就用法律领域的数据微调一下,它在法律方面的能力就会大幅提升。 微调的类型: - 全参数微调:调整模型所有参数,成本高 - 参数高效微调(PEFT):只调整少量参数,成本低。包括LoRA、QLoRA、Adapter等 - 指令微调(Instruction Tuning):用指令-回答对训练,让模型学会遵循指令 - RLHF:基于人类反馈的强化学习,让模型的回答更符合人类偏好 对齐(Alignment) 定义:对齐是让AI模型的行为符合人类的价值观、意图和偏好的过程。简单说,就是让模型”说人话、办人事、有正确的价值观”。 通俗解释:预训练模型就像一个博学但没有教养的天才,它什么都知道,但可能会说脏话、会编造信息、会拒绝回答、会给出有害建议。 对齐就是”调教”它,让它变得有礼貌、有帮助、诚实、安全。 对齐方法: - SFT(监督微调):用高质量的人工标注数据教模型怎么回答。 RLHF(基于人类反馈的强化学习):训练一个奖励模型,用强化学习优化模型输出。 DPO(直接偏好优化):RLHF的简化替代方案,直接用偏好数据优化。 宪法AI(Constitutional AI):让模型根据一套”宪法”原则自我批判和改进。 对齐的挑战: - 对齐税(Alignment Tax):对齐可能会降低模型的部分能力 - 过度对齐:模型变得过于谨慎,拒绝回答合理问题 - 对齐泛化:对齐效果能否泛化到未见过的场景。 
幻觉(Hallucination) 定义:幻觉是指AI模型生成了看似合理但实际上不正确、不存在或无依据的内容。模型”一本正经地胡说八道”。 通俗解释:就像一个人吹牛,说得头头是道、有鼻子有眼,但全是编的。AI幻觉就是这样:它会编造不存在的论文、不存在的人物、不正确的事实、错误的代码,而且语气非常自信,让人难以分辨。 幻觉产生的原因: - 模型的本质是概率预测,不是事实检索 - 训练数据中可能包含错误信息 - 模型倾向于生成”流畅”的文本,而不是”正确”的文本 - 对于模型不确定的内容,它不会说”我不知道”,而是倾向于编造。 如何减少幻觉: - 使用RAG(检索增强生成),让模型基于真实资料回答 - 在Prompt中要求模型”只基于提供的信息回答,不知道就说不知道” - 对关键信息进行事实核查 - 使用引用来源功能,让模型标注信息出处 - 选择幻觉率较低的模型 重要提醒 :幻觉是当前大模型最核心的问题之一。使用AI时,永远不要盲目相信AI给出的事实性信息,尤其是涉及法律、医疗、金融、学术等严肃领域。关键信息一定要交叉验证。 温度(Temperature) 定义:温度是控制模型输出随机性的参数。温度越高,输出越随机、越有创意;温度越低,输出越确定、越保守。 通俗解释:温度就像”脑洞大小”。温度低的时候,模型循规蹈矩,总是选概率最高的词,输出稳定但可能单调。温度高的时候,模型天马行空,会选一些概率较低的词,输出有创意但可能不靠谱。 使用建议:事实性问答、代码生成,用低温度(0-0.3);追求准确、创意写作、头脑风暴,用高温度(0.7-1.0);追求创意、日常对话:中等温度(0.5-0.7);平衡 - 温度为0时,输出是确定性的(同样的输入总是同样的输出) 涌现能力(Emergent Ability) 定义:涌现能力是指当模型规模大到一定程度时,突然出现的小模型不具备的能力。这些能力不是被显式训练的,而是规模扩大后自然”涌现”出来的。 通俗解释:就像水加热到100度突然沸腾,在99度时还没有沸腾,到100度就突然沸腾了。模型能力也有类似现象:参数从1亿到10亿,某些能力几乎没有;但到了100亿、1000亿,这些能力突然就出现了。 常见的涌现能力: - 复杂推理(数学题、逻辑题) - 代码生成 - 上下文学习(In-context Learning) - 指令遵循 - 多步任务分解 争议:有研究者认为涌现能力可能是评估指标造成的假象,如果用更平滑的指标,能力增长可能是渐进的。但无论如何,大模型的能力随规模增长是事实。 
Prompt(提示词) 定义:Prompt是用户输入给AI模型的指令或问题。模型根据Prompt来生成回答。Prompt的质量直接影响模型输出的质量。 通俗解释:Prompt就是你对AI说的话。你说得越清楚、越具体,AI就越能理解你的需求,给出越好的回答。“写篇文章”是一个差Prompt,“写一篇500字的关于AI对教育影响的文章,面向中学生,语言通俗易懂,分三个小标题”是一个好Prompt。 Prompt工程:研究如何设计高质量Prompt的学科。核心技巧包括:明确角色、具体任务、提供背景、给出示例、约束输出格式、分步指令等。 提示词是使用AI的重要工具,或者说是人类连接AI的桥梁。我们平时用豆包聊天、查资料,如果你的提示词足够详细,你就能得到足够稳妥的答案。此外,在图生视频,文字生视频,文字生图等等都需要足够详细,准确的提示词,如果提示词不够详细,不够准确,你就会浪费更多的时间和精力。 
RAG(检索增强生成) 定义:RAG(Retrieval-Augmented Generation,检索增强生成)是一种技术:在模型生成回答之前,先从外部知识库中检索相关信息,然后把检索到的信息作为上下文提供给模型,让模型基于这些信息回答问题。 通俗解释:大模型就像一个博学但记忆不准的人。你问他问题,他凭记忆回答,可能会记错(幻觉)。RAG就是在他回答之前,先帮他查一下相关资料,把资料给他看,让他基于资料回答。这样回答就准确多了,而且可以引用来源。 RAG的核心流程: 1. 文档切分:把长文档切成小块(Chunk) 2. 向量化:把每个文本块转换成向量(Embedding) 3. 存储:把向量存入向量数据库 4. 检索:用户提问时,把问题也转成向量,在数据库中找最相似的文本块 5. 生成:把检索到的文本块和问题一起发给大模型,让模型基于这些信息回答 RAG的优势: - 减少幻觉,提高准确性 - 可以使用模型训练数据之外的最新信息 - 可以使用企业私有数据 - 可以引用来源,可追溯 - 成本低于微调 。 Agent(智能体) 定义:AI Agent是能够自主感知环境、做出决策并执行行动来完成目标的AI系统。与单纯的对话模型不同,Agent有目标、有记忆、能使用工具、能自主规划和执行多步骤任务。 通俗解释:普通的AI对话模型就像一个顾问,你问什么它答什么,但它不会主动做事。AI Agent就像一个助理,你给它一个目标(比如”帮我订一张明天去上海的机票,预算1000以内”),它会自己规划步骤、搜索航班、比较价格、甚至帮你下单,不需要你一步步指挥。 Agent的核心组件: 感知(Perception):接收用户指令和环境信息; 规划(Planning):把大目标分解成小步骤; 记忆(Memory):短期记忆(对话上下文)和长期记忆(历史信息); 行动(Action):调用工具(搜索、代码执行、API调用等) ; 反思(Reflection):评估行动结果,调整计划 Agent的能力边界: - 当前Agent在简单、明确的任务上表现较好 - 在复杂、模糊、需要大量常识的任务上还容易出错 - Agent的可靠性是当前研究的重点 - “Agent幻觉”,Agent可能会编造工具调用结果或任务完成状态。 
API(应用程序接口) 定义:API(Application Programming Interface)是让不同软件之间互相通信的接口。AI API就是让开发者能够通过编程方式调用AI模型能力的接口。 通俗解释:API就像餐厅的服务员。你(应用程序)不需要自己去厨房(AI模型)做饭,只需要向服务员(API)下单,服务员把订单传给厨房,做好后再端给你。有了AI API,你不需要自己训练和部署大模型,只需要调用接口就能使用AI能力。 常见AI API: - OpenAI API:调用GPT系列模型 - Anthropic API:调用Claude系列模型 - 字节跳动豆包API - 百度文心一言API - 阿里通义千问API - DeepSeek API API的优势: - 不需要自己训练和部署模型 - 按需付费,成本可控 - 随时使用最新模型 - 可以集成到自己的应用中 API一般主要是针对性编程以及各类AI工程师用得比较多,我们大部分人只需要知道哪个模型适合做哪些事就行。API对应的就会有API key,这个是对于想开发APP或者搭建网站的时候需要用到。 微调(Fine-tuning) (已在之前的章节详细解释,此处补充应用视角) 什么时候需要微调: - 需要模型适应特定领域的专业术语和知识 - 需要模型遵循特定的输出格式或风格 - 需要模型在特定任务上达到更高的准确率 - Prompt工程和RAG无法满足需求时 微调 vs RAG vs Prompt工程: - Prompt工程:最快、最便宜,适合大多数场景 - RAG:需要使用外部/私有/最新知识时,成本中等 - 微调:需要模型行为深度定制时,成本最高,效果最好。 
多模态(Multimodal) 定义:多模态是指AI模型能够同时处理和理解多种类型的数据(模态),包括文本、图像、音频、视频等。 通俗解释:传统的AI只能处理一种信息,要么只能看文字,要么只能看图片。多模态AI就像人一样,既能读文字,又能看图片,还能听声音,并且能把这些信息结合起来理解。比如你给它一张图片加一段文字描述,它能结合两者来回答问题。 多模态的典型能力: - 图文理解:给图片回答问题、描述图片内容 - 文生图:根据文字描述生成图片 - 语音交互:听懂语音、用语音回答 - 视频理解:分析视频内容、回答视频相关问题 - 跨模态生成:文字→图片、文字→视频、图片→文字 代表模型:GPT-4o、Claude 3.5 Sonnet、Gemini、Qwen-VL、LLaVA、即梦、Sora。 向量数据库(Vector Database) 定义:向量数据库是专门存储和检索向量(高维数字数组)的数据库。核心能力是”相似度搜索”,给定一个查询向量,快速找到数据库中最相似的向量。 通俗解释:传统数据库是”精确匹配”,你搜”苹果”,它找包含”苹果”的记录。向量数据库是”语义匹配”,你搜”苹果”,它能找到”水果”、“iPhone”、“平安果”等语义相关的内容,因为这些内容在向量空间中距离很近。向量数据库是RAG系统的核心组件。 常见向量数据库: - Chroma:轻量级,适合入门和小型项目 - Pinecone:托管服务,开箱即用 - Milvus:开源,企业级,高性能 - Weaviate:开源,支持混合搜索 - pgvector:PostgreSQL的向量扩展,适合已有PG的团队 - FAISS:Facebook开源的向量搜索库(不是完整数据库)。 
Embedding(嵌入/向量化) 定义:Embedding是把文本、图像等非结构化数据转换成高维向量(一串数字)的过程。转换后的向量能表示数据的语义信息,语义相似的内容,向量距离也近。 通俗解释:就像给每个词、每句话分配一个”坐标”。意思相近的词,坐标也离得近。比如”国王”和”女王”的向量距离很近,“国王”和”汽车”的向量距离很远。有了Embedding,计算机就能”理解”语义相似度了。 Embedding的用途: - 语义搜索:按意思搜索,而不是按关键词 - RAG检索:找到与问题最相关的文档片段 - 聚类:把相似的内容自动分组 - 推荐系统:推荐语义相似的内容 - 异常检测:找到语义上”格格不入”的内容 常见Embedding模型:OpenAI text-embedding-3、BGE、GTE、E5、Cohere Embed 关注公众号 回复「AI」 即可领取完整的电子书资料!







