AI 问答:从“AI 味”一路聊到大语言模型底层
Q:AI 为什么老喜欢用“写到这里”“值得思考的是”“真正重要的是”“从这个角度来看”这些词? A: 这些词本身没有问题,人类作者也经常使用。真正的问题是,它们在高质量文章中承担着固定的结构功能,例如引出分析、转换视角、总结观点。大语言模型在预训练时学习的是海量文本中的统计规律,因此会学到:“文章写到这个位置,这种表达出现的概率最高。”所以它不是背了一份高频词清单,而是学习了这些表达通常出现在什么位置。Q:把这些词删掉,是不是就没有 AI 味了? A: 不是。真正的 AI 味更多来自整篇文章的组织方式,而不是几个连接词。例如大量 AI 文章都遵循“提出问题→分析原因→换个角度→总结升华”的节奏,即使连接词全部替换,读者仍然会觉得风格相似。因此,AI 味更接近一种模板化的表达,而不是几个固定词汇。Q:可是固定结构明明是我要求 AI 写的,这也算 AI 味吗? A: 固定结构本身没有问题。优秀文章本来就应该逻辑清晰。问题在于,AI 往往会把不同主题都组织成几乎相同的结构,并且使用相似的句式和节奏。当所有文章都采用同一种模板时,就容易产生“AI 味”。Q:AI 为什么越来越倾向于使用这些模板? A: 因为模型训练的目标不是寻找最有个性的表达,而是寻找统计意义上最合理、最容易理解、最容易获得好评的表达。对于同一个意思,人类可能有几十种说法,模型会更倾向选择高概率、高成功率的那一种,因此语言会逐渐收敛到一种“平均风格”。Q:AI 真的只是预测下一个 Token? A: 这是正确但不完整的说法。从数学定义来看,大语言模型最终确实是逐个预测下一个 Token(词或词的一部分)生成文本。但这是输出机制,而不是全部能力来源。现代 AI 通常还结合了推理(Reasoning)、工具调用(Tool Use)、检索增强(RAG)、长期上下文(Long Context)、规划(Planning)、记忆(Memory)等能力。最终输出仍然是一串 Token,但这些 Token 往往已经经过分析、推理甚至搜索,而不是简单接龙。Q:Transformer 已经过时了吗? A: 没有。今天的大模型已经远远不是 2017 年论文里的原始 Transformer,而是在其基础上加入了更高效的 Attention、Mixture of Experts(MoE)、长上下文、工具调用、推理等能力。Transformer 仍然是主流模型的重要基础,但已经成为整个 AI 系统中的一个组成部分。Q:AI 为什么能懂这么多知识?它真的只是“猜”吗? A: 不是。预训练阶段,模型已经把大量知识压缩进参数中。这些知识不是以百科全书的形式保存,而是以高维数学表示(Representation)的形式分布在参数里。回答问题时,模型不是去数据库查答案,而是在这些表示之间进行计算,最后再生成文字。Q:什么叫“干净的数据”? A: 干净的数据并不是把坏内容全部删除,而是提高训练数据质量。包括去重、去乱码、去广告、过滤爬虫错误、减少低质量自动生成内容,同时尽量保留准确、完整、有价值的信息。真正困难的是平衡“高质量”和“多样性”,因为过度清洗也可能让模型越来越像“标准答案生成器”。Q:AI 为什么总是这么礼貌、正向? A: 并不是因为训练前删掉了所有负面内容。预训练阶段,模型仍然会学习暴力、诈骗、仇恨等真实世界信息,否则它无法理解这些概念。真正改变行为的是后训练(Post-training),包括 Instruction Tuning(指令微调)、Preference Optimization(偏好优化)、RLHF(人类反馈强化学习)等步骤,它们共同塑造了模型“有帮助、诚实、减少伤害”的行为倾向。Q:新闻里说的非洲标注员到底在做什么? A: 他们主要参与数据标注和人类反馈。例如判断内容是否包含暴力、色情、仇恨、自残,或者比较两个回答,选择哪个更准确、更礼貌、更安全。这些标注不会直接写进程序,而是成为后续训练的数据,帮助模型逐渐形成符合人类偏好的行为。Q:Instruction Tuning 到底是什么? A: 可以理解为“教 AI 怎么当助手”。预训练后的 Base Model 已经懂很多知识,但不一定知道用户是在给它任务。Instruction Tuning 会提供大量“用户指令→理想回答”的样本,例如“翻译”“总结”“解释”“写邮件”,不断调整模型参数,让它学会按照用户要求完成任务,而不是继续模仿网页文本。Q:参数到底是什么?Karpathy 说 AI 帮他调参数,又是什么意思? 第一,模型参数(Parameters),也就是神经网络中的权重(Weights)和偏置(Bias),通常有几十亿到几千亿个,它们存储了模型学到的知识。 第二,超参数(Hyperparameters),例如 Learning Rate、Batch Size、Optimizer、Epoch 等,由工程师设定,决定模型如何训练。 第三,推理参数(Inference Parameters),例如 Temperature、Top-p、Max Tokens,用来控制模型生成时的风格和随机性。 Karpathy 提到 AI 帮他“调参数”,很多时候指的是帮助寻找更好的超参数组合,而不是修改几千亿个模型参数。 Q:模型参数为什么能存储知识? A: 参数不是数据库,也不是一本百科全书。它们更像是一个高维数学空间中的知识表示。模型不会保存一句完整的话,而是把概念之间的关系编码进大量参数中,因此能够迁移知识、类比推理,而不仅仅是记忆训练数据。Q:我是不是走偏了?还不会开车,就开始研究发动机。 A: 如果目标是尽快完成工作,确实应该先学会使用 AI、写代码、做项目,这是“先开车”。但如果想真正理解 AI 为什么会这样工作,底层知识迟早绕不过去。比较好的方式不是等完全学懂发动机再开车,而是一边实践,一边逐步理解底层原理,让两者相互促进。