星漫宇航|AI名词百科 · 第16篇
同一个模型、同一个问题,为什么有时回答简洁稳定,有时措辞更丰富,甚至出现不必要的发挥?
有人会说:“把Temperature调低一点。”
也有人会说:“模型效果不够好,需要重新训练、调一下参数。”
两句话都用了“调参”,调整的对象却不在同一层。
上一篇介绍了Parameter:模型在训练中形成的可学习数值。这一篇继续解释:
训练模型时调整Parameter,训练前后设置超参数,以及调用模型时修改Temperature,为什么是三件不同的事?
先看结论
1. 模型参数(Parameter)由训练过程更新,构成模型内部的数值状态。
2. 训练超参数控制模型怎样学习,例如学习率、批量大小和训练轮数。
3. 推理设置控制一次生成怎样进行,例如Temperature、Top-p和最大输出长度。
4. 修改推理设置通常不会永久改写模型参数,也不会让模型获得原本没有的信息。
一、Temperature改变了什么?
假设我们让同一个模型完成同一项任务:
“请把会议记录整理成三条结论。”
Temperature较低时,生成结果通常更集中。模型会更偏向概率较高的候选Token,因此多次运行的措辞和结构往往更接近。
Temperature较高时,候选Token之间的概率差距会被压平,原本概率较低的候选更有机会被选中。输出可能更多样,也更容易出现偏离任务的表达。
这里有两个边界。
第一,Temperature并不是“智能程度旋钮”。调高不会让模型获得更多知识,调低也不会让模型自动变得更准确。
第二,Temperature为0或较低,也不等于结果在所有系统中都完全可复现。服务端实现、并行计算、模型版本和其他采样设置都可能影响输出。
Temperature调整的是当前生成过程,不是模型内部已经训练好的Parameter。

同一个输入经过不同Temperature设置,候选Token的选择会发生什么变化?
二、模型参数、训练超参数和推理设置分别是什么?

“参数”一词在AI项目中常被混用。先把三个层次放在一起看。
1. 模型参数:训练形成的内部数值
模型参数主要包括神经网络中的权重,以及其他可学习数值。训练程序根据误差信号反复更新它们,训练完成后再保存为模型权重。
普通调用会读取这些参数完成计算。把Temperature从0.7改成0.2,通常不会改变模型权重。
如果要真正改变模型参数,通常需要继续训练、全量微调,或训练LoRA等额外参数模块。它需要训练数据、计算资源和效果评估,不是一次普通API设置。
2. 训练超参数:控制模型怎样学习
训练超参数由训练者设定,用来安排训练过程。代表性的例子包括:
- 学习率:一次参数更新的幅度;
- 批量大小:每次用多少训练样本计算更新;
- 训练轮数:训练数据被重复使用多少遍。
学习率过大,参数更新可能震荡;学习率过小,训练进展可能很慢。批量大小和训练轮数也会影响训练成本、稳定性与最终效果。
超参数会影响模型最后形成什么参数,但超参数本身不等于模型参数。
3. 推理设置:控制这一次怎样生成
模型训练完成并开始回答问题时,进入推理阶段。常见推理设置包括:
- Temperature:调整候选Token概率分布的尖锐或平缓程度;
- Top-p:把采样范围限制在累计概率达到阈值的一组候选Token内;
- 最大输出长度:限制本次最多生成多少Token;
- 停止条件:满足指定条件时结束生成。
这些设置会影响输出的稳定性、长度和多样性,但通常只作用于当前请求或当前应用配置,不会把新知识永久写入模型参数。
三、三类设置怎样相互影响?

三类设置处在不同阶段,却会共同影响最终结果。
训练超参数先影响训练过程。训练过程根据数据和误差信号更新模型参数。模型部署后,推理设置再决定如何利用这些参数生成当前答案。
可以把它们连成一条时间线:
人设置训练超参数; 训练程序根据数据更新模型参数; 模型保存参数并完成部署; 用户提交Prompt; 系统按照推理设置生成答案。
例如,学习率设置不合适,训练出的模型可能表现不佳。模型训练正常,但Temperature过高,当前回答也可能显得发散。这两种问题都影响输出,却不能使用同一种方法解决。
训练超参数影响Parameter怎样形成,推理设置影响现有Parameter怎样参与当前生成。
四、Prompt和RAG属于哪一层?

Prompt和RAG也会改变回答,但它们不属于上面的三类参数。
Prompt提供当前任务、上下文、限制和输出要求。修改Prompt,相当于改变模型这一次接收到的输入。
RAG先从外部知识库检索资料,再把检索结果放进当前上下文。它补充的是本次回答可参考的信息,不会因此自动改写模型权重。
所以,企业问答助手没有引用最新制度时,问题未必出在模型参数。更常见的检查顺序是:
Prompt有没有说明任务和格式; RAG有没有检索到正确、最新且有权限使用的资料; Temperature、Top-p和输出长度是否符合任务需要; 如果格式或行为仍长期不稳定,再评估是否需要微调。
这里不展开Prompt、RAG与微调的完整选型,后续会分别介绍它们。
五、使用Temperature时,哪些判断容易出错?

误解一:Temperature越低,答案越正确
较低Temperature通常让输出更集中,却不能修复错误知识、缺失资料或含糊的任务要求。模型可能更稳定地输出同一个错误答案。
误解二:Temperature越高,模型越有创造力
较高Temperature增加的是候选选择的多样性。它有时能带来更丰富的表达,也可能增加跑题、不一致和格式漂移。是否合适取决于任务。
制度问答、信息抽取和固定格式输出通常更看重稳定性;广告创意、标题探索和开放式写作可以容纳更多变化。但具体设置仍需通过实际测试确定,不能把一个数值复制到所有模型和任务。
误解三:只要设置相同,所有模型表现就相同
不同模型、接口和服务商对推理设置的支持范围与实现细节可能不同。同一个Temperature数值不能直接作为跨模型的能力比较标准。
六、一张图分清三类“调参”

Prompt改变输入,RAG补充外部资料,它们也会影响回答,但不应被笼统归入模型Parameter。
结尾总结
“AI调参”可能指三种不同动作。
模型参数是训练形成的内部数值;训练超参数控制模型怎样学习;推理设置控制一次回答怎样生成。
Temperature属于推理设置。它调整候选Token的选择分布,通常不会改变模型权重,也不会增加模型原本没有的知识。
项目中遇到回答问题时,先判断问题发生在训练、输入资料还是当前生成阶段,再决定应该训练模型、修改Prompt、检查RAG,还是调整Temperature。
调参之前,先确认你要改变的是模型内部数值、训练过程,还是当前生成方式。
下一篇将讨论模型规模、训练数据与算力之间的经验关系,以及为什么参数更多不等于在所有任务上都更好。

注:文章插图均由 AI 辅助生成。
星漫宇航|AI名词百科
概念学清,项目做实,前沿看懂。复盘迭代,持续精进。
夜雨聆风