ARTICLE · 1126985
一次经历,能说明多少?——从 n=1、似然比到我们如何理解自己
一封拒稿邮件到来时,屏幕上的字通常不多;一次考试失利,卷面上的分数也不过两三位。事情本身很短,我们却很容易在心里替它续写出很长的结论。
一篇论文被拒,便怀疑整个研究方向;一次课堂表达没有得到回应,便觉得自己不善言辞;一次选择出了错,便仿佛证明了自己缺乏判断力。
我们常常不是在描述一次经历,而是在借一次经历定义自己。
但从统计意义上说,一次,不过是 n=1。
一次,不等于没有信息
“小样本”容易被理解为“没有意义”,其实并不准确。
一个样本当然可以提供信息。有时,一次观测甚至足以显著改变原有判断。真正需要追问的,不只是样本有几个,而是这项证据究竟具有多强的区分力。
一次失败之中,既可能包含我们想了解的信号,也可能混入状态、情境、运气与随机扰动。
学生可能确实没有掌握某个知识点,也可能只是那天身体不适;一次演讲的冷场,可能来自表达方式,也可能来自听众、时机与场合;一次研究没有得到预期结果,可能推翻了原来的假设,也可能只是数据、测量或模型设定出了问题。
问题在于,情绪往往会放大一件事在记忆中的重量。
越令人难过的经历,我们越容易相信它意义重大;越使人羞愧的失败,我们越倾向于把它解释成某种本质性的缺陷。
但情绪的强度,不等于证据的信息量。
证据究竟支持哪一种解释
贝叶斯方法提供了一个更准确的尺度:似然比。
假设面对一次失败,我们有两种解释:
H1:我确实不擅长这件事。
H0:我原本可以,只是这一次没有做好。
现在,我们观察到一次失败,把它记作 E。似然比可以写成:
Λ=P(E|H1) ÷ P(E|H0)
这个式子所问的,其实很朴素:
如果H1成立,这次失败有多可能发生?如果H0成立,同样的失败又有多可能发生?
假如在两种解释之下,这件事都很容易出现,那么似然比便接近1。这项证据虽然真实,却没有多少区分力。
例如,一个人在极度疲惫的状态下做错一道题,并不能很好地区分“他不会做”与“他只是状态不好”。因为无论哪一种解释成立,错误都不难发生。
只有当一项证据在两种解释之下出现的可能性相差很大,它才真正具有区分力。似然比越明显地偏离1,证据越有能力把判断推向其中一种解释。
所以,令人难过,并不等于信息量很大。
反过来,n=1也不必然意味着证据很弱。如果某个结果在一种解释下极少出现,在另一种解释下却非常常见,那么一次观测也可能很有分量。
贝叶斯思维既不迷信大样本,也不轻视小样本。它关心的是:证据究竟改变了什么,以及应该改变多少。
从20%更新到33%
再看一个简单的数字例子。
这里所说的“赔率”,不是日常意义上的下注赔率,而是两种解释之间相对可信程度的比值。
假设在这次失败发生以前,根据过去的表现和已有经验,我认为自己“确实不擅长”的概率是20%,而“原本可以,只是偶尔失手”的概率是80%。
那么,两种解释之间的先验赔率就是:
20% ÷ 80%=1∶4
“先验”并不是成见。它只是表示:在新证据到来以前,我们已经根据过去的经验处在某个判断位置上。
现在加入一次新的失败。
假设如果我确实不擅长,这次失败出现的概率是60%;如果我原本可以,只是偶尔失手,同样的失败出现的概率是30%。
那么,这项证据的似然比就是:
60% ÷ 30%=2
贝叶斯更新可以写成:
后验赔率=先验赔率×似然比
于是:
1∶4 × 2=1∶2
把1∶2的后验赔率换算成概率,大约是33%。
也就是说,这次失败确实提供了不利证据,使“我可能不擅长”的判断从20%上升到了33%。
它改变了我们的认识,却没有把20%直接推到100%。
这些数字当然只是为了展示推理结构,并不是对现实人生的精确测量。它真正说明的是:一次失败不应被忽略,但它能在多大程度上改变判断,既取决于此前积累的经验,也取决于这次证据本身具有多强的区分力。
十次失败,也未必是十份独立证据
样本数量增加以后,判断通常会变得更可靠。但这里还有一个经常被忽略的问题:多次观测之间是否相互独立。
如果一个学生连续几次在同一种题型上失分,这些失败可能共同指向一个知识缺口;但如果几次考试都发生在同一段身体不适的时期,它们便可能受到同一个因素影响。
十次发生在同一环境、同一方法和同一种偏差之下的失败,未必等于十份独立证据。名义上的样本量是10,有效样本量却可能远小于10。
研究中如此,生活中也是如此。
一个人用同一种无效的方法尝试十次,得到的并不是关于自身能力的十次独立检验,而更可能是关于这种方法的一次反复证明。
因此,真正值得更新的,有时不是“我是否有能力”,而是“我正在使用的方法是否合适”。
这一区别非常重要。
教育不应把观测写成判决
这也是为什么,我始终不赞成把一次考试、一次排名或一次课堂表现写成对学生能力的最终判断。
分数当然是证据。否认分数没有意义。但分数所包含的信息需要被解释:它测量了什么,没有测量什么;其中有多少来自理解能力,有多少来自训练程度、题目类型、临场状态和评价方式。
教育真正应该做的,不是让每一次观测都显得漂亮,而是不断提供新的、高质量的观测,让一个人有机会更新对知识的理解,也更新对自己的认识。
第一次接触一个概念时,即使理解得并不完整,也会形成某种先验。以后每一次学习、练习和应用,都是新的证据。
认识并不是一次完成的。它是在不断更新中逐渐接近准确。
一个孩子不应因为第一次没有听懂,就认定自己“不适合数学”;一个年轻研究者也不应因为第一次投稿被拒,就认定自己的问题没有价值。
当然,更新也不能永远朝着自我安慰的方向进行。如果相互独立、具有较强区分力的证据一再出现,判断就应当作出更明显的调整。
贝叶斯方法从来不是拒绝坏消息,而是要求坏消息获得与其信息量相称的权重。
给证据应有的分量
我们需要的并不是盲目的乐观,而是一种更有纪律的判断方式。
它既不为了保护自尊而删除不喜欢的证据,也不因为一次挫败令人痛苦,就允许它独占全部解释权。
“这一次没有做好”,是一次观测。
“我就是这样的人”,却已经是一个关于自己的模型。
从观测走向模型,中间还隔着先验、噪声、似然比、有效样本量,以及未来尚未发生的许多次观测。
一个人的经历当然会塑造他,但任何一次经历,都不应未经检验便取得最终解释权。
或许,这正是贝叶斯思维最有人情味的地方:它尊重已经发生的事实,也为尚未发生的未来保留位置。
别让 n=1 替整个人生发言;也别假装它从未说过话。
Bayes Vision|判断的尺度 02