

而自洽性,是因为AI大模型生成内容时,会根据temperature和top_p等参数有一定程度的创造性,也就是会有一定概率的选择不是最大概率的输出结果。这样,如果我们多次使用相同的提示词,可能会得到不同的结果。此时,根据词元的随机选择,输出的质量可能会提高或降低。换句话说,全靠运气!
为了抵消这种随机性并提高生成模型的性能,研究人员引入了自洽性(self-consistency)的概念。这种方法会用相同的提示词向生成模型多次提问,并将占多数的结果作为最终答案。然而,这种方法需要多次询问同一个问题,因此,尽管可以改进生成效果,但它会变得更慢。如果输出样本的数量为n,这种方法的速度就会慢至1/n。
对于我们用小龙虾或其他Agent的情况,我们可以选择用两个AI助理互相检查验证的方法(背后调用的大模型不同),以便我们获得更好的效果,同时也降低我们人工检查的工作量。比如下面是我用一个小龙虾检查另外一只小龙虾的方案所发现的问题:

通过这样一些检查,可以让我们的工作更准确有效,也可以让他们通过互相检查、互相完善,来降低我们的人工精力投入。
夜雨聆风