夜雨聆风学习资料网

ARTICLE · 1107981

你的一个想法对还是不对?一个工具,让AI全方位辩论,给你最终结果

你的一个想法对还是不对?一个工具,让AI全方位辩论,给你最终结果
地铁上看到一条推送信息:AI又发现了一种新材料手指一划就过去了,心里嘀咕一句,这跟我有什么关系?但是如果你是研究生、医生或者天天写行业报告的人,“怎么把零散的线索拼凑成一个站得住脚的结论”,就是每天逃不掉的苦活。

最近在 GitHub 上出现了一个叫做 hypoarena 的项目。据公开介绍,它是“科学假设发现工作台”。也就是说,让机器把你的证据摆在桌子上,然后让几个 AI 假说互相辩论、逐轮进化,最后用一套像体育比赛一样的积分排名来告诉你:哪个假设更靠谱。

它不会替你下结论,而是把“凭感觉”变成“有证据”。

它到底在忙什么

你就是个侦探。手上有的线索有脚印、时间、动机。hypoarena 干的事就是把每一个“假设”以及它所对应的“证据”都画成一张关系图。哪一条假设能够成立,就看它所附带的证据有多少。

更巧的是,它还会自己制造一批“模拟文献”,据公开介绍,里面藏有已知的因果关系,就相当于出了一道有标准答案的练习题。这样它就可以检验自己了:到底能不能找到那个正确的答案,而不仅仅是自说自话。

它是怎么工作的

用生活来打比方的话,那就是举行一场“假设选秀”。

先海选生成:让模型一次性抛出几个候选假设。 再上辩论台:候选人们互相挑刺——你这段证据能站得住脚吗?还有什么其他的说法吗? 然后进化:活下来的人带着新的证据再长一轮,来来回回几轮。 裁判这一关就更好了,用Elo积分(下棋、打比赛排名用的那套)来让假设两两对战打分。据公开介绍,在它自己出的题目中,这套排名可以还原出预设的“真实水平顺序”。

另外两个地方我比较在意。一个是“换个说法也能认出你”,即同一个意思用不同的措辞,系统会把它当作重复证据而忽略掉,防止自己被自己欺骗。另一个叫做贝叶斯累积,听上去很吓人,其实也就是:新的证据进来时,在原有的信心基础上进行加减运算,并不是每次都要从零开始拍脑袋。

怎么上手

坦白说,它并不是打开网页就可以使用的App,而是一个开源项目,只对会写代码的人开放。下面的几个步骤是这样的:

打开浏览器访问 https://github.com/OpSafari/hypoarena,从头开始阅读README说明。[1] 按照说明把Python环境安装好,并把仓库下载到本地。 安装基础依赖。根据公开的信息,核心只需要 NumPy,其他的 torch 功能可以选,而且可以纯 CPU 运行,不需要买显卡。 跑一个有示例的,看看它从假设到报告的整个过程。 换成你自己的问题之后,再生成一份可以复现的报告。

环境安装一般需要几分钟。跑一轮示例的快慢取决于适配器,大概几十秒到更长。它主打的是离线适配器,即不需要联网来调大模型,对于数据敏感的团队来说会更放心一些。

一个具体场景

以前我帮朋友整理过很多论文线索,最烦人的就是:读了一个下午,反对的观点总是到最后才想起来。

这样的工作台可以接到它。输入为:一个主要的问题加上一些证据材料。中间的过程是:系统产生多个假设,并让它们互相辩论,在图上挂上证据,重复的自动去除,信心值随着证据一层层累积。最后写出一份报告,写出每一条假设得几分以及依据是什么。

做医学信息的朋友也试过,他说同样的事情从一下午压缩到十几分钟,最节省的不是快,而是不容易遗漏对方的证据。

别把它神化

它并不是科研本身。它自带练习题和标准答案,这是为了检验方法;但是真实世界中的因果关系并不是这样干净的。它的功能就是“避免自说自话”、“过程留痕、可以复现”,而不能代替你找到真理。

留个问题

如果你明天要做出一个重要的决定,并且需要收集证据的话,你会更害怕“证据不足”,还是更害怕“只看到支持自己观点的证据”?

觉得好用的话可以点个赞,转发给经常查资料、写报告的朋友。想要知道我把它拆开来是怎么样的,可以在评论区留言。

引用链接

[1]https://github.com/OpSafari/hypoarena,从头开始阅读README说明。: https://github.com/OpSafari/hypoarena%EF%BC%8C%E4%BB%8E%E5%A4%B4%E5%BC%80%E5%A7%8B%E9%98%85%E8%AF%BBREADME%E8%AF%B4%E6%98%8E%E3%80%82

相关学习资料