乐于分享
好东西不私藏

8800万篇盗版论文喂出的AI诞生!被索赔2000万美元的“海盗女王”,要给全世界科学家免费白嫖

8800万篇盗版论文喂出的AI诞生!被索赔2000万美元的“海盗女王”,要给全世界科学家免费白嫖

2026年4月,一个名叫Sci-Bot的AI研究助手上线了。它未举办发布会,也未见融资新闻稿或科技巨头的Logo墙。 但它的背后,是人类历史上规模最大的学术影子图书馆,8800万篇被付费墙锁死的论文,全部免费开放。

它的创造者叫Alexandra Elbakyan。你可能没听过这个名字,但在学术圈,她的另一个称呼更响亮:“科学界的海盗女王”

而她刚刚干了一件让大型出版商头疼的事:用AI把整个Sci-Hub变成了一台可以对话的大脑你问一个问题,它帮你读几十篇论文,再给你一份带真实引用的答案。免费

一个买不起论文的研究生,掀翻了价值百亿的学术出版帝国

2011年,Elbakyan还是个在哈萨克斯坦读研的穷学生。一篇文章30美元起跳,一个参考文献列表就是几十篇文章,她要做的神经工程课题需要几百篇论文,知识过路费高达几千美元对一个苏联解体后长大的中亚学生来说,这道付费墙堵死了她的研究路径。

于是她写了一个脚本:自动抓取论文、缓存、提供给下一个需要的人。几天写出的自动化程序,十四年后变成了8800万篇文献的庞然大物。

2017年,美国法院对Sci-Hub连开两张罚单:爱思唯尔胜诉,获赔1500万美元美国化学会接着打赢官司,再拿480万美元两项缺席判决加起来近2000万美元。

结果怎样? 埃尔巴克扬人在俄罗斯,判决一美分都没执行域名被封,就换一个新域名;ISP被勒令屏蔽,就用镜像站和Telegram机器人绕过去。互联网的分布式基因,被一个女性程序员玩得炉火纯青。

法庭赢了官司,但输了战争

一场诉讼打十年,对手反而进化成了AI

2026年4月,Sci-Bot上线

它接在Sci-Hub那个8800万篇论文的数据库上,运行方式用埃尔巴克扬自己的话说,是一个agentic的检索-阅读循环先对摘要做语义匹配,找出最可能的论文,然后读全文,生成带引用的答案,再根据答案缺口反复回去找新的论文。 就像一个不知疲倦的文献综述助手,把几千小时的文献工作压缩到几分钟。

▲ Elbakyan本人对Sci-Bot技术机制的说明:先搜摘要、读全文、编译答案,循环可反复

《化学与工程新闻》(C&EN)请了三位科学家实测。结论是:它仍有缺陷,但文献覆盖面更广、版权约束更少,合法学术AI难以望其项背。宾大的数据科学家对此一针见血, “正因为它不在乎版权,它反而能给你合法工具给不了的全景。”

一位科罗拉多大学的生物信息学家还贡献了一个黄金观察:那些大型科技公司,暗中用LibGen这类盗版库训练自己的模型,然后估值千亿,一分钱不给原作者而Elbakyan做同样的事,免费的,却反复被告,被要求赔2000万。这类做法在商业公司和公益项目上遭遇的法律后果截然不同。

于是出现了这一幕:多国法院要求关闭Sci-Hub,它却以新域名反复复活;而走到2026年,它干脆长出了牙齿,从PDF仓库变成了AI大脑。

语义的金字塔:为什么Sci-Bot让合法学术AI输得一塌糊涂?

这就要说到一个技术上的根本差别

合法的学术AI只能检索出版商授权它们看的语料。 它们具备阅读全文的能力,阅读范围却被版权合同画了一个圈。圈外的世界无法进入检索结果

而Sci-Bot的语料边界是Sci-Hub的边界,整个被锁住的知识世界光是2022年Sci-Hub公开报告的数据,是8834万份全文文件。对2015到2020年之间的化学、材料、生物医学文献覆盖率超过90%。

决定竞争力的关键在语料 当你的语料比别人大一个数量级,且无需谈判、签协议或支付天价授权费,优势自然随之而来。

C&EN的实测里有个细节值得玩味:受访者说Sci-Bot给出的引用“一般真实但不总是最相关”。它依靠数据库检索,能少一些从模型记忆里吐出似真似假文献的风险。在一个幻觉泛滥的AI时代,这居然成了最朴素的美德。

付费墙的真相,和那个“最讽刺”的轮回

来看看资料包里那条被转了几十万次的病毒式评论:

▲ 付费墙双重收费争议:纳税人出钱、作者白写、审稿人白干,出版商锁门,读者再买单

纳税人出钱资助研究 → 科学家免费写作 → 审稿人免费审稿 → 出版商锁上门 → 读者再付一次钱。

这条链条,每一个环节都没人敢在正式场合反对。但它拼在一起,就是一个荒诞剧Elsevier的利润率常年维持在30%以上,比苹果谷歌还高;而创造内容的科学家,一毛钱稿费都拿不到

因此,当Sci-Bot 2026年上线时,有网友这样总结:

“用了十五年,她从盗版论文里活活逼出了一个产业终局。”

这场对学术出版的碾轧落在了用户体验上。当科学家们发现,在自己的电脑上敲一个问题就能得到一份带原文链接的综述,谁还愿意花30美元点开一篇PDF?

2026都来了,合法性仍然没有答案,但产业已经给出判断

站在2026年回看,Sci-Hub的产品形态已经发生变化:

Sci-Hub保存约8800万篇历史论文,Sci-Bot则把这座图书馆变成了对话窗口。

而更大的产业信号是:出版商们已经在AI时代找到了新的后路。 它们扭头和OpenAI、Meta们签训练数据协议,把受版权保护的论文变成AI公司的付费语料。曾经的盗版党成了今天的语料供应商,只不过钱收得心安理得,而作者和审稿人照样一毛没有。

Elbakyan做的事其实很简单:用最复杂的机器,实现一个最朴素的愿望,让任何人在任何地方读任何论文。

她16年前写给那位纽约法官的信,放在今天读起来依旧锋利:

“我被逼得只能这样做。我希望研究者不用为了读一篇文章而付30美元。科学就应该是免费的。”

法庭判了她2000万美元但今天,Sci-Bot每天都有人用

而爱思唯尔们,至今没拿到那一分钱