按会议总结所说:当答案可以被瞬间生成,值得托付的,究竟是什么?围绕这一追问,论坛内容自然汇聚为四个核心洞察——范式、可信、服务、育人,每一洞察都凝结为一段会议共识。
洞察一:图书馆的底层逻辑, 正从“资源中心”走向“知识中心”
洞察二:AI越强,可信基础设施越成为最稀缺的资源
洞察三:图书馆正从文献保障者, 走向科研与战略决策的支撑者
洞察四:检索越高效, 批判性思维与人文之魂越是不可让渡的育人内核
1
会议间隙我对几个老总说,先不说产品本身的能力,当然我是很认可的,应该说我认为是目前最好的,但是有几点顾虑不知道是否有答案,一个是AI类产品肯定要走向token经济,现有的订阅制会如何改变。二是你们AI工具使用的大模型是否能明示。三是未来使用AI工具的交互数据你们将怎么处理。
老总们说正要多听听用户的意见,但我这个显然并没有当成重要反馈。回来后没几天,陆续发生了几件事情,也许他们该理解我为什么会问这些。
一个是受中国政府国家安全撤资令的影响,Meta本月已正式完成与AI初创公司Manus的运营切割,成为中国强制撤销已完成海外交易的标志性判例。一个是美国政府援引国家安全授权条款,对人工智能巨头Anthropic实施了极其严厉的出口管制禁令,该公司最新发布仅数十小时的行业旗舰级模型Mythos等被迫在全球范围内全网停用。另一个是上海网信办针对携程商务有限公司未落实数据出境安全评估、违法出境个人信息的行为,开出了高达千万元的行政处罚。
前天WOS的小朋友来访,介绍他们新出的两个学术AI工具,我也提到了这几个疑虑,很显然他们几个也没有想过,迅速掏出小本本记了几笔,今天和我说已经向老板专门做了汇报。
2
之所以提到这几个问题,是因为对大模型和数据的安全关注最近越来越成为影响AI使用的重要因素。
早在2023年,中国政府应该是全球率先迅速出台了首部关于生成式人工智能的管理办法。我搜了一下主要的相关法律法规大概如下:
《互联网信息服务算法推荐管理规定》(2021.12.31/2022.3.1施行)
《数据出境安全评估办法》(2022.7.7 发布 / 2022.9.1 施行)
《互联网信息服务深度合成管理规定》(2022.11.25/2023.1.1施行)
《个人信息出境标准合同办法》(2023.2.22 发布 / 2023.6.1 施行)
《生成式人工智能服务管理暂行办法》(2023.7.10/2023.8.15施行)
《促进和规范数据跨境流动规定》(2024.3.23 施行)
《网络数据安全管理条例》(2024.9.24 发布 / 2025.1.1 施行)
《人工智能生成合成内容标识办法》(2025.3.14/2025.9.1施行)
《人工智能科技伦理审查与服务办法(试行)》(2025/2026.3.1施行)
《人工智能拟人化互动服务管理暂行办法》(2026.4.10/2026.7.15施行)
不得不说,中国式的监管在先,可能会暂时减慢前进脚步,但不太会因为混乱而停下脚步。美国这种乱了再治的模式下看起来极少限制技术发展,但动不动TACO实在是折腾。
目前来说,一个AI 企业要想在中国上线AI服务,合规路径必须是:第一层【底层数据准备】 ➔ 满足《数据安全法》与数据跨境要求(不出海或依法出海);第二层【算法模型研发】 ➔ 满足《算法推荐/深度合成规定》(登记“算法备案”);第三层【生成式应用上线】➔ 满足《生成式AI办法》(通过“安全评估”与“大模型备案”)。
据我有限的所知,没听说国外学术AI工具在中国进行了这些合规工作(如果是我无知请见谅),国内的CNKI、超星等不少大公司都进行了明确的模型备案算法备案,但也有一些小公司在打擦边球,先抢一些用户挣了钱再说合规的事。按说国外这种大型商业巨头,法务审核应该是所有商业行为的首要环节,不应该不知道服务目标国家或地区的相关法律啊。
学术类资源服务,原来确实不用考虑这么多,国外数据库进入中国销售,首先都经过具有资质的进出口公司负责内容审查,图书馆能买到的理论上都是没有数据问题的。使用方法就是检索下载,也谈不到有多么特殊的算法,你见过查哪个数据库成瘾的学生吗?(刷x书x音上瘾是真的,那种算法必须严查)。而且单向的检索->下载,也谈不到数据出海的问题,数据商收集点儿个人注册信息只要是同意隐私规则的也不算是违规。
3
但现在不一样了。
因为学术AI工具不是过去那种确定的全文库,它是以文献检索、摘要生成、知识图谱和研究辅助为核心能力的黑箱,表面上是围绕学术资源展开的增强型服务,但其运行逻辑已经明显从传统数据库检索转向了不透明的答案生成与过程介入,在这种模式下,一个原本被认为安全边界清晰的领域正在变得复杂起来。
简单点儿说,我想问问国外数据商的学术AI工具,使用的底层大模型是否进行了合规性备案?算法是否进行了审查?用户交互数据是否被保存在境外服务器或者被用于AI训练?
从大模型和算法角度来说,这类工具大都不是使用一个大模型,而是有负责文本的有负责多模态的有负责向量化的有负责工具执行的等等,还会有数据标引机器学习神经网络等多种技术支撑,但不管是开源的还是自研的对用户都是不透明的,据判断他们也会用到Claude、chatGPT等质量较高的商业模型以保证输出质量和算力支撑。对数据的加工深度和匹配算法更是黑箱,因为这是区别不同学术AI工具能力的根本体现,一般不会公开的。在这种结构下,学术AI工具强调的结果可信引用、来源朔源等能力,更多是作用在应用表现层,而非底层模型和数据层,一旦有人通过奶奶漏洞等针对AI的手段进行提示词诱导、越狱攻击,绕过薄弱的安全限制和算法防护,会不会出现结果有违背国内法律的情况?反正国内这些审查备案过的大模型再越狱也基本不会,从根上就不会了。
从数据流动的角度来说,使用学术AI工具,用户与系统的交互越多越充分,得到的结果就越符合用户需求,大量的多轮交互甚至数据提交正是有别于过去传统关键词检索的行为特征。在这种结构下,学术输入数据可能经过多次跨境处理与转发,包括检索对话、全文片段、用户行为轨迹以及上传的文献、实验数据等内容,都可能进入境外计算链路之中。
对于科研环境而言,这些数据并不普通。它们可能包含尚未发表的实验结果、论文初稿、课题设计思路,甚至涉及特定研究团队的关键技术路线。一旦进入不透明的跨境处理体系,其风险不再局限于隐私泄露,还可能触及科研成果归属与数据主权问题甚至国家安全问题。
从监管逻辑看,这类风险并非理论推演。近年来关于数据出境与个人信息保护的执法案例已经明确释放信号,类似Manus、携程的处罚事件表明,只要存在未经评估的算法、数据跨境流动,即使业务本身具有正当性,也可能构成合规违规。在学术场景中,这种风险并不会因为“科研用途”而自然豁免。
爱记的老总是和我保证了他们绝对不会保存和使用用户数据,但我相信不算,审查备案了算。
国外学术AI工具还有一个需要面对的问题,国外的商用大模型基本上都明确拒绝中国大陆用户使用,那么爱记购买的claude到底是服务了阿姆斯特丹的爱记公司,还是服务了中国高校的师生呢?一旦底层大模型供应或API策略发生变化,整个学术工具链条可能出现不可预测的中断或功能退化,也会使得以token为计算单位的AI工具费用更难以核算。
这种不确定性在当前地缘政治环境下被进一步放大,大模型服务本身已经成为受出口管制、合规审查与数据主权影响的高敏感基础设施,其稳定性不再完全由市场机制决定,坦白说只要川建国当总统,什么事情都可能发生。
4
在大部分出版商和馆长都不注意这些问题的时候,我不合时宜的又给举步维艰的外文资源采购加了一些顾虑,也给想靠学术AI工具开辟新财源的数据商们增加了些许阻碍,增值税的问题还没解决,还要考虑这些事情?
不考虑不行啊,OpenClaw都能让上级下文不许随便安装,这么明显的口子不可能不被重视,早考虑早解决早销售早使用早受益。
对我们高校图书馆来说,也许还有一条途径。
现在普通大模型的能力已经和半年前截然不同了,也就说,只要手里有好的学术资源数据,比如OpenAccess的、FreeAccess的、本地镜像保存的,还有官方开通GoogleScholar的,靠国内甚至本地的大模型就能做出足够可用的、不亚于目前大部分学术AI工具的效果。我用过不少模型,包括商业的、开源的十几个,现在最好用的你道是哪个?是本地部署的QWen3.5-27B,从agent调用、工具操作到文本处理、知识分析、数据研究,都不亚于商业模型,稳得一批。当然图片设计、视频制作这种艺术工作,还是那几个顶尖的厉害,我们闭馆音乐秀的系列海报,同样的结构化提示词,chatGPT出的结果最好,几乎直出,国内几个惨不忍睹,PS都没办法下手,开源的就更别提了。
扯远了。
归根结底还是数据,前面写的几篇文章我都强调了这一点,在越来越强大的大模型能力加持下,手里有了数据,被到处通缉的Alexandra Elbakyan都能先于大厂技术团队发布真正纯正的学术AI工具sci-hub bot,我也丝毫不怀疑,很快会出现基于Z-library的私人化的学术AI工具(它们欢迎镜像,去掉logo甚至自设认证体系都欢迎,只要不怕法律制裁)。
5
我们图书馆很想马上引入相中的几个学术AI工具,尤其是爱记的LeapSpace,让师生早日体会到AI赋能科研学习的能力提升,但是作为机构责任人,还是希望一切工作都合规合法有理有据,或者,你们数据商就不会不提AI这俩词吗?所有宣传材料和网站页面上都不提,我就当是新出了一个数据库工具闭着眼用就是了。
作为一个个体,即使学校图书馆没有学术AI工具,仍有太多的开源工具可以使用,而且比那些商用的更加开放更加自由,在结果可信度以及引用溯源方面也毫不逊色,不说原来写过的OpenClaw-Medical-Skills生物医学方面的AI工具包,不说清华开源的AI赋能教学的OpenMAIC,今天在github上又发现一个用于Claude Code的Skills:academic-research-skills,给你从零到出版一整套完整的pipeline,研究→撰写→诚信审查→模拟审查(5人)→苏格拉底指导→修订→验收审查→再修订→最终诚信审查→定稿→过程记录+协作品质评估,都是在你通过各个checkpoint监督下由agent完成的。
学术AI工具参与学术写作的界限到底在哪里?给学生提供学术AI工具是不是在助长懒惰?是不是越早购买学术AI工具越好?就和前面问数据商的三个问题一样,现在我没有答案。

欢迎关注“后图书馆现场”
一个老馆员的碎碎念
夜雨聆风