ARTICLE · 1140565
07 文献处理三件事:整理已下载的、让它自己去下载、读成笔记入库

进入科研环节。这一篇是整个系列最实用的一篇,因为它解决的是每个做研究的人都绕不过的三个动作。
我把它拆成三部分,顺序就是真实的工作顺序:你电脑里已经堆了一批 PDF,先把它们整理清楚;接下来还需要新文献,让 WorkBuddy 去知网帮你找并下载;下载完不能只是躺在文件夹里,要读成笔记、进知识库。
三部分可以独立跑,也可以串成一条流水线。建议先跑第一部分,因为它最安全、见效最快。

第一部分:整理已经下载的文献
1.1 先看清现状
打开你的下载文件夹,大概是这个样子:知网导出.pdf、知网导出(3).pdf、12345678.pdf、基于DEA的效率评价研究.pdf、还有几个不知道从哪来的 article.pdf。
这批文件的问题不是“没整理”,是没有可检索性。你知道自己下载过一篇讲双重差分的文章,但你没法找到它,只能重新去知网下一遍。我干过不止一次。
2.2 分步指令
别把五步一次贴进去。拆成五条,跑完一条、花半分钟看一眼结果,再贴下一条。 一条长指令一口气跑效果差,根源在第三步:它本该“先停下来给方案”,混在同一条里,AI 常常不停顿,直接跳到改名和移动。
第一步|盘点(只读,不动)
只做盘点:不要读取正文、不要改名、不要移动、不要建文件夹。 处理 D:\AI工作台\科研\文献待整理 下的所有 PDF,列出: - 文件总数; - 每个文件的页数和大小; - 逐个标记两类异常:打不开的、明显是扫描件(无文字层)的。 把扫描件归到「需OCR」子文件夹,不做后续处理。 完成后停下,报告:总数 / 可正常读取多少篇 / 需OCR多少篇 / 打不开多少篇。
PLAINTEXT
跑完先看这份“体检报告”。「需OCR」占比过高(比如过半),先按 1.4 处理,别往下走。
第二步|提取元数据(只提取,不分类)
只做提取:不要改名、不要移动、不要分类。 逐篇读取 D:\AI工作台\科研\文献待整理 下的 PDF(优先读首页和摘要页),提取: 标题 / 全部作者 / 第一作者单位 / 发表年份 / 期刊或会议名 / 关键词 / 研究方法 / 数据来源 / 核心结论一句话 / 是否为实证研究 / DOI或知网链接 硬约束: - 所有字段必须来自 PDF 原文,不许根据标题推测。 - 提取不到的字段填「待补充」,不许留空,不许编造。 - 期刊名必须是原文出现的完整名称,不许简写或补全。 每完成 5 篇报告一次进度。 全部完成后输出一张 Markdown 表格,并报告「待补充」字段的总数。
PLAINTEXT
「待补充」的总数是质量信号(见 1.3)。数字高得离谱,先回头解决源文件,别接着跑。
第三步|出分类方案(只看,不动)
基于上一步的提取结果,只出方案:不要改名、不要移动、不要建文件夹。 1. 归纳研究主题分类,控制在 5 类以内,另设「其他」。 2. 列出分类方案,以及每类包含哪些文献(按篇名列全)。 3. 给出重命名规则「年份_第一作者_标题前15字.pdf」,并示范围例 10 条。 输出后停下,等我确认。确认前不要执行任何改名或移动。
PLAINTEXT
这一步的停顿是硬要求(见 1.3):花一分钟审方案,换掉出事时半小时找文件。
第四步|执行归档
按我确认后的方案执行: - 按「年份_第一作者_标题前15字.pdf」重命名; - 移入对应的主题子文件夹。 同时保留一份「原文件名 → 新文件名」对照表,存成单独文件,以便回溯。 完成后报告:改名多少篇、移动多少篇、有无失败。
PLAINTEXT
第五步|输出清单
生成 Excel「文献清单_日期.xlsx」(日期用今天),存到 D:\AI工作台\科研\文献待整理\,两个工作表: - 工作表1「文献总表」:第二步全部字段 + 所属主题 + 新文件名 + 完整路径 - 工作表2「改名对照」:原文件名 | 新文件名 | 所在主题 交付时报告:共处理多少篇、其中「待补充」字段多少个、需OCR多少篇。
PLAINTEXT
3.3 三个必须注意的点
第三步的停顿是硬要求。 重命名和移动文件不可逆。我第一次跑没加这一步,它把一批文件按自己归纳的主题词改了名,找回来花了半小时。现在凡是涉及批量改名、移动、删除,我的指令里一律有“停下等确认”。
“改名对照表”是保险。 万一发现分类不对,你有一张表可以还原。这个动作成本极低,价值在出事的时候。
“待补充”的数量是质量信号。 如果一百篇里有三百个待补充字段,说明大概率是 PDF 质量问题(扫描件多、排版特殊),要先解决源文件问题,而不是接着往下跑。
4.4 扫描件怎么办
老一点的中文文献常常是扫描件,没有文字层,直接读会得到空白。处理办法是让它先 OCR:
处理「需 OCR」文件夹里的 PDF。逐个做文字识别,生成同名的 txt 文件放在同目录。识别完成后告诉我每个文件的识别质量(好/一般/差),差的单独列出,我人工处理。
识别质量差的不要硬用。OCR 出错的数字和人名会一路错到你的引文里,而且极难发现。
第二部分:让 WorkBuddy 去知网找并下载
这是很多人不知道能做的事。WorkBuddy 有浏览器控制能力,可以真的打开浏览器、输关键词、翻页、点下载来源。
但有一个前提必须先说,否则这一部分你一步都走不动。
5.1 前置条件:先把 agent-browser 装上
刚装好的 WorkBuddy 默认不具备浏览器操作能力。你直接让它去知网检索,得到的大概率是「无法访问该网站」或者一段它自己编出来的检索结果——后者更危险,因为看起来像真的。
要让它真的能开浏览器,需要先安装 agent-browser(技能市场里也叫 Agent Browser)。这个技能提供的是打开页面、滚动、点击、展开、截图、读取页面信息这一整套动作,专门用于需要交互和动态渲染的网页来源。
两种安装方式,任选一种:
一是在 WorkBuddy 的技能市场里搜索 agent-browser,点安装,安装完重启一次会话。二是直接在对话框里说「帮我安装 agent-browser 技能」,让它自己完成安装并告诉你结果。第一种更可靠,出问题也更容易定位。
装完不要马上派大活,先用一条最小任务验证:
用浏览器打开 https://www.cnki.net/ , 告诉我三件事:页面标题、首页检索框是否可见、当前是否为已登录状态。 然后截一张图给我。不要做任何检索或下载操作。
PLAINTEXT
能返回真实标题和截图,说明技能真的生效了。如果失败,按三类原因排查:技能没装上或没重启(最常见)、网络或校园 VPN 没通、页面是动态加载、内容还没渲染完就被读取。第三种的处理办法是在指令里明确「等页面完全加载后再读取,必要时先滚动到底」。
这一节看起来琐碎,但它是第 09 篇所有网页取数任务的共同起点。装一次,后面都能用。
6.2 先说清边界和前提
这一部分必须先讲清楚规则,否则会有麻烦。
第一,权限是你的,不是它的。 知网的下载权限来自你所在高校的订阅。WorkBuddy 做的是替你操作浏览器,它用的是你已经登录的、你有权使用的账号。它不会、也不应该绕过任何付费墙。
第二,登录要你自己完成。 学校 VPN、机构登录、验证码,这些必须你手动做。让 AI 处理登录凭据是坏习惯,不要把账号密码写进指令。我的做法是:先自己在浏览器里登录好、确认能正常下载,再把控制权交给 WorkBuddy。
第三,控制频率。 不要让它连续几百次快速请求。这既容易触发反爬限制、导致你的账号被临时封禁,也不符合数据库的正常使用规范。我给的限制是每次任务不超过二三十篇,条目之间留间隔。
第四,只下你确实要读的。 批量下载三百篇然后一篇不读,除了占硬盘什么价值都没有。这一条听起来像废话,但我见过太多人的文献夹就是这么形成的。
7.3 分两步:先检索出题录,再下载
不要让它一步做完“搜索并下载”。先出题录清单,你筛完再下,这是效率和合规的双重保障。
第一步:检索出题录
用浏览器打开知网(我已在浏览器中完成机构登录,请直接使用当前登录状态, 不要尝试处理任何登录或验证码环节,遇到需要登录时停下告诉我)。 检索条件: - 主题词:数字政府 AND 绩效评价 - 时间范围:2020-2026 - 来源类别:CSSCI 及北大核心 - 学科:管理学、公共管理 操作要求: - 按被引频次降序排列 - 只采集前 3 页结果 - 每条提取:篇名 / 作者 / 作者单位 / 期刊 / 发表年期 / 被引频次 / 下载频次 / 关键词 / 摘要全文 / 详情页链接 - 摘要必须是页面上的完整摘要原文,不许改写或缩写 - 页面上没有的字段填「待补充」 输出 Excel「知网题录_数字政府绩效评价_日期.xlsx」, 存到 D:\AI工作台\科研\文献待整理\ 不要下载任何文件。这一步只采集题录。
PLAINTEXT
第二步:我筛完之后再下载
拿到题录表,我会人工做一遍筛选——读摘要,在表格里加一列“是否下载”,标 Y 的才下。这一步不能交给 AI,因为判断一篇文献值不值得读,是研究能力本身。
筛完之后:
读取「知网题录_数字政府绩效评价_日期.xlsx」, 只处理「是否下载」列标记为 Y 的条目(应为 18 条,请先核对数量并报告)。 逐条打开详情页链接,下载 PDF 全文,存到 D:\AI工作台\科研\文献待整理\ 文件名按「年份_第一作者_篇名前15字.pdf」命名。 执行要求: - 每篇之间间隔几秒,不要高频连续请求。 - 下载失败的(无权限、无PDF、页面异常)不要重试超过两次,记录失败原因,跳过继续。 - 每下载 5 篇报告一次进度。 全部完成后输出「下载结果表」: 篇名 | 状态(成功/失败) | 失败原因 | 文件名 | 文件大小 最后报告:成功多少篇、失败多少篇。
PLAINTEXT
8.4 下载完立刻接第一部分
下载好的文件直接进入第一部分的整理流程。这时候你会发现一个好处:知网题录表里已经有完整元数据了,可以直接和第一部分提取的结果交叉核对——两边不一致的地方,就是提取出错的地方。这是个很好用的自动质检。
把「知网题录」表和「文献清单」表按篇名匹配,列出两表中作者、年份、期刊三个字段不一致的条目,标注两边各是什么值。不要自动修正,只报告差异。
“不要自动修正”很重要。让它报告,你来判断。
9.5 其他数据库和网页
同一套方法适用于万方、维普、Web of Science,以及各级政府网站的政策发布页面。遇到反爬强、依赖登录态、需要动态渲染的页面,普通抓取会失败,这类情况需要更专门的浏览器自动化方案,属于第 09 篇的范围来源。
第三部分:读成笔记,存进知识库
文献下载好、整理好,最容易发生的事是:躺在文件夹里,一篇没读。
这一部分解决的是把 PDF 变成可用的知识。
10.1 精读一篇:文献速读卡
我用一个固定结构,字段是刻意设计的——每个字段都对应我后面写综述或论文时会用到的东西。先看一眼成品长什么样,再决定要不要抄这个结构:

精读 D:\AI工作台\科研\文献待整理\效率评价\2023_张某_数字政府建设对行政效率.pdf 按以下结构输出,字段名不许改,顺序不许调: 【1. 基本信息】标题 / 作者 / 期刊 / 年份 / 学科领域 【2. 研究问题】作者想回答什么?用原文表述,标注页码。 【3. 理论基础】用了什么理论框架?关键概念如何定义?定义要引原文。 【4. 数据与方法】 - 数据来源、样本范围、样本量、时间跨度 - 识别策略或分析方法 - 核心变量及其测量方式(逐个列出) 【5. 核心结论】主要发现 3-5 条,每条标注对应的表号或页码。 【6. 作者自述的局限】作者在文中承认了哪些不足?原文摘录。 【7. 我读出的问题】你认为这篇研究在方法或论证上可能存在的问题。 明确标注这一节是「AI 推断,需人工判断」。 【8. 与我的研究的关系】 我的研究方向是:数字政府建设的绩效评价体系构建。 说明这篇文献可以支撑我哪个部分,或与我的思路有何不同。 【9. 可引用原句】挑 3-5 句适合直接引用的原文,逐句标注页码。 原句必须逐字准确,不许改写、不许合并两句。 【硬约束】 1. 第 2-6、9 节全部内容必须来自 PDF 原文,不许补充任何文外信息。 2. 原文没有的,写「原文未提及」。 3. 只有第 7 节允许你推断,且必须标明。 4. 页码必须是 PDF 中真实存在的页码,无法确定的写「页码待核」。
PLAINTEXT
第 6、7 节分开是刻意的。 “作者自述的局限”是原文事实,“我读出的问题”是 AI 推断,两者绝不能混。混在一起你会把 AI 的猜测当成作者的自白引用出去,这是很难挽回的错误。
第 9 节的“逐字准确”必须写。 AI 会不自觉地润色引文,读起来更通顺,但已经不是原句了。引文出错在学术上是硬伤。
这个结构我封装成了一个 Skill 叫 lit-card,源码开源在《3 个科研 Skill 源码(免费开源)》里,装上之后一句话就能触发,不用每次贴这段。
11.2 批量做卡:一批文献一起过
单篇能跑通之后,改成批量:
对「效率评价」文件夹下 12 篇 PDF,逐篇按 lit-card 结构生成速读卡。 要求: - 每篇输出一个独立的 Markdown 文件,存到 D:\Obsidian\研究库\文献\,文件名「年份_第一作者_主题.md」 - 每完成 3 篇报告一次进度,我可以中途叫停 - 全部完成后,额外生成一份「批次总览.md」, 用表格汇总 12 篇的:文件名 | 研究问题 | 方法 | 核心结论 | 与我研究的关系
PLAINTEXT
“每完成 3 篇报告一次”是给自己留后路。 如果它前三篇的输出质量就不对,你可以立刻叫停调整,而不是等十二篇全部跑完。
12.3 直接写进 Obsidian,带上 YAML 和双链
如果你用 Obsidian(第 06 篇讲过),可以让笔记直接符合你的库规范:
生成速读卡时,按以下 Obsidian 规范: 文件开头 YAML: --- title: 论文标题 authors: [作者1, 作者2] year: 2023 journal: 期刊名 tags: [文献/数字政府, 方法/双重差分] status: read rating: --- (rating 留空,我自己填) 正文用二级标题分节,节名与 lit-card 的 9 节一致。 在「与我的研究的关系」一节中,用 [[双链]] 关联到 vault 中已有的笔记。 硬约束:只能关联 D:\Obsidian\研究库\ 下确实存在的笔记文件, 关联前先列出你打算关联的文件名让我确认,不许创建指向不存在笔记的链接。
PLAINTEXT
最后这条约束我在第 06 篇也强调过,这里再说一次:AI 编双链会在你的 vault 里留下一片死链,而 Obsidian 不报错,只默默显示成待创建的空笔记。等你发现时已经几十条了。
13.4 存进 WorkBuddy 知识库
笔记生成之后,把它们放进第 06 篇建的“研究主题库”:
把 D:\Obsidian\研究库\文献\ 下新生成的 12 份速读卡,添加到「研究主题库」资料库中。添加完成后列出当前该库共有多少份文件,按主题分组统计。
到这里闭环完成:知网检索 → 筛选 → 下载 → 整理归档 → 精读成卡 → 进库。下一篇写综述时,就是在这个库上工作。
14.5 我自己的抽查动作
这一步永远不能省。每批笔记生成后,我固定做三件事:
随机挑两篇,回原文核对第 4 节的方法和变量。 方法描述出错是最要命的,因为你写综述时会直接引用。
核对第 9 节所有引用原句。 逐字比对,看有没有被润色。这一步我从不跳过。
看第 7 节的推断是否合理。 如果它提的“问题”明显是没读懂原文导致的,说明这篇 PDF 的提取质量有问题,整张卡都要怀疑。
AI 做不到什么
这一篇讲的三件事,AI 做得都不错,但边界很清楚。
它不能替你判断一篇文献值不值得读。 第二部分我坚持“先出题录、人工筛选、再下载”,就是因为这一步是研究能力本身。把筛选交给被引频次排序,你会得到一堆热门文献,错过真正贴合你问题的冷门好文。
它不能替你判断一篇文献可不可信。 速读卡会把有问题的结论也整理得很漂亮。第 7 节那个“AI 推断”标记的存在,就是提醒你:这一节需要你自己想。
它不能替你读。 这句话是我想强调的重点。速读卡的价值是让你用五分钟决定这篇要不要花两小时精读,不是让你不用精读。真正要引用、要作为论证支柱的文献,你必须自己完整读一遍。我自己的比例大概是:一百篇做速读卡,二十篇自己完整读,五篇反复读。
AI 压缩的是筛选和整理的时间,不是理解的时间。
下一篇
文献进库了,卡也做好了。下一步是最难的一步:写综述。
下一篇给你一套可以直接复制的综述提示词,从归类、找脉络、揪争议、定缺口到搭框架、写小节,逐环节给指令,并且说清哪一步 AI 绝对不能替你做。