、这篇是「AI与数据」专栏。讲一个我上周亲历的小实验:如何把"自己手动整理资料"这件又烦又费时的事,交给 AI 主动接管。
第283篇原创
🧩 一、我囤了四年的"数据",其实从没真正属于我
我加入一个叫"数据学堂"的知识星球,四年了。
运营者很用心,四年分享了 1859 个文件,总容量 15.27 GB——白皮书、方案 PPT、工具模板、统计年鉴,应有尽有。
但我如果诚实一点说:这些东西,我从来没真正"拥有"过。
这话听着像哲学,其实是物理事实。链接散落在几千条帖子里,提取码藏在上下文的某句话里,百度网盘的分享今天还在、明天可能就死了。我每次想找点东西,都得重新登录、重新翻帖、重新输提取码、重新转存。
上个月我认认真真算了一笔账——光"整理资料"这件小事,我前前后后搭进去的时间,够我把那几门课从头学一遍了。

这就是大多数人的"数字资产"现状:你以为你收藏了,其实你只是租了一间随时会被收走的房子。
🤖 二、上周我做了件有点意思的事:不再自己动手,让 AI 动手
痛点想清楚之后,我换了个打法。
我不再亲自登录、亲自翻、亲自转存了。我让 AI 去动手。
注意,不是"AI 帮我写段代码、我复制去跑"那种浅合作。是真正的:
我把需求说清楚,AI 把脚本写出来,脚本自己去登录、去提取、去验活、去转存、去分类、去归档——我一觉醒来,数据已经自己归位了。
这里的关键,是一个被很多人忽略的技术姿势:CLI(命令行接口)+ 浏览器自动化。
你给 AI 一个"能跑命令的环境",它就不再是聊天框里那个嘴替,而是一个能直接操作你电脑、调用网站接口的"数字员工"。知识星球的帖子文本、百度网盘的转存按钮、NAS 的同步目录,对它来说都是可以攀爬的台阶。
(你说这不就是自动化?对。但大多数人的卡点在于"自动化得先写代码"。而现在的区别是——写代码这步,也可以交给 AI。你只负责想清楚要什么,剩下的交给它踩坑。)

🛠️ 三、什么是 CLI?为什么我选它而不是别的?
很多人听到"让 AI 帮我干活",第一反应是:那不就是写脚本吗? 是的,但脚本跑起来需要一个入口,这个入口就是 CLI——Command Line Interface,命令行接口。
说人话:你在终端(黑窗口)里敲一行命令,比如 wenyan publish -f article.md,程序就帮你把文章推到公众号草稿箱了。CLI 是你电脑里所有能"用一行文字召唤出来干活的工具"的统称——npm、git、python、wenyan、ffmpeg、curl,全是 CLI。
但当你想让 AI 干更多事的时候,光知道 CLI 不够。给 AI 装"工具"有四条路:CLI、Skill、MCP、API。它们看起来差不多,其实各有各的脾气。

一句话区分:
🧰 CLI:终端里的现成工具,AI 直接调(门槛最低,立刻能用) 📖 Skill:写给 AI 看的"使用说明书",告诉它什么时候该怎么用工具(厂商内置) 🔌 MCP:一套让 AI "即插即用"外部工具的标准协议(生态发展中) 🛠 API:最底层的 HTTP 调用,开发者手写(最灵活但最重)
四者的关系,其实是上下叠层:
API 是地基,CLI 是地上一层的"现成摊位",MCP 是"统一接口的商场",Skill 是贴在摊位上的"使用指南"。能力越来越丰富,门槛也越来越高。
那为什么这次我用 CLI? 因为现实条件很简单:
知识星球没有官方 API——只能走网页解析 知识星球的 MCP 也还没成熟实现——自己写一个成本太高 我手头正好有 wenyan-cli 这种现成的 CLI 工具——AI 一行命令就能调用 门槛最低、可立刻跑通——符合"个人脚本级自动化"的最优解
所以你看,技术选型不是看"哪个最先进",是看"哪个最匹配你当下的约束"。CLI 在我的场景里刚好是性价比最高的——成熟、可组合、AI 友好。如果你面对的是稳定的 SaaS 系统(GitHub、Notion、飞书),MCP 是更好的选择;如果是临时性脚本自动化,CLI 一行命令就到顶。
🏗️ 四、我给这套打法起了个名字:数字置业三段式
把这次实践抽象一下,底层逻辑只有三步。它能迁移到几乎任何"散落资源整合 + 本地永久化"的场景。
第一段:从任意源 → 可处理列表。 知识星球的帖子、微信收藏、小红书、Notion、印象笔记……本质都是"人类可读的混杂文本"。第一步永远是把它变成结构化数据——链接、文件名、标题、提取码。这一步做完,"乱"就变成了"表"。
第二段:从结构化数据 → 存活判断 + 分类。 别急着全拉下来。先问"哪些还活着",再问"它们该去哪"。先筛活、再归类,省掉的是后期 90% 的杂乱。
第三段:从清洗后的列表 → 本地永久存储。 NAS、移动硬盘、云盘备份都行,但底线只有一个:你必须有一个本地副本。"在线"不等于"拥有",云盘会限速、会关停、会被删。

一句话记住:别一开始就买设备,先用脚本看看自己到底有多少东西;先下载转存,后分类;本地永久是底线。
🔧 五、落到"知识星球→NAS"这条线,是六个具体动作
把"三段式"套到这次的任务上,就变成一条清晰的流水线:
链接提取 → 批量验活 → 批量转存 → 智能分类 → 本地下载 → NAS 同步。

六个动作,我一个一个讲,但重点不是动作本身,是动作里那些"有意思的坑"——它们才是这个项目真正值钱的部分。
① 链接提取。 把帖子文本丢进去,正则匹配出 8 种网盘的链接,自动识别提取码("提取码: xxxx""pwd=xxxx"各种写法都覆盖),按 URL 去重。1070 条链接,就是这么捡起来的。
② 批量验活。 这一步最有意思。百度的失效分享,页面照样返回 200,骨架和活链长得一模一样——只有内嵌的那行 JavaScript 变量 errno 说了真话:0 是活,非 0 是死。

UI 会骗人,数据不会。我当初验证时发现,光看页面会误判一大批死链为有效,加了 errno 校验才救回来。另外,验活时如果不及时清掉上一条链接残留的 BDCLND Cookie,下一批链接会被"误判"为不需要提取码——一个小票据,能污染整条判定链路。
③ 批量转存。 启动一个本地 HTTP 服务,浏览器登录百度网盘后自动拉任务、填提取码、点转存。991 条,一条条自己跑完。
④ 智能分类。 转存完,991 个目录名全是分享码(如 1aBcDe...),人看不懂。让 AI 读目录内部的文件名,推测主题,分成 11 类,再自动重命名为中文标题。155 个空目录也一并清掉。
⑤ 本地下载。 知识星球原生上传的文件(不走网盘链接),通过官方 API 枚举、取直链、多线程下载。1859 个文件,15.27 GB。
⑥ NAS 同步。 百度网盘客户端把归档目录设为同步文件夹,自动同步到 NAS。按"年份/类型"归档——2024/PDF/、2024/PPT/……目录自己长好了。
📊 六、数字摆出来,冲击感就有了
| 1070 条 | |
| 991 条(存活率 92.6%) | |
| 1859 个 / 15.27 GB | |
| 11 个主题 |
4 年的星球,链接存活率居然还有 92.6%。这说明运营者用心,也说明——这些资料,确实值得"搬回家"。
最终,我通过这个AI连续3天,完成所有 的下载

💡 七、真正贵的,从来不是技术
这个项目我前后花了30分钟设计,然后让AI 跑了 10 多个小时,外加 4 天配额等待。看起来是用时间换时间,亏了。
但我想说的另一件事是:
我们总以为"技术"是门槛。写代码、配环境、调接口,确实烦。
可真正贵的,从来不是技术——是你想清楚"我要什么、约束是什么、什么算做好"的那部分思考。
AI 把我从"写代码的人"变成了"提需求的人"。它踩坑、它报错、它说"我重写了",我负责判断"这是不是我要的"。
技术是最便宜的环节,思考才是最贵的。

所以这次实践,我想发给所有"囤资料癖"读者一句话:
收藏只是暂住,下载才是签到,本地永久才是置业。 你不落本地的东西,本质上都是租来的。租来的,房东随时能收。
这套"从散落源到本地永久"的方法论,可以迁移到几乎任何场景:微信收藏的历史文章、多个群里的表情包、各平台买的网课、多个微信号里的视频。底层逻辑只有一个——把"人类可读的混杂"变成"机器可处理的列表",再变成"你真正拥有的资产"。
而 AI 在这个过程里扮演的角色,不是替你思考,是替你把"想清楚之后的脏活累活"一口气干完。
「AI与数据」专栏 · 我是 Steven,把数据从业经验写成可落地的实战笔记。

夜雨聆风