有没有过这种体验?
花了几百块买了本《Designing Data-Intensive Applications》,啃了两周,觉得收获满满。三个月后,同事问你"分布式共识算法的问题怎么处理",你只记得书里好像讲过,但具体说了啥,一点都想不起来。
PDF翻了半天,搜到一堆页码,不是答案。问AI,它要么编一段看着像那么回事但其实不对的,要么直接告诉你"我没有这本书的内容"。
今天GitHub上有个项目炸了——单日涨了1421颗星,真的非常推荐下,它做的事说起来简单:把技术书变成AI能随时查阅的技能包。

项目叫book-to-skill,用法就一行命令:
/book-to-skill ./my-book.pdf然后它会做什么?
1. 把整本书拆解成章节结构 2. 提取核心概念、术语表、设计模式、速查表 3. 生成一个 SKILL.md加一堆章节文件,塞进你的AI编程助手的技能目录里
完事之后,你在Claude Code或者GitHub Copilot CLI里打一句:
/my-book-slug replicationAI就会去读对应章节,用书里的真实内容回答你。不是编的,不是猜的,是书里白纸黑字写的。
为什么不用RAG,不用向量数据库?
你可能会想,这不就是RAG干的事吗?把文档切块、向量化、检索?
差别在于:book-to-skill不是把书切成碎片让你搜,而是把书结构化了。
它生成的不是一堆chunk,而是一个有层次的技能包:
• SKILL.md(约4000 token):核心心智模型+章节索引,AI每次对话都会加载 • chapters/ch01-xxx.md(每章约1000 token):按需加载,你问到才读 • glossary.md:术语表,带章节引用 • patterns.md:所有技术、算法、设计模式 • cheatsheet.md:决策表和快速参考
关键数字:比直接把书扔进上下文窗口省24到51倍token。
这不是小事。一本500页的技术书,如果直接喂给AI,光上下文就吃掉几万token,每次问答都要背着这个负担。而book-to-skill的方式,日常只加载4000 token的索引,问到具体章节才加载那一章的1000 token。
省钱,省速度,还省你的API额度。

不止是书
虽然名字叫"book-to-skill",但它的输入远不止PDF教材。看了下,在README里列了这些场景:
内部文档——架构决策记录、运维手册、新人入职指南。把整个docs/文件夹扔进去,团队成员写代码时直接问AI,不用再翻wiki。
品牌设计系统——语调指南、组件原则、视觉规范。把60页的品牌手册变成一个技能,你的团队终于会用了。
论文集——一堆论文加你自己的笔记,合成一个统一的技能包。新论文发表了?一条命令把新内容折叠进去。
规范和标准——RFC、API合同、合规文件。那些你经常查但永远背不下来的东西。
判断标准很简单:如果你经常打开一个文档,每次都希望自己能背下来,那它就是候选。

支持哪些格式和工具
文档格式方面,覆盖很全:
• PDF(技术书用docling提取代码块和表格,纯文字书用pdftotext秒出) • EPUB、DOCX、TXT、Markdown • HTML、RTF、MOBI/AZW/AZW3 • reStructuredText、AsciiDoc
AI平台方面,它遵循的是开放的Agent Skills标准[1],所以:
• Claude Code ✅ • GitHub Copilot CLI ✅ • Amp ✅
三家用的是同一套SKILL.md格式,生成的技能可以跨平台使用。
一个让人眼前一亮的细节
它还有个功能叫"fold-in"——你可以往已有的技能包里追加新内容:
# 把新论文折叠进已有的研究技能包/book-to-skill ~/articles/new-paper.pdf ~/.claude/skills/project-knowledge这意味着你的知识库是活的,可以持续更新。买了本新版?出了新论文?一条命令就并进去,不用从头再来。

说回那个更本质的问题
book-to-skill表面上是"把书变成AI技能",但它触及的是一个更深的趋势:
AI编程助手正在从"代码补全工具"变成"知识伙伴"。
当你的AI助手能随时查阅你读过的每一本技术书、你公司内部的每一份架构文档、你关注的每一个RFC——它的价值就不再只是帮你写几行代码了。
它变成了你的第二个大脑。而且是一个不会忘记的、24小时在线的、秒级响应的第二大脑。
我认为这是一个真实痛点的共振:读过的书不该变成沉没成本。
项目地址:github.com/virgiliojr94/book-to-skill
MIT协议,Python实现,装好依赖就能用。
夜雨聆风