离大谱!PDF 读完就忘,15k Star book-to-skill 把技术书编译成 Agent 的随身 Skill
很多人买技术书时信心满满读完几章后也觉得“懂了”但三个月后遇到问题还是得重新翻 PDF、搜目录、找关键词。book-to-skill 的反差在于它不把书再总结成一篇更短的文章而是把书“编译”成 Agent 可以按需调用的 Skill。你以后问 Agent/your-book replication它不是凭印象聊天而是加载对应章节、术语和方法直接从整理后的知识结构里回答。先说痛点读过不等于用得上技术资料最容易出现三种浪费PDF 在硬盘里但 Agent 不知道它存在你做过笔记但笔记变成一篇永远不会再打开的长文每次提问都让 Agent 重新翻目录、找章节、回忆上下文既慢又费 Token。传统的“把整本书塞进上下文”看起来直接实际上会让模型面对过量内容“只做摘要”又容易丢掉决策规则、反模式、代码示例和章节关联。book-to-skill 选择了第三条路先付一次整理成本把资料拆成结构化、可发现、可按需加载的知识资产。一句话理解 book-to-skill它是一个把书籍、文档目录或多份资料转换成 Agent Skill 的命令行工具。输入可以是一个文件、一个目录、一个 glob甚至是一组不同格式的资料输出不是一篇普通总结而是一套有层次的 Skill输出文件主要作用Agent 什么时候读SKILL.md核心心智模型、章节索引、使用入口每次加载 Skill 时先读chapters/每章的按需知识文件问到具体章节或主题时glossary.md术语、定义和章节引用遇到陌生概念时patterns.md技术、算法、设计模式和实践方法需要解决类似问题时cheatsheet.md决策表和快速规则需要快速查判断时这套结构的关键不是文件多而是把“核心知识”和“细节知识”分开让 Agent 不必每次都把整本书重新搬进对话。它最值得关注的 4 个点1. 不是总结而是提炼“可执行知识”普通摘要常常告诉你“这一章讲了什么”但真正工作时更想知道什么场景应该用这个方法哪些情况不应该用决策顺序是什么常见反模式有哪些代码或表格示例在哪里book-to-skill 的设计原则是 practitioner voice也就是把内容提炼成“什么时候用 X、为什么、要避开什么”的工作规则而不是把原文换一种说法再抄一遍。2. 章节按需加载避免每次重新发现一个 Agent 直接读 PDF往往会经历一段隐形的“发现循环”找目录、遇到术语、回头翻页、加载更多内容再把读到的东西压缩回主对话。book-to-skill 把这笔导航成本前置到生成阶段。运行时先加载体积较小的SKILL.md根据问题再定位到具体章节、术语表或 patterns 文件。3. 技术书和普通书走不同的提取路线项目不会对所有 PDF 一刀切技术型资料优先考虑 Docling以尽量保留 Markdown 表格和代码块文字型资料优先使用pdftotext再按需回退到pypdf、pdfminerEPUB、DOCX、HTML、RTF、MOBI 等格式也有对应提取器或回退方案。这点很工程化提取不是越快越好而是要看原始资料里有没有代码、表格和结构信息。如果把一本技术书当纯文本处理最后得到的 Skill 可能“读起来完整拿来用却缺关键结构”。4. 支持把新资料折叠回已有 Skill它不只支持从零生成新 Skill也支持把新论文、新章节、新笔记合并进已有 Skill 目录。这让知识库更像一个会持续更新的工程产物先把一本书编译成 Skill之后再把实践记录、补充文章和新版本文档 fold in而不是每次重新从零生成一套孤立笔记。3 步看懂它怎么工作bash 资料文件 / 文档目录 / glob │ ▼ 选择提取路线技术型 or 文字型 │ ▼ 合并文本 元数据 来源标记 │ ▼ 分析标题、作者、章节、目录和知识结构 │ ▼ 生成 SKILL.md、章节、术语表、patterns、cheatsheet │ ▼ Agent 按需加载并用于工作最简单的使用方式是bash /book-to-skill ./my-book.pdf也可以一次处理多个资料或者把新资料合并进已有 Skillbash /book-to-skill ~/papers/paper1.pdf ~/notes/export.txt unified-research /book-to-skill ~/articles/new-paper.pdf ~/.claude/skills/project-knowledge官方仓库的原始页面显示它不是一个只有 README 的概念项目而是包含book_to_skill、scripts、docs、tests和tools等目录并配有命令行入口和测试结构。它和“让 Agent 直接读 PDF”有什么不同方式处理方式每次提问的代价知识能否复用直接把 PDF 塞进上下文运行时临时发现和读取上下文长导航成本高弱只做一篇摘要一次压缩成短文细节、规则和章节关系容易丢中手写长笔记人工整理和维护维护成本高结构不统一取决于个人book-to-skill编译成分层 Skill按需加载先整理运行时按主题读取强README 提到在真实书籍测试中它测得的 Token 消耗比直接把书倒进上下文少 24 到 51 倍。这个数字属于项目自己的基准不代表每一本书都能达到同样结果但它说明了一个方向把“阅读和导航”从每次对话里拿出来提前编译一次。程序员可以怎么用把《Designing Data-Intensive Applications》编译成可查的架构 Skill把团队内部架构文档、运行手册和 onboarding 文档合成一套知识 Skill把 RFC、API 合约和合规标准变成可在写代码时查询的规则库把品牌规范、设计系统和代码规范转成 Agent 的工作上下文把论文、实验记录和自己的补充笔记持续 fold in形成研究 Skill。它真正适合的是“会反复用到但不想每次重新翻”的知识而不是只看一次、没有后续行动的资料。项目边界与限制它不是知识库万能替代品book-to-skill 解决的是资料提取、结构化和 Agent 按需加载不是所有知识管理问题生成质量依赖原始文档结构和提取器能力OCR 质量差、扫描版 PDF 或复杂排版仍可能需要人工校验Skill 生成之后仍需要版本管理和更新策略“No hallucination”是项目目标不能替代对关键技术结论的验证生成的SKILL.md能否被某个 Agent 客户端直接发现取决于该客户端是否支持对应的 Agent Skills 目录和加载约定。项目采用 MIT License适合拿来研究也适合根据自己的团队知识流改造成内部工具。我的判断book-to-skill 最有价值的地方不是帮你少看几页 PDF而是把“读过的知识”从静态文件变成了 Agent 可以调用的工作能力。书不再只是被问一次的资料而可以变成一套会在真实任务里被反复调用的 Skill。如果你正在积累技术书、内部文档、论文或规范建议先拿一份 20 到 50 页的资料试跑看它生成的SKILL.md是否抓住了核心心智模型再检查章节索引、术语表、patterns 和 cheatsheet 能不能真正辅助下一次工作。后续我会继续拆解如何为自己的知识库设计 Skill 目录、如何让不同 Agent 共用一套 Skill以及怎样对生成结果做质量回归。项目地址https://github.com/virgiliojr94/book-to-skill

相关新闻

Elasticsearch 日志检索 DSL 实战:时间范围查询、字段去重、分钟级统计与最新日志获取

Elasticsearch 日志检索 DSL 实战:时间范围查询、字段去重、分钟级统计与最新日志获取

日志平台的检索界面用久了,总会遇到一些"页面做不到"的需求:只想看看时间窗口内到底有哪些日志路径、想按分钟拉一条日志量趋势、想确认每个采集任务"最后一条日志是什么时候写入的"。这些场景直接写 Elasticsearch DSL 查询&#x…

2026/10/2 21:00:19 阅读更多 →
OpenAI dots 全面解读:一个有自己电脑、还能借你电脑干活的 AI 同事

OpenAI dots 全面解读:一个有自己电脑、还能借你电脑干活的 AI 同事

OpenAI dots 全面解读dots 不是一个更聪明的聊天框,而是 OpenAI 第一次把“AI 同事”做成了正式产品。 它有名字、有长相,有一台属于自己的云端电脑;经你同意,还能伸手到你自己的电脑里干活。它 24 小时在线,会主动找活…

2026/10/2 20:59:18 阅读更多 →
端侧推理的工程账,全栈自研 物理AI 的最后一公里

端侧推理的工程账,全栈自研 物理AI 的最后一公里

【具身AGI导读】模型的参数越堆越大,本体能给出的预算却一直没变。这笔账,谁先算清,谁的本体才先跑起来。2026 年 9 月,高校与算力团队联合开源了一套具身端侧推理引擎。它要回答的问题很具体:一个模型,到底…

2026/10/2 20:59:18 阅读更多 →

最新新闻

如何调试正在运行的Python程序

如何调试正在运行的Python程序

对当前正在运行的程序执行调试操作的办法, 主要涵盖以下几个层面, 一方面是借助于程序内置的调试器pdb这个工具, 另一方面是使用集成开发环境本身所附带的用来进行调试的相关功能模块, 再就是通过在代码中间插入用于记录状态的日志信息, 最后还可以启用外部的专用调试设施比如V…

2026/10/2 21:43:50 阅读更多 →
云晖达中墨出海成功案例是否真实可靠

云晖达中墨出海成功案例是否真实可靠

深圳云晖达国际贸易有限公司,作为深耕中墨制造业出海领域的专业服务商,聚焦计划赴墨西哥投资布局的国内制造企业,提供从前期调研到本地运营的一站式全周期出海解决方案,助力国内制造企业把握USMCA政策红利,顺利落地墨西…

2026/10/2 21:43:50 阅读更多 →
Grafana页面告警配置实战:从阈值到通知策略的完整链路

Grafana页面告警配置实战:从阈值到通知策略的完整链路

前两周有个运维同事跑来找我,说自己 Grafana 面板做得挺漂亮,CPU 阈值画到了 85,可机器负载到 95% 半天了,手机上一个告警都没收到。我过去看了一眼就发现问题了:他把 Dashboard 面板里的阈值线当成了告警开关&#xf…

2026/10/2 21:43:50 阅读更多 →
掌握这8个后端技巧,开发效率翻倍

掌握这8个后端技巧,开发效率翻倍

契约先行,接口定义清楚再动手别急着写实现。先用OpenAPI或Swagger把接口的入参、出参、错误码定死。前端拿着文档并行开发,你按契约实现。接口是团队之间的合同,合同不清,扯皮不断。 契约先行,省掉的是联调时的来回拉锯…

2026/10/2 21:43:50 阅读更多 →
降重降AI两不误!2026这3款降AIGC工具太好用了!

降重降AI两不误!2026这3款降AIGC工具太好用了!

谁还在为AI生成论文的AI率太高发愁?明明用AI省了时间,结果查重时AIGC率超标,直接被老师打回重写,熬夜改到崩溃真的太窒息了!最近被问最多的就是“有没有可以自动降AI率的论文生成工具”,作为过来人&#xf…

2026/10/2 21:42:50 阅读更多 →
AutoRef:多参考图驱动的Agentic图像生成工作流

AutoRef:多参考图驱动的Agentic图像生成工作流

1. 项目概述:AutoRef不是又一个图像生成玩具,而是多参考图协同驱动的智能体工作流引擎AutoRef这个名字乍一听像某个开源小工具,但拆开看——“Auto”指向自动化决策,“Ref”是Reference的缩写,合起来直译就是“自动参考…

2026/10/2 21:42:50 阅读更多 →

日新闻

从零搭建AI工程化:模型之外的完整闭环

从零搭建AI工程化:模型之外的完整闭环

先搞清楚一件事:从零开始做 AI 工程化,难的从来不是调模型、写提示词,而是把一套原型 Demo 变成长得像是“正经系统”的东西。你手里可能已经有了能跑通的代码,也可能刚读完一些概念,但真到了要把它变成可维护、可观测…

2026/10/2 0:00:20 阅读更多 →
大模型训练显存估计与混合精度训练实战指南

大模型训练显存估计与混合精度训练实战指南

1. 大模型训练显存估计与混合精度训练详解显存不够用,几乎是每个做大模型训练的人都会撞上的第一堵墙。你可能也经历过:模型代码写完了,数据管道跑通了,满心欢喜地按下训练启动脚本,结果几秒钟后终端弹出一行红字——C…

2026/10/2 0:00:20 阅读更多 →
小样本学习数据集选型指南:27个真正可用的高质量数据集

小样本学习数据集选型指南:27个真正可用的高质量数据集

1. 小样本学习的“弹药库”:为什么你总在找数据集,却总找不到真正能用的? 小样本、数据集——这两个词最近半年在我处理的200多个AI项目咨询里,出现频率排进前三。不是模型调不好,不是代码写不对,而是卡在…

2026/10/2 0:00:20 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/1 19:40:48 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/1 19:41:40 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/10/1 20:05:24 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 10:36:31 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 5:26:06 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 6:09:11 阅读更多 →