book-to-skill — technical books as agent skills
book-to-skill — technical books as agent skills
为什么重要
book-to-skill 把技术书、文档目录或资料集合转成 cross-host agent skill。它和用户的 llm-wiki/book ingestion 场景高度相关:完整书籍不应只被总结成一页,也不应整本塞入上下文;更好的做法是抽取 frameworks、decision rules、anti-patterns、chapter index、glossary、patterns 和 cheatsheet,并按需加载。
机制 / 一阶原理
README 描述了两段式结构:deterministic Python extractor 负责 document → clean text + metadata;spec-driven generator 负责生成 SKILL.md、chapter files、glossary、patterns、cheatsheet。SKILL.md 约 4,000 tokens,章节文件按需加载,目标是比直接把书塞进上下文少 24x–51x tokens。它支持 PDF、EPUB、DOCX、MD、HTML、RTF、MOBI,并强调本地处理与版权边界。
与已有概念的关系
- 补强 External-Agent-Skills-Design-Patterns:高质量 skill 是结构化知识包,不是长摘要。
- 连接 Context-Engineering:按需章节加载是 rate-distortion / purpose bundle 的具体实现。
- 连接 LLM-Wiki:wiki 负责长期综合和 cross-link,skill 负责 agent-facing workflow/routing;二者可以互补。
对 Hermes / llm-wiki 的可执行启发
- 大书 ingestion 后可增加“是否值得编译成 skill”的 gate:如果用户会反复让 agent 运用书中方法,就应生成 agent-facing routing 层。
- wiki 的 source page 不应承载整本书所有细节;章节级 raw + 概念页 + skill/cheatsheet 才是更稳结构。
- 对第三方生成的 book skill,应只学习结构;安装前仍需检查脚本、依赖、版权和来源 hash。
失败模式 / 边界
自动生成 skill 可能把版权内容过度复制,也可能把章节压缩成过浅规则。技术书里的代码和公式还需要 extractor 质量验证;没有 with/without-skill eval 时,不能只凭 token 节省断言它提高任务质量。
写入记录
- 2026-08-16 09:00 CST:新增 book-to-skill 来源页,沉淀 full-length source → agent skill 的结构、按需加载和 llm-wiki book ingestion 启发。