深入解析 Skill_Seekers Jupyter 参考文件生成机制:从 `section_s3-s4.md` 看代码单元、Raw 单元与 golden 验证体系
人工智能AI 应用AI 技能RAGMCP 服务网页爬虫【免费下载链接】Skill_SeekersConvert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection项目地址https://gitcode.com/gh_mirrors/sk/Skill_Seekers点击查看免费下载导读本文以 Skill_Seekers 仓库中 Jupyter Notebook 转 Skill 流水线的 golden 输出示例tests/golden/phase2/jupyter_kw/references/section_s3-s4.md为切入点逐行拆解 Skill_Seekers 如何把一个.ipynb中无标题、异常报错、未渲染的杂项单元转换为结构化 Markdown 参考文件。读者将掌握参考文件的命名规则、代码单元与 Raw 单元的具体渲染格式、关键词分类与 Other 兜底机制以及 golden 测试如何保证输出字节级稳定。一、关联文档在产物树中的定位tests/golden/phase2/jupyter_kw/是 Skill_Seekers 为 Jupyter 抓取器src/skill_seekers/cli/jupyter_scraper.py在 Phase 2 重构迁移到DocumentSkillBuilder前后输出一致性而提交的 golden 基线树。该目录包含SKILL.md生成的主技能入口含 Section Overview、Dependencies、Code Examples、Notebook Statistics 等汇总references/index.md整个 notebook 的分类索引列出 5 个分类、各类包含的 section 区间、统计信息与导入包列表references/section_*.md每个分类对应一个参考文件section_s3-s4.md正是其中之一。关联文档section_s3-s4.md属于golden_jupyter_kw构建产物对应测试 test_jupyter_keyword_categorization_matches_golden 中Other分类的输出。它只包含两个单元Section 3 与 Section 4恰好覆盖了流水线中最容易被忽略的两种单元类型——抛出异常的代码单元与Raw 原始单元因此是理解整个渲染管线最浓缩的标本。从 references/index.md 的 Categories 一节可以看到它的归属- [Other](https://link.gitcode.com/i/b7f9c2e704a14162f9f90afaeedb8336) (2 sections, Sections 3-4)而index.md的 Statistics 提供了全局口径5 个 section、2 个 code 单元、2 个 markdown 单元、1 个 raw 单元、1 个 notebook导入包为numpy、pandas、sklearn三个。这些数字与 test_phase2_golden_jupyter.py 中的SECTIONS与_extracted_data完全对应。二、参考文件命名规则section_s3-s4.md从何而来参考文件的名字不是随意的其生成逻辑集中在 src/skill_seekers/cli/scraper_utils.py 的reference_filename()函数中它是文件写入器、index.md和SKILL.md导航三处共用的唯一事实来源以避免链接漂移代码注释中标记为 DOC-07。命名分三种情况分类为空回退为section_序号.md两位数字补齐例如空分类的 references/section_04.md只有一个分类使用源文件 stem 命名如analysis.md无 stem 时用main.md多分类当前场景取分类内最小与最大 section 号拼成区间格式为base_prefixmin-prefixmax.md。golden_jupyter_kw走第三条路径其分类来源是测试传入的categories字典见 test_phase2_golden_jupyter.py含setup、modeling、loading、empty_cat四个显式分类。分类完成后Other 桶收集了未被任何分类命中的 section 3Magic 单元与 section 4Raw 单元section 号区间为 3–4因此得到文件名section_s3-s4.md——s是prefix参数的默认值base_stem为空时取section。同一逻辑也解释了同目录下section_s1-s1.md、section_s5-s5.md的命名。三、代码单元渲染标题推断、执行计数与错误输出section_s3-s4.md的第一段完整展示了无执行计数的代码单元是如何被渲染的** Source: Section 3** (Code Cell) #### Magic: %timeit python %timeit broken()Errors:NameError: name broken is not defined Traceback line 1Tags: raises-exception逐行对应 [jupyter_scraper.py](https://link.gitcode.com/i/9735c98d6b9f8bb35b679f4aca3d9901) 中的处理 ### 3.1 单元头部与执行计数 渲染入口是 _write_reference_section()[jupyter_scraper.py](https://link.gitcode.com/i/9735c98d6b9f8bb35b679f4aca3d9901#L749-L794)代码单元固定输出 ** Source: Section N** (Code Cell)若存在执行计数会追加 [In N] 标记如 (Code Cell [In 2])。本单元 execution_count 为 None因此不显示 [In N]——这正是 [test_phase2_golden_jupyter.py](https://link.gitcode.com/i/2cbf673e4405cd4929710920525fcf79) 中 section 3 的数据形态。 ### 3.2 Magic 命令的标题推断 代码单元本身没有 Markdown 标题其标题由 _infer_code_heading()[jupyter_scraper.py](https://link.gitcode.com/i/9735c98d6b9f8bb35b679f4aca3d9901#L583-L605)按优先级推断 - 首行是 # 注释 → 截取注释文本超过 80 字符截断 - 首行是 def/class/async def → Define: 名字 - 首行是赋值表达式 → Assign: 变量名 - 首行是 **magic 命令% 开头** → Magic: 命令 - 首行以 ! 开头 → Shell: 命令 - 兜底 → Code Cell [执行计数]。 %timeit broken() 命中第四支产出 Magic: %timeit。写入时标题层级在 heading_levelh3基础上加一级渲染为 ####因此参考文件中出现 #### Magic: %timeit。 ### 3.3 错误输出的收集与格式化 异常信息来自 _parse_code_cell()[jupyter_scraper.py](https://link.gitcode.com/i/9735c98d6b9f8bb35b679f4aca3d9901#L497-L562)对 outputs 中 output_type error 的处理拼接 ename: evalueNameError: name broken is not defined后追加清理过的 traceback 行剥离 ANSI 颜色码 \x1b[...m得到第二行 Traceback line 1。写入时统一放进 **Errors:** 代码块[jupyter_scraper.py](https://link.gitcode.com/i/9735c98d6b9f8bb35b679f4aca3d9901#L783-L784)。与之相对stream 输出进 **Output:** 块execute_result/display_data 的 text/plain 进正文文本text/html、image/png、image/svgxml 等富输出则折叠为一行 *Rich output: mime 列表*。 ### 3.4 单元标签 nbformat 中 cell 级 metadata.tags 会被保留并渲染为 *Tags: ...* 行[jupyter_scraper.py](https://link.gitcode.com/i/9735c98d6b9f8bb35b679f4aca3d9901#L791-L793)。本单元携带 raises-exception 标签在 SKILL 中成为一种语义标注便于 Agent 检索会抛异常的示例。 ## 四、Raw 单元的极简渲染 section_s3-s4.md 的第二段是全文件最短的一段 markdown ** Source: Section 4** (Raw Cell) raw front-matter contentRaw 单元通常用于存放 front-matter、LaTeX、不可渲染的源文本由_parse_raw_cell()jupyter_scraper.py处理无标题、无代码样例、无输出仅保留source.strip()作为正文写入时头部标记为(Raw Cell)jupyter_scraper.py。这段渲染刻意裸奔保证 front-matter 类内容不被二次加工破坏可直接被下游解析器消费。五、为什么这两个单元会进入 Other 分类Other 桶的形成取决于分类策略。categorize_content()jupyter_scraper.py按优先级依次处理单文件来源直接用 notebook 的 stem 作为唯一分类本 golden 分支未启用因为测试配置未把notebook_path设为文件显式关键词分类对每个 section 拼接text heading code_section_text()jupyter_scraper.py逐个匹配categories字典中的关键词命中数最多的分类胜出没有任何命中则落入other自动主题分类无显式分类时使用内置_TOPIC_KEYWORDSjupyter_scraper.py涵盖 data_loading、modeling、evaluation 等 8 类主题得分 ≥2 才入桶否则进other。在test_jupyter_keyword_categorization_matches_golden中测试传入categories{ setup: [install, setup], modeling: [accuracy, recall, model], loading: [read_csv], # 仅能命中代码样例中的 read_csv empty_cat: [zzz-no-match], # 永远不会命中 → 空分类 }Section 3 的%timeit broken()与 Section 4 的raw front-matter content均不包含任何分类关键词%timeit不在 modeling 关键词中、broken与raw亦不匹配于是双双落入other标题渲染为 Other。而 section 1 因含setup、install命中setupsection 5 因含accuracy、recall、model命中modelingsection 2 的read_csv命中loading——这正是 index.md 中五个分类数量1/1/1/0/2的成因。六、golden 测试如何保证输出不变tests/golden/phase2/jupyter_kw/不是随手生成的文档而是回归测试的字节级基线。tests/phase2_golden_utils.py 定义了校验协议重构前用UPDATE_GOLDENS1 pytest 测试名从旧代码捕获基线并提交重构后测试在比对模式下运行assert_matches_golden()tests/phase2_golden_utils.py会对skill_dir下所有文件做集合与逐字节比对任何差异包括空白、换行都会以 unified diff 形式抛错其 docstring 明确警告UPDATE_GOLDENS1会重写已提交基线只能在刻意更新时使用。因此section_s3-s4.md的每一行都等价于一条约束——只要JupyterToSkillConverter的渲染逻辑有任何行为变化测试 test_phase2_golden_jupyter.py 就会立即失败。这也是将golden_jupyter_kw归类到目录来源 显式关键词分类 空分类 other 兜底组合的原因该分支覆盖了_reference_filename的区间命名、空分类回退section_04.md、关键词打分与兜底桶等最易回归的路径。七、从单文件到整个技能包参考文件的消费方式section_s3-s4.md最终通过两条路径被 Agent 消费SKILL.md的Navigation一节SKILL.md列出全部references/*.md及其分类名链接同样由reference_filename()统一生成保证不会指向不存在的文件顶部 front-matter 的name与description如Use when testing the golden_jupyter_kw golden build供 Agent 在技能选择阶段判断何时加载description若未显式配置会由infer_description_from_notebook()jupyter_scraper.py依据language_info、kernelspec.display_name等 notebook 元数据自动生成。用户在自己的 notebook 上复现同样的产物只需安装nbformat后运行单文件或目录均可见 jupyter_scraper.py 用法注释pip install skill-seekers[jupyter] skill-seekers jupyter --notebook analysis.ipynb --name myskill skill-seekers jupyter --notebook ./notebooks/ --name myskill skill-seekers jupyter --from-json notebook_extracted.json生成的技能目录结构即为本 golden 树所展示的形态SKILL.mdreferences/index.md 按分类区间命名的references/section_*.md。八、小结section_s3-s4.md虽只有寥寥数行却是 Skill_Seekers Jupyter 转 Skill 管线的浓缩横截面它同时验证了 Magic 标题推断、无执行计数代码单元渲染、ANSI 清理后的错误输出、cell 标签保留、Raw 单元透传、关键词分类的 Other 兜底以及多分类区间命名这七项机制。结合 jupyter_scraper.py 的源码与 test_phase2_golden_jupyter.py 的测试数据可以确认参考文件不是临时拼凑的摘要而是由nbformat解析、DocumentSkillBuilder组装、reference_filename()统一命名、golden 测试逐字节守护的规范化产物——这正是 Skill_Seekers 把任意 notebook 变成可被 Agent 引用、检索和复现的知识技能包时的核心保障。赞分享人工智能AI 应用AI 技能RAGMCP 服务网页爬虫【免费下载链接】Skill_SeekersConvert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection项目地址https://gitcode.com/gh_mirrors/sk/Skill_Seekers点击查看免费下载相关推荐Skill_Seekers 的 Jupyter Notebook 转 SkillReference Index 索引文件的设计、生成与 Golden 验证Skill_Seekers 的 Jupyter Notebook 转 SkillReference Index 索引文件的设计、生成与 Golden 验证 S人工智能AI 应用AI 技能RAGMCP 服务网页爬虫Skill_Seekers PDF 分页参考文档生成机制解析从关键词分类到 Golden 测试Skill_Seekers PDF 分页参考文档生成机制解析从关键词分类到 Golden 测试 本文以仓库中 golden 测试产物 tests/golden人工智能AI 应用AI 技能RAGMCP 服务网页爬虫深入 Vanity 源码适配器模式与 Playground 架构设计解析深入 Vanity 源码适配器模式与 Playground 架构设计解析 本文带你深入 Vanity 源码拆解这个面向 Ruby/Rails 的 A/B 测人工智能AI 应用AI 技能RAGMCP 服务网页爬虫上一篇Karpenter 开发环境搭建与开发者工作流实战指南下一篇13ft Ladder技术架构深度剖析FlaskBeautifulSoup实现创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

3步看懂mcafee virusscan源码最佳实践

3步看懂mcafee virusscan源码最佳实践

3步看懂mcafee virusscan源码最佳实践 面试被问“病毒扫描引擎底层怎么跑”答不上来?别慌,今天带你扒开 mcafee virusscan 的底裤,用 最佳实践…

2026/9/24 19:38:09 阅读更多 →
5分钟跑通第一次授权渗透测试:CyberStrikeAI 安全测试平台快速上手

5分钟跑通第一次授权渗透测试:CyberStrikeAI 安全测试平台快速上手

5分钟跑通第一次授权渗透测试:CyberStrikeAI 安全测试平台快速上手 【免费下载链接】CyberStrikeAI The system of action for AI-native cybersecurity—where intent becomes governed execution, evidence becomes operational memory, and every operation impr…

2026/9/24 19:41:54 阅读更多 →
oct是几月?程序员转行全栈新手避坑指南

oct是几月?程序员转行全栈新手避坑指南

oct是几月?程序员转行全栈新手避坑指南 配置环境就卡半天,这是很多转行做全栈开发的新手最真实的噩梦。你刚把电脑打开,IDE装好了,Node.js装好了,结果一个小小的环境变量配置或者依赖版本冲突,就能让你原地踏步两小时。这时候,如果你连基…

2026/9/24 19:42:15 阅读更多 →

最新新闻

raylib 安装跨平台实操:三条路线跑通第一个窗口,链接参数照着敲

raylib 安装跨平台实操:三条路线跑通第一个窗口,链接参数照着敲

raylib 安装跨平台实操:三条路线跑通第一个窗口,链接参数照着敲 【免费下载链接】raylib A simple and easy-to-use library to enjoy videogames programming 项目地址: https://gitcode.com/GitHub_Trending/ra/raylib raylib 是一个 C 语言写的…

2026/9/24 20:49:59 阅读更多 →
c++构造函数问题

c++构造函数问题

在 C11 及之后的标准中,“五大成员函数”(对应著名的五法则 / Rule of Five)指的是负责管理对象生命周期与底层资源(如堆内存、文件描述符、网络套接字等)的五个特殊成员函数。这五个函数共同构成了 C 资源管理的基础&…

2026/9/24 20:49:59 阅读更多 →
东莞GEO优化服务商筛选指南:深度测评与避坑框架

东莞GEO优化服务商筛选指南:深度测评与避坑框架

东莞GEO优化服务商怎么选:一份讲实话的深度测评与筛选框架这两年“GEO优化”这个词在东莞的老板圈子里越来越火,尤其是做外贸、做本地生活服务、做B2B工业品的朋友,几乎都被客户问过一句:“你们公司在AI里怎么搜不到?”…

2026/9/24 20:49:59 阅读更多 →
AI Agent + Tabular Editor:让大模型直接操作Power BI模型的实战指南

AI Agent + Tabular Editor:让大模型直接操作Power BI模型的实战指南

做Power BI模型开发的朋友,对Tabular Editor这个名字应该不陌生。最近半年我把这个工具和AI Agent组合到一起,摸索了一套“让大模型直接动手改Power BI模型”的开发工作流,今天把整套思路和踩坑记录完整聊一遍。无论你是刚开始接触Power BI建…

2026/9/24 20:49:59 阅读更多 →
本地AI出图环境搭建指南:从硬件选型到ComfyUI进阶

本地AI出图环境搭建指南:从硬件选型到ComfyUI进阶

先交代一个背景:我最早用AI出图也走的是在线平台路线,图省事,注册完就能生成。但用了不到一个月就受不了了——排队、限次数、风格千篇一律,最要命的是想微调一张图里的手部细节,在线工具根本没有容我折腾的空间。后来…

2026/9/24 20:49:59 阅读更多 →
AI工程全景地图:六步构建从数据到价值的落地路径

AI工程全景地图:六步构建从数据到价值的落地路径

1. 为什么突然都在说 AI 工程这几年“AI 工程”这个词出现频率越来越高,但你要是真去问一句“AI 工程到底是什么”,能一句话说清楚的人其实不多。我见过不少团队,模型训练得挺溜,一到上线就翻车,不是推理延迟压不下来&…

2026/9/24 20:48:59 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →