返回市场
技能寻找者

技能寻找者

作者:yusufkaraaslan4430 星标更新:2025-11-13

项目介绍

【技术文档摘要】

MseeP.ai 安全评估徽章

技能搜索者

版本 许可证: MIT Python 3.10+ MCP 集成 测试 项目板 PyPI 版本 PyPI - 下载量 PyPI - Python 版本

自动将文档网站、GitHub 仓库和 PDF 转换为 Claude AI 技能在几分钟内。

📋 查看开发路线图及任务 - 涵盖 10 类别的 134 项任务,选择任何一项来贡献!

什么是技能搜索者?

技能搜索者是一款自动化工具,它将文档网站、GitHub 仓库和 PDF 文件转换为生产就绪的 Claude AI 技能。无需手动阅读和总结文档,技能搜索者:

  1. 抓取多个来源(文档、GitHub 仓库、PDF)自动进行
  2. 分析代码仓库,使用深度 AST 解析
  3. 检测文档与代码实现之间的冲突
  4. 组织内容到分类参考文件中
  5. 增强使用 AI 提取最佳示例和关键概念
  6. 打包所有内容到一个可上传的 .zip 文件中,供 Claude 使用

结果: 在 20-40 分钟内获得任何框架、API 或工具的全面 Claude 技能,而不是数小时的手动工作。

为什么使用这个?

  • 🎯 对于开发者:从文档 + GitHub 仓库创建技能,并检测冲突
  • 🎮 对于游戏开发者:为游戏引擎生成技能(Godot 文档 + GitHub、Unity 等)
  • 🔧 对于团队:结合内部文档 + 代码仓库为单一事实来源
  • 📚 对于学习者:从文档、代码示例和 PDF 构建全面技能
  • 🔍 对于开源项目:分析仓库以查找文档缺口和过时示例

关键特性

🌐 文档抓取

  • 支持 llms.txt - 自动检测并使用 LLM 就绪文档文件(速度快 10 倍)
  • 通用抓取器 - 适用于任何文档网站
  • 智能分类 - 自动按主题组织内容
  • 代码语言检测 - 识别 Python、JavaScript、C++、GDScript 等
  • 8 个现成预设 - Godot、React、Vue、Django、FastAPI 等

📄 PDF 支持(v1.2.0

  • 基本 PDF 提取 - 提取文本、代码和图像
  • 扫描 PDF 的 OCR - 提取扫描文档中的文本
  • 加密 PDF - 处理加密 PDF
  • 表格提取 - 提取复杂的表格
  • 并行处理 - 对大型 PDF 快 3 倍
  • 智能缓存 - 再次运行时快 50%

🐙 GitHub 仓库抓取(v2.0.0

  • 深度代码分析 - 对 Python、JavaScript、TypeScript、Java、C++、Go 进行 AST 解析
  • API 提取 - 函数、类、方法及其参数和类型
  • 仓库元数据 - README、文件树、语言分布、星标/分支
  • GitHub 问题与 PR - 获取带有标签和里程碑的开放/关闭问题
  • 变更日志与发布 - 自动提取版本历史
  • 冲突检测 - 比较文档化 API 与实际代码实现
  • MCP 集成 - 自然语言:"抓取 GitHub 仓库 facebook/react"

🔄 统一多源抓取(新 - v2.0.0

  • 组合多个来源 - 混合文档 + GitHub + PDF 到一个技能中
  • 冲突检测 - 自动发现文档与代码之间的差异
  • 智能合并 - 规则或 AI 动力冲突解决
  • 透明报告 - 并排比较,带 ⚠️ 警告
  • 文档缺口分析 - 识别过时文档和未记录功能
  • 单一事实来源 - 显示意图(文档)和现实(代码)的技能
  • 向后兼容 - 旧的单源配置仍然有效

🤖 AI & 增强

  • AI 动力增强 - 将基础模板转化为全面指南
  • 无 API 成本 - 使用 Claude Code Max 免费本地增强
  • MCP 服务器用于 Claude Code - 直接从 Claude Code 使用自然语言

⚡ 性能 & 扩展性

  • 异步模式 - 使用 async/await 加速 2-3 倍(使用 --async 标志)
  • 大型文档支持 - 处理 10K-40K+ 页面文档,智能分割
  • 路由器/集线器技能 - 智能路由到专业子技能
  • 并行抓取 - 同时处理多个技能
  • 检查点/恢复 - 长时间抓取永不丢失进度
  • 缓存系统 - 抓取一次,即时重建

✅ 质量保证

  • 完全测试 - 包含 379 项测试

📦 现已发布在 PyPI!

Skill Seekers 已经发布在 Python 包索引! 通过一条命令安装:

pip install skill-seekers

立即开始。无需克隆,无需设置 - 只需安装并运行。查看下面的安装选项。


快速入门

方法 1:从 PyPI 安装(推荐)

# 从 PyPI 安装(最简单的方法!)
pip install skill-seekers

# 使用统一 CLI
skill-seekers scrape --config configs/react.json
skill-seekers github --repo facebook/react
skill-seekers enhance output/react/
skill-seekers package output/react/

时间: ~25 分钟 | 质量: 生产就绪 | 成本: 免费

📖 新手? 查看我们的 快速入门指南无错误快速入门指南

方法 2:通过 uv 安装(现代 Python 工具)

# 使用 uv 安装(快速、现代替代方案)
uv tool install skill-seekers

# 或不安装直接运行
uv tool run --from skill-seekers skill-seekers scrape --config https://raw.githubusercontent.com/yusufkaraaslan/Skill_Seekers/main/configs/react.json

# 统一 CLI - 简单命令
skill-seekers scrape --config configs/react.json
skill-seekers github --repo facebook/react
skill-seekers package output/react/

时间: ~25 分钟 | 质量: 生产就绪 | 成本: 免费

方法 3:开发安装(从源码)

# 克隆并以编辑模式安装
git clone https://github.com/yusufkaraaslan/Skill_Seekers.git
cd Skill_Seekers
pip install -e .

# 使用统一 CLI
skill-seekers scrape --config configs/react.json

方法 4:从 Claude Code 使用(MCP 集成)

# 一次性设置(5 分钟)
./setup_mcp.sh

# 然后在 Claude Code 中,只需询问:
"从 https://react.dev/ 生成 React 技能"
"抓取 PDF 文档/manual.pdf 并创建技能"

时间: 自动 | 质量: 生产就绪 | 成本: 免费

方法 5:旧版 CLI(向后兼容)

# 安装依赖
pip3 install requests beautifulsoup4

# 直接运行脚本(旧方法)
python3 src/skill_seekers/cli/doc_scraper.py --config configs/react.json

# 将 output/react.zip 上传到 Claude - 完成!

时间: ~25 分钟 | 质量: 生产就绪 | **成本: 免费

使用示例

文档抓取

# 抓取文档网站
skill-seekers scrape --config configs/react.json

# 快速抓取无需配置
skill-seekers scrape --url https://react.dev --name react

# 使用异步模式(快 3 倍)
skill-seekers scrape --config configs/godot.json --async --workers 8

PDF 提取

# 基本 PDF 提取
skill-seekers pdf --pdf docs/manual.pdf --name myskill

# 高级功能
skill-seekers pdf --pdf docs/manual.pdf --name myskill \
    --extract-tables \        # 提取表格
    --parallel \              # 快速并行处理
    --workers 8               # 使用 8 个 CPU 内核

# 扫描 PDF(需要:pip install pytesseract Pillow)
skill-seekers pdf --pdf docs/scanned.pdf --name myskill --ocr

# 加密 PDF
skill-seekers pdf --pdf docs/encrypted.pdf --name myskill --password mypassword

时间: ~5-15 分钟(或并行处理 2-5 分钟)| 质量: 生产就绪 | 成本: 免费

GitHub 仓库抓取

# 基本仓库抓取
skill-seekers github --repo facebook/react

# 使用配置文件
skill-seekers github --config configs/react_github.json

# 使用身份验证(更高的速率限制)
export GITHUB_TOKEN=ghp_your_token_here
skill-seekers github --repo facebook/react

# 自定义要包含的内容
skill-seekers github --repo django/django \
    --include-issues \        # 提取 GitHub 问题
    --max-issues 100 \        # 限制问题数量
    --include-changelog \     # 提取 CHANGELOG.md
    --include-releases        # 提取 GitHub 发布

时间: ~5-10 分钟 | 质量: 生产就绪 | 成本: 免费

统一多源抓取(新 - v2.0.0

问题: 文档和代码经常脱节。文档可能过时,缺少代码中存在的功能,或者记录了已被删除的功能。

解决方案: 将文档 + GitHub + PDF 组合成一个统一的技能,显示两者,并明确警告差异。

# 使用现有的统一配置
skill-seekers unified --config configs/react_unified.json
skill-seekers unified --config configs/django_unified.json

# 或创建统一配置(混合文档 + GitHub)
cat > configs/myframework_unified.json << 'EOF'
{
  "name": "myframework",
  "description": "来自文档 + 代码的完整框架知识",
  "merge_mode": "rule-based",
  "sources": [
    {
      "type": "documentation",
      "base_url": "https://docs.myframework.com/",
      "extract_api": true,
      "max_pages": 200
    },
    {
      "type": "github",
      "repo": "owner/myframework",
      "include_code": true,
      "code_analysis_depth": "surface"
    }
  ]
}
EOF

# 运行统一抓取器
skill-seekers unified --config configs/myframework_unified.json

# 打包并上传
skill-seekers package output/myframework/
# 将 output/myframework.zip 上传到 Claude - 完成!

时间: ~30-45 分钟 | 质量: 生产就绪,带冲突检测 | 成本: 免费

特别之处:

冲突检测 - 自动发现 4 种类型的差异:

  • 🔴 代码中缺失(高):已记录但未实现
  • 🟡 文档中缺失(中):已实现但未记录
  • ⚠️ 签名不匹配:不同的参数/类型
  • ℹ️ 描述不匹配:不同的解释

透明报告 - 显示两个版本并排:

#### `move_local_x(delta: float)`

⚠️ **冲突**:文档签名与实现不同

**文档说:**

def move_local_x(delta: float)


**代码实现:**
```python
def move_local_x(delta: float, snap: bool = False) -> None

✅ **优势:**
- **识别文档缺口** - 自动找到过时或缺失的文档
- **捕捉代码更改** - 知道 API 更改而文档未更新时
- **单一事实来源** - 显示意图(文档)和现实(代码)的技能
- **可操作见解** - 获取解决每个冲突的建议
- **开发辅助** - 查看代码库中实际存在的内容与文档

**示例统一配置:**
- `configs/react_unified.json` - React 文档 + GitHub 仓库
- `configs/django_unified.json` - Django 文档 + GitHub 仓库
- `configs/fastapi_unified.json` - FastAPI 文档 + GitHub 仓库

**完整指南:** 查看 [docs/UNIFIED_SCRAPING.md](docs/UNIFIED_SCRAPING.md) 以获取完整文档。

## 如何工作

```mermaid
graph LR
    A[文档网站] --> B[技能搜索者]
    B --> C[抓取器]
    B --> D[AI 增强]
    B --> E[打包器]
    C --> F[组织好的参考资料]
    D --> F
    F --> E
    E --> G[Claude 技能 .zip]
    G --> H[上传到 Claude AI]
  1. 检测 llms.txt - 首先检查 llms-full.txt、llms.txt、llms-small.txt
  2. 抓取:从文档中提取所有页面
  3. 分类:按主题(API、指南、教程等)组织内容
  4. 增强:AI 分析文档并创建包含示例的综合 SKILL.md
  5. 打包:将所有内容打包到一个 Claude 就绪的 .zip 文件中

📋 先决条件

开始前,请确保您有:

  1. Python 3.10 或更高版本 - 下载 | 检查:python3 --version
  2. Git - 下载 | 检查:git --version
  3. 首次设置 15-30 分钟

第一次用户?从此处开始:无错误快速入门指南 🎯

此指南逐步引导您完成一切(Python 安装、git 克隆、第一个技能创建)。


🚀 快速入门

方法 1:Claude Code 的 MCP 服务器(最简单)

直接从 Claude Code 使用自然语言!

# 克隆仓库
git clone https://github.com/yusufkaraaslan/Skill_Seekers.git
cd Skill_Seekers

# 一次性设置(5 分钟)
./setup_mcp.sh

# 重启 Claude Code,然后只需询问:

在 Claude Code 中:

列出所有可用配置
为 Tailwind 在 https://tailwindcss.com/docs 生成配置
使用 configs/react.json 抓取文档
打包位于 output/react/ 的技能

优点:

  • ✅ 无需手动 CLI 命令
  • ✅ 自然语言界面
  • ✅ 与您的工作流程集成
  • ✅ 即时可用的 9 个工具(包括自动上传!)
  • 经过测试且在生产中运行

完整指南: