返回市场
MCP文档抓取器

MCP文档抓取器

作者:askjohngeorge8 星标更新:2025-05-04

项目介绍

MseeP.ai 安全评估徽章

Doc Scraper MCP 服务器

smithery 徽章

这是一个提供文档抓取功能的模型上下文协议(MCP)服务器。该服务器使用 jina.ai 的转换服务将基于网络的文档转换为 Markdown 格式。

功能

  • 从任何网络 URL 抓取文档
  • 将 HTML 文档转换为 Markdown 格式
  • 将转换后的文档保存到指定的输出路径
  • 集成到模型上下文协议(MCP)

安装

通过 Smithery 安装

要通过 Smithery 自动安装 Doc Scraper for Claude Desktop:

npx -y @smithery/cli install @askjohngeorge/mcp-doc-scraper --client claude
  1. 克隆仓库:
git clone https://github.com/askjohngeorge/mcp-doc-scraper.git
cd mcp-doc-scraper
  1. 创建并激活虚拟环境:
python -m venv venv
source venv/bin/activate  # 在 Windows 上使用:venv\Scripts\activate
  1. 安装依赖项:
pip install -e .

使用方法

可以使用 Python 运行服务器:

python -m mcp_doc_scraper

工具描述

服务器提供了一个工具:

  • 名称scrape_docs
  • 描述:从 URL 抓取文档并保存为 Markdown
  • 输入参数
    • url:要抓取的文档的 URL
    • output_path:Markdown 文件应保存的路径

项目结构

doc_scraper/
├── __init__.py
├── __main__.py
└── server.py

依赖项

  • aiohttp
  • mcp
  • pydantic

开发

要设置开发环境:

  1. 安装开发依赖项:
pip install -r requirements.txt
  1. 服务器使用模型上下文协议。请确保熟悉 MCP 文档

许可证

MIT 许可证