返回市场
爬取4AI-MCP

爬取4AI-MCP

作者:ritvij1426 星标更新:2025-04-14

项目介绍

Crawl4AI MCP Server

这是一个集成Crawl4AI与Cursor AI的Model Context Protocol (MCP)服务器实现,提供网络爬取和抓取功能作为Cursor Composer代理模式下LLMs的工具。

系统需求

需要安装Python 3.10或更高版本。

当前功能

  • 单页面抓取
  • 网站爬取

安装

基本设置说明也可在MCP服务器快速入门官方文档中找到。

设置环境

首先,让我们安装uv并设置我们的Python项目和环境:

MacOS/Linux:

curl -LsSf https://astral.sh/uv/install.sh | sh

Windows:

powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"

确保之后重启终端以确保uv命令被识别。

接下来:

  1. 克隆仓库

  2. 使用UV安装依赖项:

# 导航到crawl4ai-mcp目录
cd crawl4ai-mcp

# 安装依赖(仅首次安装)
uv venv
uv sync

# 激活虚拟环境
source .venv/bin/activate

# 运行服务器
python main.py
  1. 添加到Cursor的MCP服务器或Claude的MCP服务器

您可能需要在命令字段中填写uv可执行文件的完整路径。您可以通过在MacOS/Linux上运行which uv或在Windows上运行where uv来获取此路径。

{
  "mcpServers": {
    "Crawl4AI": {
      "command": "uv",
      "args": [
        "--directory",
        "/ABSOLUTE/PATH/TO/PARENT/FOLDER/crawl4ai-mcp",
        "run",
        "main.py"
      ]
    }
  }
}

提供的工具

此MCP服务器向LLM暴露以下工具:

  1. scrape_webpage(url: str)

    • 描述: 使用Crawl4AI从单个网页抓取内容和元数据。
    • 参数:
      • url (字符串,必需):要抓取的网页的URL。
    • 返回值: 包含一个带有抓取内容(主要是markdown)的TextContent对象的JSON列表。
  2. crawl_website(url: str, crawl_depth: int = 1, max_pages: int = 5)

    • 描述: 使用Crawl4AI从给定的URL开始爬取网站,直到指定的深度和页面限制。
    • 参数:
      • url (字符串,必需):要开始爬取的起始URL。
      • crawl_depth (整数,可选,默认值:1):相对于起始URL的最大爬取深度。
      • max_pages (整数,可选,默认值:5):在爬取过程中要抓取的最大页面数。
    • 返回值: 包含一个带有爬取页面结果(包括URL、成功状态、markdown内容或错误)的JSON数组的TextContent对象的列表。