返回市场
爬取4AI-MCP

爬取4AI-MCP

作者:Ichigo37662 星标更新:2025-03-28

项目介绍

Crawl4ai MCP Server

这是一个使用crawl4ai提供网络爬取功能的MCP服务器,并以Markdown格式输出给LLM。

安装

预备条件

设置

  1. 克隆仓库:
git clone https://github.com/Ichigo3766/crawl4ai-mcp.git
cd crawl4ai-server
  1. 安装依赖:
npm install
  1. 构建服务器:
npm run build
  1. 将服务器配置添加到您的环境中:
{
  "mcpServers": {
    "crawl4ai": {
      "command": "node",
      "args": [
        "/path/to/crawl4ai-server/build/index.js"
      ],
      "env": {
        "CRAWL4AI_API_URL": "http://127.0.0.1:11235",
        "CRAWL4AI_AUTH_TOKEN": "your-auth-token"           // 可选:如果需要认证
      }
    }
  }
}

替换环境变量为您自己的值:

  • CRAWL4AI_API_URL:crawl4ai API服务的URL(可选)
  • CRAWL4AI_AUTH_TOKEN:API的认证令牌(可选)

功能

工具

  • crawl_urls - 爬取网页并获取带有引用的Markdown内容
    • 参数:
      • urls(必需):要爬取的URL列表

响应格式

工具返回每个URL的带有引用的Markdown内容。多个URL之间用水平线(---)分隔。示例:

这是来自第一个URL的内容 [^1]

[^1]: https://example.com

---

这是来自第二个URL的内容 [^2]

[^2]: https://example.org

开发

为了开发时自动重建:

npm run watch

错误处理

常见问题及解决方案:

  1. 确保URL有效且可访问
  2. 如果使用认证,请确保令牌有效
  3. 检查到crawl4ai API服务的网络连接
  4. 对于超时错误,尝试减少每次请求中的URL数量
  5. 如果被网站阻止,服务会自动重试并使用不同的用户代理

许可证

此MCP服务器采用MIT许可证。这意味着您可以自由地使用、修改和分发该软件,但需遵守MIT许可证的条款和条件。更多详情,请参见项目仓库中的LICENSE文件。