一个以隐私优先、独立运行为主的MCP服务器,提供使用本地浏览器自动化和您自己的LLM API密钥进行网页抓取和数据提取工具。无需外部依赖或API密钥
scrape_page - 从单个网页中提取内容url, onlyMainContentbatch_scrape - 在一次请求中抓取多个URLurls[], onlyMainContentextract_data - 使用LLM提取结构化数据urls[], prompt, enableWebSearchextract_with_schema - 使用JSON模式提取数据urls[], schema, prompt, enableWebSearchscreenshot - 对网页截图url, width, height, fullPage添加到~/Library/Application Support/Claude/claude_desktop_config.json:
{
"mcpServers": {
"firecrawl-lite": {
"command": "npx",
"args": ["-y", "@ariangibson/firecrawl-lite-mcp-server"],
"env": {
"LLM_API_KEY": "your_llm_api_key_here",
"LLM_PROVIDER_BASE_URL": "https://api.x.ai/v1",
"LLM_MODEL": "grok-code-fast-1"
}
}
}
}
claude mcp add firecrawl-lite npx -- -y @ariangibson/firecrawl-lite-mcp-server --env LLM_API_KEY=your_key --env L
LM_PROVIDER_BASE_URL=https://api.x.ai/v1 --env LLM_MODEL=grok-code-fast-1
添加到您的Cursor MCP配置:
{
"mcpServers": {
"firecrawl-lite": {
"command": "npx",
"args": ["-y", "@ariangibson/firecrawl-lite-mcp-server"],
"env": {
"LLM_API_KEY": "your_llm_api_key_here",
"LLM_PROVIDER_BASE_URL": "https://api.x.ai/v1",
"LLM_MODEL": "grok-code-fast-1"
}
}
}
}
# 您的LLM API密钥(xAI、OpenAI、Anthropic等)
LLM_API_KEY=your_api_key_here
# LLM提供商基础URL
LLM_PROVIDER_BASE_URL=https://api.x.ai/v1
# LLM模型名称
LLM_MODEL=grok-code-fast-1
# xAI (Grok)
LLM_PROVIDER_BASE_URL=https://api.x.ai/v1
LLM_API_KEY=xai-your-key-here
LLM_MODEL=grok-code-fast-1
# OpenAI
LLM_PROVIDER_BASE_URL=https://api.openai.com/v1
LLM_API_KEY=sk-your-key-here
LLM_MODEL=gpt-4o-mini
# Anthropic
LLM_PROVIDER_BASE_URL=https://api.anthropic.com
LLM_API_KEY=sk-ant-your-key-here
LLM_MODEL=claude-3-haiku-20240307
# 本地LLM (Ollama)
LLM_PROVIDER_BASE_URL=http://localhost:11434/v1
LLM_API_KEY=your-local-key
LLM_MODEL=llama2
对于远程服务器或Docker部署,请确保至少启用一个HTTP端点(取决于您计划使用的传输协议)- 默认情况下这些端点未启用:
docker run -d \
-p 3000:3000 \
-e ENABLE_HTTP_STREAMABLE_ENDPOINT=true \
-e ENABLE_SSE_ENDPOINT=true \
-e LLM_API_KEY=your_key_here \
-e LLM_PROVIDER_BASE_URL=https://api.x.ai/v1 \
-e LLM_MODEL=grok-code-fast-1 \
ariangibson/firecrawl-lite-mcp-server:latest
claude mcp add firecrawl-lite-remote http://your-server:3000/mcp -t http
方法1:连接器(推荐 - 只支持HTTPS) 官方Claude Desktop方法用于远程MCP服务器:
https://your-server.com:3000/mcp方法2:mcp-proxy(HTTP/HTTPS备用方案) 对于没有SSL证书的服务器:
pip install mcp-proxy
添加到claude_desktop_config.json:
{
"mcpServers": {
"firecrawl-lite": {
"command": "mcp-proxy",
"args": ["http://your-server:3000/sse"]
}
}
}
PROXY_SERVER_URL=http://your-proxy-server.com:1337
PROXY_SERVER_USERNAME=your-username
PROXY_SERVER_PASSWORD=your-password
SCRAPE_USER_AGENT="Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/113.0.0.0 Safari/537.3"
SCRAPE_DELAY_MIN=1000
SCRAPE_DELAY_MAX=3000
SCRAPE_VIEWPORT_WIDTH=1920
SCRAPE_VIEWPORT_HEIGHT=1080
SCRAPE_BATCH_DELAY_MIN=2000
SCRAPE_BATCH_DELAY_MAX=5000
Chrome会在首次使用时自动安装。如果遇到问题:
# 手动安装
npx puppeteer browsers install chrome
# 如果损坏则重置
rm -rf ~/.cache/puppeteer && npx puppeteer browsers install chrome
{
"name": "scrape_page",
"arguments": {
"url": "https://example.com"
}
}
{
"name": "batch_scrape",
"arguments": {
"urls": ["https://example.com", "https://example.org"],
"onlyMainContent": true
}
}
{
"name": "extract_data",
"arguments": {
"urls": ["https://example.com"],
"prompt": "提取主要文章标题和摘要"
}
}
{
"name": "extract_with_schema",
"arguments": {
"urls": ["https://example.com"],
"schema": {
"type": "object",
"properties": {
"title": {"type": "string"},
"description": {"type": "string"}
}
}
}
}
预构建镜像可用:
Docker Hub:ariangibson/firecrawl-lite-mcp-server:latest
GitHub Container Registry:ghcr.io/ariangibson/firecrawl-lite-mcp-server:latest
两者都支持多架构(amd64,arm64),并自动更新。
该项目灵感来源于原始Firecrawl项目的杰出工作:
由Mendable.ai创建的原始Firecrawl项目 - 一个具有先进功能的综合网页抓取平台。
由Firecrawl团队实施的官方MCP服务器。
我们对Firecrawl团队在网页抓取和MCP集成方面的开创性工作表示极大的感谢! 🚀
💡 寻找企业级网页抓取?
访问**firecrawl.com**了解其零设置复杂性的云端服务。
MIT许可证 - 详情见LICENSE。