返回市场
无爬取-mcp服务器

无爬取-mcp服务器

作者:scrapeless-ai58 星标更新:2025-09-23

项目介绍

预览

Scrapeless MCP Server

欢迎来到官方的Scrapeless模型上下文协议(MCP)服务器——这是一个强大的集成层,使LLMs、AI代理和AI应用程序能够实时与网络互动。

基于开放的MCP标准,Scrapeless MCP服务器无缝连接了诸如ChatGPTClaude等模型以及CursorWindsurf等工具,使其能够访问广泛的外部功能,包括:

  • Google服务集成(搜索、趋势)
  • 浏览器自动化用于页面级别的导航和交互
  • 抓取动态、JS密集型网站——导出为HTML、Markdown或截图

无论您是在构建AI研究助手、编码副驾还是自主网络代理,此服务器都能提供您的工作流程所需的动态上下文和现实世界数据——不会被阻止

使用示例

  1. 使用Claude进行自动网页交互和数据提取

使用Scrapeless MCP浏览器,Claude可以通过对话命令执行复杂的任务,如网页导航、点击、滚动和抓取,并通过实时会话实时预览网页交互结果。

预览

  1. 绕过Cloudflare以获取目标页面内容

使用Scrapeless MCP浏览器服务,自动访问Cloudflare页面,在过程完成后,提取并返回页面内容为Markdown格式。

预览

  1. 抓取动态渲染的页面内容并写入文件

使用Scrapeless MCP通用API,抓取上述目标页面的JavaScript渲染内容,导出为Markdown格式,并最终写入名为**text.md**的本地文件。

预览

  1. 自动SERP抓取

使用Scrapeless MCP服务器,在Google搜索中查询关键词“web scraping”,检索前10个搜索结果(包括标题、链接和摘要),并将内容写入名为serp.text的文件。

预览

这里有一些额外的使用这些服务器的例子:

示例
在Google搜索中搜索scrapeless。
查找过去一年内“AI”的搜索兴趣。
使用浏览器访问chatgpt.com,搜索“今天的天气怎么样?”并总结结果。
抓取scrapeless.com页面的HTML内容。
抓取scrapeless.com页面的Markdown内容。
获取scrapeless.com的截图。

设置指南

  1. 获取Scrapeless密钥
  • 登录到Scrapeless仪表板(提供免费试用)
  • 然后点击左侧的“设置”->选择“API密钥管理”->点击“创建API密钥”。最后,点击您创建的API密钥以复制它。

预览

  1. 配置您的MCP客户端

Scrapeless MCP服务器支持Stdio可流式传输HTTP两种传输模式。

🖥️ Stdio(本地执行)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "command": "npx",
      "args": ["-y", "scrapeless-mcp-server"],
      "env": {
        "SCRAPELESS_KEY": "YOUR_SCRAPELESS_KEY"
      }
    }
  }
}

🌐 可流式传输HTTP(托管API模式)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "type": "streamable-http",
      "url": "https://api.scrapeless.com/mcp",
      "headers": {
        "x-api-token": "YOUR_SCRAPELESS_KEY"
      },
      "disabled": false,
      "alwaysAllow": []
    }
  }
}

高级选项

使用可选参数自定义浏览器会话行为。这些可以通过环境变量(对于Stdio)或HTTP头(对于可流式传输HTTP)设置:

Stdio(环境变量)可流式传输HTTP(HTTP头)描述
BROWSER_PROFILE_IDx-browser-profile-id指定一个可重用的浏览器配置文件ID以维持会话连续性。
BROWSER_PROFILE_PERSISTx-browser-profile-persist启用持久存储cookies、本地存储等。
BROWSER_SESSION_TTLx-browser-session-ttl定义最大会话超时时间(秒)。在该时间段内无活动后,会话将自动过期。

与Claude Desktop的集成

  1. 打开Claude Desktop
  2. 导航至:设置工具MCP服务器
  3. 点击**“添加MCP服务器”**
  4. 粘贴上面的Stdio可流式传输HTTP配置
  5. 保存并启用服务器
  6. Claude现在可以发出网络查询、提取内容并使用Scrapeless与页面互动。

与Cursor IDE的集成

  1. 打开Cursor
  2. 按下Cmd + Shift + P并搜索:配置MCP服务器
  3. 使用上述格式添加Scrapeless MCP配置
  4. 保存文件并重启Cursor(如有必要)
  5. 现在您可以向Cursor询问如下问题:
    1. "在StackOverflow上搜索解决这个错误的方法"
    2. "从这个页面抓取HTML"
  6. 它将在后台使用Scrapeless。

支持的MCP工具

名称描述
google_search通用信息搜索引擎。
google_trends从Google Trends获取热门搜索数据。
browser_create使用Scrapeless创建或复用云浏览器会话。
browser_close断开云浏览器连接以关闭当前会话。
browser_goto将浏览器导航到指定URL。
browser_go_back在浏览器历史中后退一步。
browser_go_forward在浏览器历史中前进一步。
browser_click点击页面上的特定元素。
browser_type在指定输入字段中键入文本。
browser_press_key模拟按键。
browser_wait_for等待特定页面元素出现。
browser_wait暂停执行固定时长。
browser_screenshot捕获当前页面的截图。
browser_get_html获取当前页面的完整HTML。
browser_get_text获取当前页面的所有可见文本。
browser_scroll滚动到页面底部。
browser_scroll_to滚动特定元素进入视图。
scrape_html抓取URL并返回其完整HTML内容。
scrape_markdown抓取URL并将其内容作为Markdown返回。
scrape_screenshot捕获任何网页的高质量截图。

安全最佳实践

当使用Scrapeless MCP服务器与LLMs(如ChatGPT、Claude或Cursor)一起使用时,处理所有抓取或提取的网络内容时必须小心。默认情况下,网络数据是不可信的,不当处理可能会使您的应用暴露于提示注入或其他安全漏洞。

✅ 推荐做法

  • 永远不要直接将原始抓取的内容传递给LLM提示。 原始HTML、JavaScript或用户生成的文本可能包含隐藏的注入载荷。
  • 对所有提取的内容进行清理和验证。 在使用内容进行下游逻辑或AI模型之前,剥离或转义潜在有害的标签和脚本。
  • 优先使用结构化提取而不是自由形式文本。 使用scrape_htmlscrape_markdown或具有已知安全选择器的目标browser_get_text工具来仅提取您信任的内容。
  • 在抓取动态生成的页面时应用域名或选择器白名单,以限制数据流向已知和可信的来源。
  • 记录和监控所有通过浏览器或抓取工具发出的外向请求,特别是如果您正在处理敏感数据、令牌或内部网络访问。

🚫 避免

  • 直接将抓取的HTML注入提示中
  • 让用户指定任意URL或CSS选择器而不进行验证
  • 存储未过滤的抓取内容以供未来提示使用

社区

联系我们

如有疑问、建议或合作咨询,请随时通过以下方式联系我们: