
欢迎来到官方的Scrapeless模型上下文协议(MCP)服务器——这是一个强大的集成层,使LLMs、AI代理和AI应用程序能够实时与网络互动。
基于开放的MCP标准,Scrapeless MCP服务器无缝连接了诸如ChatGPT、Claude等模型以及Cursor和Windsurf等工具,使其能够访问广泛的外部功能,包括:
无论您是在构建AI研究助手、编码副驾还是自主网络代理,此服务器都能提供您的工作流程所需的动态上下文和现实世界数据——不会被阻止。
使用Scrapeless MCP浏览器,Claude可以通过对话命令执行复杂的任务,如网页导航、点击、滚动和抓取,并通过实时会话实时预览网页交互结果。

使用Scrapeless MCP浏览器服务,自动访问Cloudflare页面,在过程完成后,提取并返回页面内容为Markdown格式。

使用Scrapeless MCP通用API,抓取上述目标页面的JavaScript渲染内容,导出为Markdown格式,并最终写入名为**text.md**的本地文件。

使用Scrapeless MCP服务器,在Google搜索中查询关键词“web scraping”,检索前10个搜索结果(包括标题、链接和摘要),并将内容写入名为serp.text的文件。

这里有一些额外的使用这些服务器的例子:
| 示例 |
|---|
| 在Google搜索中搜索scrapeless。 |
| 查找过去一年内“AI”的搜索兴趣。 |
| 使用浏览器访问chatgpt.com,搜索“今天的天气怎么样?”并总结结果。 |
| 抓取scrapeless.com页面的HTML内容。 |
| 抓取scrapeless.com页面的Markdown内容。 |
| 获取scrapeless.com的截图。 |

Scrapeless MCP服务器支持Stdio和可流式传输HTTP两种传输模式。
🖥️ Stdio(本地执行)
{
"mcpServers": {
"Scrapeless MCP Server": {
"command": "npx",
"args": ["-y", "scrapeless-mcp-server"],
"env": {
"SCRAPELESS_KEY": "YOUR_SCRAPELESS_KEY"
}
}
}
}
🌐 可流式传输HTTP(托管API模式)
{
"mcpServers": {
"Scrapeless MCP Server": {
"type": "streamable-http",
"url": "https://api.scrapeless.com/mcp",
"headers": {
"x-api-token": "YOUR_SCRAPELESS_KEY"
},
"disabled": false,
"alwaysAllow": []
}
}
}
使用可选参数自定义浏览器会话行为。这些可以通过环境变量(对于Stdio)或HTTP头(对于可流式传输HTTP)设置:
| Stdio(环境变量) | 可流式传输HTTP(HTTP头) | 描述 |
|---|---|---|
| BROWSER_PROFILE_ID | x-browser-profile-id | 指定一个可重用的浏览器配置文件ID以维持会话连续性。 |
| BROWSER_PROFILE_PERSIST | x-browser-profile-persist | 启用持久存储cookies、本地存储等。 |
| BROWSER_SESSION_TTL | x-browser-session-ttl | 定义最大会话超时时间(秒)。在该时间段内无活动后,会话将自动过期。 |
设置 → 工具 → MCP服务器Stdio或可流式传输HTTP配置Cmd + Shift + P并搜索:配置MCP服务器"在StackOverflow上搜索解决这个错误的方法""从这个页面抓取HTML"| 名称 | 描述 |
|---|---|
| google_search | 通用信息搜索引擎。 |
| google_trends | 从Google Trends获取热门搜索数据。 |
| browser_create | 使用Scrapeless创建或复用云浏览器会话。 |
| browser_close | 断开云浏览器连接以关闭当前会话。 |
| browser_goto | 将浏览器导航到指定URL。 |
| browser_go_back | 在浏览器历史中后退一步。 |
| browser_go_forward | 在浏览器历史中前进一步。 |
| browser_click | 点击页面上的特定元素。 |
| browser_type | 在指定输入字段中键入文本。 |
| browser_press_key | 模拟按键。 |
| browser_wait_for | 等待特定页面元素出现。 |
| browser_wait | 暂停执行固定时长。 |
| browser_screenshot | 捕获当前页面的截图。 |
| browser_get_html | 获取当前页面的完整HTML。 |
| browser_get_text | 获取当前页面的所有可见文本。 |
| browser_scroll | 滚动到页面底部。 |
| browser_scroll_to | 滚动特定元素进入视图。 |
| scrape_html | 抓取URL并返回其完整HTML内容。 |
| scrape_markdown | 抓取URL并将其内容作为Markdown返回。 |
| scrape_screenshot | 捕获任何网页的高质量截图。 |
当使用Scrapeless MCP服务器与LLMs(如ChatGPT、Claude或Cursor)一起使用时,处理所有抓取或提取的网络内容时必须小心。默认情况下,网络数据是不可信的,不当处理可能会使您的应用暴露于提示注入或其他安全漏洞。
scrape_html、scrape_markdown或具有已知安全选择器的目标browser_get_text工具来仅提取您信任的内容。如有疑问、建议或合作咨询,请随时通过以下方式联系我们: