一个强大的工具,利用Cursor AI和MCP(模型上下文协议)轻松生成适用于各种类型网站的网络爬虫。该项目帮助您快速分析网站并以最小的努力生成适当的Scrapy或Camoufox爬虫。
本项目包含两个主要组件:
将此仓库克隆到您的本地机器:
git clone https://github.com/TheWebScrapingClub/AI-Cursor-Scraping-Assistant.git
cd AI-Cursor-Scraping-Assistant
安装所需的依赖项:
pip install mcp camoufox scrapy
如果您计划使用Camoufox,您需要获取其浏览器二进制文件:
python -m camoufox fetch
MCP服务器提供了一些工具,帮助Cursor AI分析网页并生成XPath选择器。启动MCP服务器:
导航至MCPfiles目录:
cd MCPfiles
更新xpath_server.py中的CAMOUFOX_FILE_PATH,使其指向您的本地Camoufox_template.py文件。
启动MCP服务器:
python xpath_server.py
在Cursor中,通过设置或使用MCP面板连接到MCP服务器。
cursor-rules目录包含规则,这些规则教授Cursor AI如何分析网站并创建不同类型的爬虫。当您在Cursor中打开项目时,这些规则会自动加载。
cursor-rules目录包含一组MDC(Markdown配置)文件,指导Cursor在创建网络爬虫时的行为:
prerequisites.mdc此规则处理创建任何爬虫之前的初始设置任务:
pwd获取当前项目的完整路径website-analysis.mdc此综合规则引导Cursor进行网站分析:
scrapy-step-by-step-process.mdc此规则提供了创建爬虫的执行流程:
scrapy.mdc此详尽规则包含了Scrapy的最佳实践:
scraper-models.mdc此规则定义了可以创建的不同类型的爬虫:
这是如何使用AI-Cursor-Scraping-Assistant的方法:
为gucci.com编写一个电子商务PLP爬虫
Cursor随后将:
您可以请求不同类型的爬虫:
例如:
为nike.com编写一个电子商务PDP爬虫
该项目包括一个用于创建隐身爬虫的Camoufox模板,这些爬虫可以绕过某些防机器人措施。MCP工具帮助您:
您可以通过向cursor-rules文件添加新的爬虫类型来扩展功能。模块化设计允许轻松定制。
AI-Cursor-Scraping-Assistant/
├── MCPfiles/
│ ├── xpath_server.py # 带有网络抓取工具的MCP服务器
│ └── Camoufox_template.py # Camoufox爬虫模板
├── cursor-rules/
│ ├── website-analysis.mdc # 分析网站的规则
│ ├── scrapy.mdc # Scrapy的最佳实践
│ ├── scrapy-step-by-step-process.mdc # 创建爬虫的指南
│ ├── scraper-models.mdc # 不同爬虫类型的模板
│ └── prerequisites.m
└── README.md
以下功能计划在未来开发:
本项目基于The Web Scraping Club的文章:
有关网络抓取技术和最佳实践的更多信息,请访问The Web Scraping Club。
欢迎贡献!请随时提交Pull Request。
本项目根据MIT许可证发布 - 查看LICENSE文件了解详情。