此包使用Google Chrome的无头API来抓取网页供AI/LLM代理使用。
由于它默认使用Chrome作为用户代理,因此任何需要JavaScript(例如单页应用程序)的网站也应可以通过此工具进行解析。
它支持通过Go(Go语言)使用LangChainGo调用,或作为MCP服务器运行。
首先使用go编译代码:
go build .
{
"mcpServers": {
"mcp-web-scraper": {
"command": "/path/to/mcp-web-scraper",
"args": []
}
}
}
{
"mcp": {
"servers": {
"mcp-web-scraper": {
"command": "/path/to/mcp-web-scraper",
"args": []
}
}
}
}
集成到langchain非常简单:
import "github.com/lmorg/mcp-web-scraper/langchain"
func example() {
scraper := langchain.NewScraper()
}
请参阅langchaingo文档了解如何使用其库中的工具。
如果您没有安装Google Chrome,那么mcp-web-scraper将回退到使用Go的HTTP用户代理。
这在大多数情况下都能工作,但您可能无法获取需要JavaScript渲染的网站内容。
默认情况下,此模块会查找<article>并将其转换为Markdown。
如果页面没有呈现为某种描述的文章(例如不是博客、技术文档等),则此模块将回退到返回HTML。
返回的任何HTML文档都会移除特定的HTML标签(如<script>、<svg>和HTML注释),以减少LLM解析所需的标记。