一个使用Defuddle库提供网页内容抓取能力的模型上下文协议服务器。此服务器使LLMs能够从网页中检索和处理内容,自动清理HTML并将其转换为干净、可读的Markdown。
这是一个可以替代使用Readability的默认抓取MCP服务器的插件。这通常为大多数现代网页提供了更好的结果。
(使用此问题)
| 默认抓取MCP | Defuddle抓取MCP |
|---|---|
| https://github.com/kepano/defuddle/issues/61的内容:<br><br>MCP协议是给AI模型访问工具的标准。<br><br>有一个默认抓取MCP服务器,它使AI模型能够从网站获取内容。这使用了Readability.js,对于GitHub来说效果一般(我经常尝试用它来导航)。我很感激有GitHub MCP,但一个更通用的网络浏览解决方案在这里显得特别好。<br><br>Defuddle在处理页面时似乎显著优于Readability.js,并且拥有自定义提取器以使特定站点工作良好的模式看起来很好。<br><br>如果有人构建了一个基于Defuddle的抓取MCP服务器,那会很酷。如果我对默认抓取MCP感到足够沮丧,我可能会稍后解决这个问题 😄 | # idea: 基于Defuddle的抓取MCP服务器 · Issue #61 · kepano/defuddle<br><br>URL: https://github.com/kepano/defuddle/issues/61<br><br>打开<br><br>#61<br><br>[](https://github.com/domdomegg)<br><br>## 描述<br><br>MCP协议是给AI模型访问工具的标准。<br><br>有一个默认抓取MCP服务器,它使AI模型能够从网站获取内容。这使用了Readability.js,对于GitHub来说效果一般(我经常尝试用它来导航)。我很感激有GitHub MCP,但一个更通用的网络浏览解决方案在这里显得特别好。<br><br>Defuddle在处理页面时似乎显著优于Readability.js,并且拥有自定义提取器以使特定站点工作良好的模式看起来很好。<br><br>如果有人构建了一个基于Defuddle的抓取MCP服务器,那会很酷。如果我对默认抓取MMCP感到足够沮丧,我可能会稍后解决这个问题 😄 |
start_index和max_length参数进行分页要使用此服务器与Claude Desktop应用,请在您的claude_desktop_config.json的“mcpServers”部分添加以下配置:
{
"mcpServers": {
"defuddle-fetch": {
"command": "npx",
"args": [
"-y",
"defuddle-fetch-mcp-server"
]
}
}
}
url(字符串,必需):要抓取的URLmax_length(数字,可选):返回的最大字符数。默认为5000。start_index(数字,可选):从此字符索引开始内容。默认为0。raw(布尔值,可选):获取未经Markdown转换的原始内容。默认为false。url(字符串,必需):要抓取的URL欢迎在GitHub上提交拉取请求!开始步骤如下:
npm install安装依赖项npm run test执行测试npm run build构建要将其添加到Claude Desktop,请运行npm run build,然后在您的claude_desktop_config.json中添加以下配置:
{
"mcpServers": {
"defuddle-fetch": {
"command": "node",
"args": [
"/path/to/clone/defuddle-fetch-mcp-server/dist/index.js"
]
}
}
}
版本遵循语义化版本规范。
要发布:
npm version <major | minor | patch>增加版本git push --follow-tags推送带标签