返回市场
moz可读性服务器

moz可读性服务器

作者:emzimmer14 星标更新:2025-01-29

项目介绍

Mozilla 可读性解析器 MCP 服务器

这是一个基于 模型上下文协议 (MCP) 的服务器,用于提取并转换网页内容为干净且适合大语言模型 (LLM) 处理的 Markdown 格式。返回文章标题、主要内容、摘录、作者信息和站点名称。使用 Mozilla 的可读性算法 来移除广告、导航栏、页脚和其他非必要元素,同时保留核心内容结构。更多关于 MCP

<a href="https://glama.ai/mcp/servers/jdcx8fmajm"><img width="380" height="200" src="https://gips0.baidu.com/it/u=2526419188,2028727200&fm=3081&app=3081&f=PNG?w=760&h=400" alt="Mozilla Readability Parser Server MCP 服务器" /></a>

功能

  • 移除广告、导航栏、页脚和其他非必要内容
  • 将干净的 HTML 转换为格式良好的 Markdown(也使用 Turndown)
  • 返回文章元数据(标题、摘录、作者信息、站点名称)
  • 平稳处理错误

为什么不仅仅是抓取?

与简单的抓取请求不同,此服务器:

  • 使用 Mozilla 的可读性算法仅提取相关内容
  • 消除噪音如广告、弹出窗口和导航菜单
  • 通过移除非必要的 HTML/CSS 减少令牌使用量
  • 提供一致的 Markdown 格式以优化 LLM 处理
  • 包含有关内容的有用元数据

安装

通过 Smithery 安装

要自动安装 Mozilla 可读性解析器到 Claude Desktop,请使用 Smithery

npx -y @smithery/cli install server-moz-readability --client claude

手动安装

npm install server-moz-readability

工具参考

parse

抓取并转换网页内容为干净的 Markdown。 参数:

{
  "url": {
    "type": "string",
    "description": "要解析的网站 URL",
    "required": true
  }
}

返回值:

{
  "title": "文章标题",
  "content": "Markdown 内容...",
  "metadata": {
    "excerpt": "简短摘要",
    "byline": "作者信息",
    "siteName": "来源网站名称"
  }
}

在 Claude Desktop 中使用

在你的 claude_desktop_config.json 文件中添加:

{
  "mcpServers": {
    "readability": {
      "command": "npx",
      "args": ["-y", "server-moz-readability"]
    }
  }
}

依赖项

  • @mozilla/readability - 内容提取
  • turndown - HTML 到 Markdown 转换
  • jsdom - DOM 解析
  • axios - HTTP 请求

许可证

MIT