返回市场
MCP服务器可读性Python版

MCP服务器可读性Python版

作者:jmh1083 星标更新:2025-01-07

项目介绍

MCP Server Readability Parser (Python / FastMCP)

致谢/参考

该项目基于 emzimmer 的原始 server-moz-readability 实现。 (对于原始的README文档,请参阅 原始README.md。)

此Python实现将原始概念调整为使用FastMCP运行的基于Python的MCP。

Mozilla Readability Parser MCP Server

这是一个基于Model Context Protocol (MCP)的Python实现的服务器,用于提取并转换网页内容为干净、适合LLM处理的Markdown。

目录

功能

  • 移除广告、导航、页脚和其他非必要内容
  • 将干净的HTML转换为格式良好的Markdown
  • 能够优雅地处理错误
  • 优化以供LLM处理
  • 轻量且快速

为什么不仅仅是获取?

与简单的获取请求不同,该服务器:

  • 使用Readability算法仅提取相关的内容
  • 消除噪音,如广告、弹出窗口和导航菜单
  • 通过移除非必要的HTML/CSS减少令牌使用
  • 提供一致的Markdown格式以改善LLM处理
  • 处理具有动态内容的复杂网页

安装

  1. 克隆仓库:
git clone https://github.com/jmh108/MCP-server-readability-python.git
cd MCP-server-readability-python
  1. 创建并激活虚拟环境:
python -m venv venv
source venv/bin/activate  # 在Windows上使用:venv\Scripts\activate
  1. 安装依赖项:
pip install -r requirements.txt

快速开始

  1. 启动服务器:
fastmcp run server.py
  1. 示例请求:
curl -X POST http://localhost:8000/tools/extract_content \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/article"}'

工具参考

extract_content

抓取并转换网页内容为干净的Markdown。

参数:

{
  "url": {
    "type": "string",
    "description": "要解析的网站URL",
    "required": true
  }
}

返回值:

{
  "content": "Markdown内容..."
}

MCP服务器配置

要配置MCP服务器,在您的MCP设置文件中添加以下内容:

{
  "mcpServers": {
    "readability": {
      "command": "fastmcp",
      "args": ["run", "server.py"],
      "env": {}
    }
  }
}

然后可以使用MCP协议启动服务器,并通过parse工具访问它。

依赖项

许可证

MIT许可证 - 详情见LICENSE