返回市场
迷雾 OCR MCP

迷雾 OCR MCP

作者:lemopian6 星标更新:2025-05-28

项目介绍

Mistral OCR MCP 服务器

这是一个基于模型上下文协议(MCP)的服务器,使用Mistral的OCR API提供光学字符识别(OCR)功能。此服务器允许您通过兼容MCP的客户端(如Cursor和Claude Desktop)从PDF文件和图像中提取文本内容。

📖 更多背景信息和实际用例,请参阅相关文章: 如何使用Mistral Document AI整合我的笔记

使用示例流程图

流程图

特性

  • 从PDF文件和图像(JPG、JPEG、PNG、TIFF、BMP)中提取文本
  • 返回分页结构化的文本内容
  • 无缝集成到MCP客户端
  • 使用FastMCP构建以实现最佳性能

预备条件

安装

  1. 克隆仓库:

    git clone https://github.com/lemopian/mistral-ocr-mcp.git
    cd mistral-ocr-mcp
    
  2. 使用uv安装依赖项:

    uv sync
    
  3. 设置环境变量: 在项目根目录创建一个 .env 文件:

    echo "MISTRAL_API_KEY=your_mistral_api_key_here" > .env
    

配置MCP客户端

在您的MCP客户端配置文件中添加以下配置:

{
  "mcpServers": {
    "mistral-ocr": {
      "command": "/Users/yourusername/.local/bin/uv",
      "args": [
        "--directory",
        "/path/to/mistral-ocr-mcp",
        "run",
        "main.py"
      ]
    }
  }
}

重要提示:/path/to/mistral-ocr-mcp 替换为您实际克隆的仓库路径。

使用方法

配置完成后,服务器提供了以下工具:

extract_file_content

从PDF文件和图像中提取文本内容。

参数:

  • file_path (字符串):PDF或图像文件的本地路径

返回值:

  • 提取的文本内容作为字符串

支持的格式:

  • PDF文件(.pdf
  • 图像文件(.jpg.jpeg.png.tiff.bmp

示例用法:

请从这个文档中提取文本:/path/to/your/document.pdf

开发

直接运行服务器

uv run main.py

项目结构

mistral-ocr-mcp/
├── mistral_ocr/          # 包目录
│   ├── __init__.py       # 包初始化
│   └── extractor.py      # Mistral OCR 功能
├── docs/                 # 文档
│   └── flowchart.png     # 架构流程图
├── main.py               # MCP服务器实现
├── pyproject.toml        # 项目依赖和配置
├── uv.lock              # 依赖锁定文件
├── .env                 # 环境变量(创建此文件)
├── .gitignore           # Git忽略规则
└── README.md            # 此文件

环境变量

  • MISTRAL_API_KEY:您的Mistral API密钥(必需)

故障排除

  1. “MISTRAL_API_KEY必须设置”错误:

    • 确保已创建包含您的Mistral API密钥的.env文件
    • 验证API密钥有效
  2. “文件未找到”错误:

    • 检查文件路径是否正确且可访问
    • 确保文件格式受支持
  3. MCP连接问题:

    • 验证MCP配置中的uv路径是否正确
    • 确保仓库路径绝对且正确
    • 检查所有依赖项是否通过uv sync安装