返回市场
图像识别

图像识别

作者:mario-andreschak32 星标更新:2025-04-13

项目介绍

MCP 图像识别服务器

这是一个使用 Anthropic 和 OpenAI 视觉API 提供图像识别功能的MCP服务器。版本 0.1.2。

功能

  • 使用 Anthropic Claude Vision 或 OpenAI GPT-4 Vision 进行图像描述
  • 支持多种图像格式(JPEG、PNG、GIF、WebP)
  • 可配置的主要和备用提供商
  • 支持Base64编码和文件形式的图像输入
  • 可选的Tesseract OCR文本提取

要求

  • Python 3.8或更高版本
  • Tesseract OCR(可选)- 文本提取功能所需
    • Windows:从UB-Mannheim/tesseract下载并安装
    • Linux:sudo apt-get install tesseract-ocr
    • macOS:brew install tesseract

安装

  1. 克隆仓库:
git clone https://github.com/mario-andreschak/mcp-image-recognition.git
cd mcp-image-recognition
  1. 创建并配置环境文件:
cp .env.example .env
# 编辑.env文件,填写您的API密钥和偏好设置
  1. 构建项目:
build.bat

使用方法

启动服务器

使用Python启动服务器:

python -m image_recognition_server.server

使用批处理启动服务器:

run.bat server

在开发模式下使用MCP Inspector启动服务器:

run.bat debug

可用工具

  1. describe_image

    • 输入:Base64编码的图像数据和MIME类型
    • 输出:详细的图像描述
  2. describe_image_from_file

    • 输入:图像文件路径
    • 输出:详细的图像描述

环境配置

  • ANTHROPIC_API_KEY:您的Anthropic API密钥。
  • OPENAI_API_KEY:您的OpenAI API密钥。
  • VISION_PROVIDER:主要视觉提供商(anthropicopenai)。
  • FALLBACK_PROVIDER:可选的备用提供商。
  • LOG_LEVEL:日志级别(DEBUG、INFO、WARNING、ERROR)。
  • ENABLE_OCR:启用Tesseract OCR文本提取(truefalse)。
  • TESSERACT_CMD:可选的自定义Tesseract可执行文件路径。
  • OPENAI_MODEL:OpenAI模型(默认:gpt-4o-mini)。可以使用OpenRouter格式指定其他模型(例如,anthropic/claude-3.5-sonnet:beta)。
  • OPENAI_BASE_URL:可选的自定义OpenAI API基础URL。对于OpenRouter,设置为https://openrouter.ai/api/v1
  • OPENAI_TIMEOUT:可选的自定义超时时间(秒)。

使用OpenRouter

OpenRouter允许您通过OpenAI API格式访问各种模型。要使用OpenRouter,请遵循以下步骤:

  1. 从OpenRouter获取一个OpenAI API密钥。
  2. 在您的.env文件中将OPENAI_API_KEY设置为您从OpenRouter获得的API密钥。
  3. OPENAI_BASE_URL设置为https://openrouter.ai/api/v1
  4. 使用OpenRouter格式将OPENAI_MODEL设置为所需的模型(例如,anthropic/claude-3.5-sonnet:beta)。
  5. VISION_PROVIDER设置为openai

默认模型

  • Anthropic:claude-3.5-sonnet-beta
  • OpenAI:gpt-4o-mini
  • OpenRouter:使用anthropic/claude-3.5-sonnet:beta格式在OPENAI_MODEL中指定。

开发

运行测试

运行所有测试:

run.bat test

运行特定测试套件:

run.bat test server
run.bat test anthropic
run.bat test openai

Docker支持

构建Docker镜像:

docker build -t mcp-image-recognition .

运行容器:

docker run -it --env-file .env mcp-image-recognition

许可证

MIT许可证 - 详情见LICENSE文件。

发布历史

  • 0.1.2 (2025-02-20):改进了OCR错误处理,并增加了全面的OCR功能测试覆盖
  • 0.1.1 (2025-02-19):添加了Tesseract OCR支持以从图像中提取文本(可选功能)
  • 0.1.0 (2025-02-19):初始发布,包含Anthropic和OpenAI视觉支持