返回市场
视频识别

视频识别

作者:mario-andreschak9 星标更新:2025-04-27

项目介绍

MCP 视频识别服务器

这是一个使用Google的Gemini AI进行图像、音频和视频识别的MCP(模型上下文协议)服务器。

<a href="https://glama.ai/mcp/servers/@mario-andreschak/mcp_video_recognition"> <img width="380" height="200" src="https://gips1.baidu.com/it/u=3430252268,2303673444&fm=3081&app=3081&f=PNG?w=760&h=400" alt="视频识别服务器 MCP服务器" /> </a>

特性

  • 图像识别:使用Google Gemini AI分析和描述图像
  • 音频识别:使用Google Gemini AI分析和转录音频
  • 视频识别:使用Google Gemini AI分析和描述视频

预备条件

  • Node.js 18或更高版本
  • Google Gemini API密钥

安装

手动安装

  1. 克隆仓库:

    git clone https://github.com/yourusername/mcp-video-recognition.git
    cd mcp-video-recognition
    
  2. 安装依赖项:

    npm install
    
  3. 构建项目:

    npm run build
    

FLUJO中安装

  1. 点击添加服务器
  2. 将GitHub URL复制并粘贴到FLUJO中
  3. 点击解析、克隆、安装、构建并保存。

通过配置文件安装

要通过配置文件将此MCP服务器与Cline或其他MCP客户端集成:

  1. 打开您的Cline设置:

    • 在VS Code中,前往文件 -> 首选项 -> 设置
    • 搜索“Cline MCP设置”
    • 点击“在settings.json中编辑”
  2. mcpServers对象添加服务器配置:

    {
      "mcpServers": {
        "video-recognition": {
          "command": "node",
          "args": [
            "/path/to/mcp-video-recognition/dist/index.js"
          ],
          "disabled": false,
          "autoApprove": []
        }
      }
    }
    
  3. 使用实际路径替换/path/to/mcp-video-recognition/dist/index.js,指向您项目目录中的index.js文件。在Windows上使用正斜杠(/)或双反斜杠(\)作为路径分隔符。

  4. 保存设置文件。Cline应自动连接到服务器。

配置

服务器使用环境变量进行配置:

  • GOOGLE_API_KEY(必需):您的Google Gemini API密钥
  • TRANSPORT_TYPE:使用的传输类型(stdiosse,默认为stdio
  • PORT:SSE传输的端口号(默认为3000)
  • LOG_LEVEL:日志级别(verbosedebuginfowarnerror,默认为info

使用方法

启动服务器

使用stdio传输(默认)

GOOGLE_API_KEY=your_api_key npm start

使用SSE传输

GOOGLE_API_KEY=your_api_key TRANSPORT_TYPE=sse PORT=3000 npm start

使用工具

服务器提供了三个可以由MCP客户端调用的工具:

图像识别

{
  "name": "image_recognition",
  "arguments": {
    "filepath": "/path/to/image.jpg",
    "prompt": "详细描述这张图片",
    "modelname": "gemini-2.0-flash"
  }
}

音频识别

{
  "name": "audio_recognition",
  "arguments": {
    "filepath": "/path/to/audio.mp3",
    "prompt": "转录这段音频",
    "modelname": "gemini-2.0-flash"
  }
}

视频识别

{
  "name": "video_recognition",
  "arguments": {
    "filepath": "/path/to/video.mp4",
    "prompt": "描述这个视频的内容",
    "modelname": "gemini-2.0-flash"
  }
}

工具参数

所有工具接受以下参数:

  • filepath(必需):要分析的媒体文件路径
  • prompt(可选):自定义识别提示(默认为“描述这个内容”)
  • modelname(可选):用于识别的Gemini模型(默认为“gemini-2.0-flash”)

开发

在开发模式下运行

GOOGLE_API_KEY=your_api_key npm run dev

项目结构

  • src/index.ts:入口点
  • src/server.ts:MCP服务器实现
  • src/tools/:工具实现
  • src/services/:服务实现(Gemini API)
  • src/types/:类型定义
  • src/utils/:实用函数

许可证

MIT