这是一个使用Google的Gemini AI进行图像、音频和视频识别的MCP(模型上下文协议)服务器。
<a href="https://glama.ai/mcp/servers/@mario-andreschak/mcp_video_recognition"> <img width="380" height="200" src="https://gips1.baidu.com/it/u=3430252268,2303673444&fm=3081&app=3081&f=PNG?w=760&h=400" alt="视频识别服务器 MCP服务器" /> </a>克隆仓库:
git clone https://github.com/yourusername/mcp-video-recognition.git
cd mcp-video-recognition
安装依赖项:
npm install
构建项目:
npm run build
要通过配置文件将此MCP服务器与Cline或其他MCP客户端集成:
打开您的Cline设置:
向mcpServers对象添加服务器配置:
{
"mcpServers": {
"video-recognition": {
"command": "node",
"args": [
"/path/to/mcp-video-recognition/dist/index.js"
],
"disabled": false,
"autoApprove": []
}
}
}
使用实际路径替换/path/to/mcp-video-recognition/dist/index.js,指向您项目目录中的index.js文件。在Windows上使用正斜杠(/)或双反斜杠(\)作为路径分隔符。
保存设置文件。Cline应自动连接到服务器。
服务器使用环境变量进行配置:
GOOGLE_API_KEY(必需):您的Google Gemini API密钥TRANSPORT_TYPE:使用的传输类型(stdio或sse,默认为stdio)PORT:SSE传输的端口号(默认为3000)LOG_LEVEL:日志级别(verbose、debug、info、warn、error,默认为info)GOOGLE_API_KEY=your_api_key npm start
GOOGLE_API_KEY=your_api_key TRANSPORT_TYPE=sse PORT=3000 npm start
服务器提供了三个可以由MCP客户端调用的工具:
{
"name": "image_recognition",
"arguments": {
"filepath": "/path/to/image.jpg",
"prompt": "详细描述这张图片",
"modelname": "gemini-2.0-flash"
}
}
{
"name": "audio_recognition",
"arguments": {
"filepath": "/path/to/audio.mp3",
"prompt": "转录这段音频",
"modelname": "gemini-2.0-flash"
}
}
{
"name": "video_recognition",
"arguments": {
"filepath": "/path/to/video.mp4",
"prompt": "描述这个视频的内容",
"modelname": "gemini-2.0-flash"
}
}
所有工具接受以下参数:
filepath(必需):要分析的媒体文件路径prompt(可选):自定义识别提示(默认为“描述这个内容”)modelname(可选):用于识别的Gemini模型(默认为“gemini-2.0-flash”)GOOGLE_API_KEY=your_api_key npm run dev
src/index.ts:入口点src/server.ts:MCP服务器实现src/tools/:工具实现src/services/:服务实现(Gemini API)src/types/:类型定义src/utils/:实用函数MIT