返回市场
快速低语MCP服务器

快速低语MCP服务器

作者:BigUncle13 星标更新:2025-03-22

项目介绍

基于Faster Whisper的高性能语音识别MCP服务器


中文文档

这是一款基于Faster Whisper的高性能语音识别MCP服务器,提供高效的音频转录功能。

特性

  • 集成Faster Whisper实现高效语音识别
  • 批量处理加速以提高转录速度
  • 自动CUDA加速(如果可用)
  • 支持多种模型大小(从tiny到large-v3)
  • 输出格式包括VTT字幕、SRT和JSON
  • 支持文件夹内音频文件的批量转录
  • 模型实例缓存以避免重复加载
  • 根据GPU内存动态调整批处理大小

安装

依赖项

  • Python 3.10+
  • faster-whisper>=0.9.0
  • torch==2.6.0+cu126
  • torchaudio==2.6.0+cu126
  • mcp[cli]>=1.2.0

安装步骤

  1. 克隆或下载此仓库
  2. 创建并激活虚拟环境(推荐)
  3. 安装依赖项:
pip install -r requirements.txt

PyTorch安装指南

根据您的CUDA版本安装适当的PyTorch版本:

  • CUDA 12.6:

    pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu126
    
  • CUDA 12.1:

    pip install torch==2.5.1 torchvision==0.20.1 torchaudio==2.5.1 --index-url https://download.pytorch.org/whl/cu121
    
  • CPU版本:

    pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cpu
    

您可以使用nvcc --versionnvidia-smi检查CUDA版本。

使用方法

启动服务器

在Windows上,只需运行start_server.bat

在其他平台上,运行:

python whisper_server.py

配置Claude Desktop

  1. 打开Claude Desktop配置文件:

    • Windows: %APPDATA%\Claude\claude_desktop_config.json
    • macOS: ~/Library/Application Support/Claude/claude_desktop_config.json
  2. 添加Whisper服务器配置:

{
  "mcpServers": {
    "whisper": {
      "command": "python",
      "args": ["D:/path/to/whisper_server.py"],
      "env": {}
    }
  }
}
  1. 重启Claude Desktop

可用工具

服务器提供了以下工具:

  1. get_model_info - 获取可用的Whisper模型信息
  2. transcribe - 转录音频文件
  3. batch_transcribe - 批量转录文件夹内的音频文件

性能优化建议

  • 使用CUDA加速显著提升转录速度
  • 批量处理模式对于大量短音频文件更有效率
  • 批处理大小会根据GPU内存自动调整
  • 使用VAD(语音活动检测)过滤可以提高长音频的准确性
  • 指定正确的语言可以提高转录质量

本地测试方法

  1. 使用MCP Inspector进行快速测试:
mcp dev whisper_server.py
  1. 使用Claude Desktop进行集成测试

  2. 使用命令行直接调用(需要mcp[cli]):

mcp run whisper_server.py

错误处理

服务器实现了以下错误处理机制:

  • 音频文件存在检查
  • 模型加载失败处理
  • 转录过程异常捕获
  • GPU内存管理
  • 批处理参数自适应调整

项目结构

  • whisper_server.py: 主服务器代码
  • model_manager.py: Whisper模型加载和缓存
  • audio_processor.py: 音频文件验证和预处理
  • formatters.py: 输出格式化(VTT, SRT, JSON)
  • transcriber.py: 核心转录逻辑
  • start_server.bat: Windows启动脚本

许可证

MIT

致谢

本项目在以下令人惊叹的AI工具和模型的帮助下开发:

特别感谢这些令人惊叹的工具及其背后的团队。