通过MinerU进行文档和图像解析的MCP服务器。从PDF、截图和扫描文档中提取文本、表格和公式,并在Apple Silicon上使用MLX加速。
claude mcp add --transport stdio --scope user mineru -- \
uvx --from mcp-mineru python -m mcp_mineru.server
此命令安装并配置服务器以供所有Claude Code项目使用(无需手动安装)。
其他方法:参见安装指南,了解PyPI、源代码安装和Claude Desktop配置的方法。
用户:"分析research_paper.pdf中的表格"
Claude:[调用parse_pdf工具]"该论文包含3个表格..."
用户:"这个截图说了什么?image.png"
Claude:[调用parse_pdf工具]"截图包含..."
用户:"我应该使用哪个后端?"
Claude:[调用list_backends工具]"您的系统具有Apple Silicon M4..."
更多示例,请参阅使用示例。
解析PDF和图像文件,提取结构化内容作为Markdown。
参数:
file_path(必需):文件的绝对路径(PDF、JPEG、PNG等)backend(可选):pipeline | vlm-mlx-engine | vlm-transformersformula_enable(可选):启用公式识别(默认:true)table_enable(可选):启用表格识别(默认:true)start_page(可选):PDF的起始页(默认:0)end_page(可选):PDF的结束页(默认:-1)检查系统能力并获取后端推荐。
返回值:系统信息、可用后端及性能建议。
在Apple Silicon M4(16GB RAM)上进行基准测试:
git clone https://github.com/TINKPA/mcp-mineru.git
cd mcp-mineru
uv pip install -e ".[dev]"
# 运行测试
pytest
# 格式化代码
black src/
ruff check src/
Apache许可证2.0 - 详情请参阅LICENSE文件。
基于OpenDataLab的MinerU构建。