此仓库包含一个集成本地运行的Llama模型的Model Context Protocol (MCP)服务器实现。MCP服务器提供了一个标准化的上下文检索接口,通过本地LLM增强了AI应用的相关信息。
该项目由两个主要组件组成:
git clone https://github.com/EXPESRaza/mcp-llama-integration.git
cd mcp--llama-integration
pip install -r requirements.txt
mcp-llama-integration/
├── llama_mcp_server.py # 集成Llama的MCP服务器
├── llama_client_app.py # 样本客户端应用程序
└── README.md # 项目文档
ollama pull llama3.2
curl http://localhost:11434/api/tags
浏览器访问:
http://localhost:11434
http://localhost:11434/api/tags
启动服务器:
python llama_mcp_server.py
服务器将在http://localhost:8000上启动运行。
您可以通过检查健康状态端点来验证服务器是否运行:
curl http://localhost:8000/health
在另一个终端中启动客户端应用程序:
python llama_client_app.py
应用程序会提示您输入。
输入您的查询并接收来自Llama模型的响应。
输入'exit'以退出应用程序。
请求给定查询的上下文。
请求正文:
{
"query_text": "您的查询在这里",
"user_id": "可选用户ID",
"session_id": "可选会话ID",
"additional_context": {}
}
响应:
{
"context_elements": [
{
"content": "来自Llama模型的响应",
"source": "llama_model",
"relevance_score": 0.9
}
],
"metadata": {
"processing_time_ms": 150,
"model": "llama3",
"query": "您的查询在这里"
}
}
检查MCP服务器及其与Llama模型连接的健康状态。
响应:
{
"status": "healthy",
"llama_status": "connected"
}
如果您想使用不同的Llama模型,请修改llama_mcp_server.py中的query_llama函数里的model参数:
payload = {
"model": "your-model-name", # 将此更改为您的模型名称
"prompt": text,
"stream": False
}
要更改发送到Llama之前的查询格式,请更新get_context函数中的提示模板:
prompt = f"""请提供以下查询的相关信息:
{request.query_text}
请用事实性、有帮助的信息回应。"""
连接被拒绝错误
模型未找到错误
ollama list检查可用模型响应缓慢
欢迎贡献!请随意提交Pull Request。
本项目采用MIT许可证 - 详情请参阅LICENSE文件。