一个实现“思考”工具的 Model Context Protocol (MCP) 服务器,用于增强大型语言模型(LLMs)的复杂推理能力。此工具为 LLMs 提供了一个专门的空间,在解决问题时进行结构化思考,显著提高了在需要遵守政策和多步骤推理的复杂场景中的性能。
Think Tool MCP 服务器基于 Anthropic 的研究,该研究表明为 LLMs 提供一个专门的“思考空间”可以极大地提高其在复杂任务上的表现。此工具允许任何兼容的 LLM(如 Claude、GPT-4 等):
正如 Anthropic 的博客文章 所描述的,think 工具在不同语言模型上展示了显著的改进,特别是在需要复杂推理和政策遵循的任务上。
需求:Cursor 版本 0.45.6 或更高版本
Cmd/Ctrl + ,)think-tool-mcp(或您喜欢的名称)命令npx -y think-tool-mcp添加到您的 claude_desktop_config.json:
{
"mcpServers": {
"think-tool": {
"command": "npx",
"args": ["-y", "think-tool-mcp"]
}
}
}
配置文件位置:
~/Library/Application Support/Claude/claude_desktop_config.json此服务器适用于任何支持 Model Context Protocol 的平台。请参阅您平台的文档以获取 MCP 服务器配置信息。
Anthropic 的广泛研究表明,当 LLMs 使用 think 工具时,性能有了显著提升。以下结果展示了在不同基准测试和用例中的可测量影响。
τ-Bench 是一个全面的基准测试,旨在测试 LLM 工具在现实客户服务场景中的使用情况。它评估了导航复杂对话、遵循详细政策指南以及在多次任务试验中保持一致性的能力。
航空领域代表了一个复杂的政策密集型环境,精确遵守详细的规则至关重要。
| 配置 | k=1 | k=2 | k=3 | k=4 | k=5 |
|---|---|---|---|---|---|
| 思考 + 优化提示 | 0.584 | 0.444 | 0.384 | 0.356 | 0.340 |
| 单独使用思考工具 | 0.404 | 0.254 | 0.186 | 0.140 | 0.100 |
| 延伸思考 | 0.412 | 0.290 | 0.232 | 0.192 | 0.160 |
| 基线(无思考工具) | 0.332 | 0.206 | 0.148 | 0.116 | 0.100 |
关键发现:
零售领域有更简单的政策,即使没有广泛的提示,think 工具也能展示其优势。
| 配置 | k=1 | k=2 | k=3 | k=4 | k=5 |
|---|---|---|---|---|---|
| 思考工具(无提示) | 0.812 | 0.735 | 0.685 | 0.650 | 0.626 |
| 延伸思考 | 0.770 | 0.681 | 0.623 | 0.581 | 0.548 |
| 基线 | 0.783 | 0.695 | 0.643 | 0.607 | 0.583 |
关键发现:
SWE-Bench 评估了在真实世界软件工程任务上的编码性能。think 工具帮助 Claude 3.7 Sonnet 达到了最先进的性能。
性能影响:
| 方法 | 航空领域 (k=1) | 零售领域 (k=1) | 实施努力 |
|---|---|---|---|
| 基线 | 0.332 | 0.783 | 无 |
| 延伸思考 | 0.412 (+24%) | 0.770 (-1.7%) | 平台依赖 |
| 思考工具 | 0.404 (+22%) | 0.812 (+3.7%) | 最小 |
| 思考 + 优化提示 | 0.584 (+76%) | N/A | 低 |
关键收获:think 工具提供了显著的性能提升,而实施开销极小,使其成为增强 LLM 在复杂推理场景中能力的绝佳选择。
最快的方式开始:
npx -y think-tool-mcp
为了在项目之间持久使用:
npm install -g think-tool-mcp
为了贡献或本地开发:
git clone https://github.com/abhinav-mangla/think-tool-mcp.git
cd think-tool-mcp
npm install
npm run build
npm start
人类:帮我优化我们公司的供应链,有 5 个仓库和 12 个零售点。
LLM:我会帮你优化你的供应链。让我系统地思考一下这个问题。
[使用思考工具]
思考:这是一个复杂的优化问题,需要:
1. 分析仓库与零售点之间的距离
2. 计算所有配对之间的运输成本
3. 评估交货时间限制
4. 考虑库存容量
5. 分析需求模式
我需要将其作为线性规划问题来制定,并考虑成本最小化和交货时间限制……
[根据分析进行结构化解决方案]
人类:我可以退货吗?这个产品已经打开并且超过 45 天,没有收据。
LLM:让我仔细检查我们的退货政策。
[使用思考工具]
思考:分析这个退货请求:
- 商品:已过标准 30 天窗口期 45 天
- 没有收据
- 包装已打开
政策考虑:
- 标准退货要求 30 天 + 收据
- 可能提供购买验证的商店信用
- 商品类别影响政策(电子产品 vs 衣物)
- 会员可能有延长窗口期
- 经理有权批准
[提供符合政策的响应及可用选项]
人类:找出 60 天以上未活跃的高级用户,并创建重新激活活动。
LLM:我会查询数据库并创建有针对性的活动。
[运行数据库查询]
[使用思考工具]
思考:查询结果显示有 342 名未活跃的高级用户。主要模式:
- 45% 在 6-12 个月订阅组内
- 72% 最后活动是“查看仪表板”
- 仅 8% 使用了最新功能
- 28% 在变得不活跃之前有过支持票
活动策略:
- 根据使用模式细分用户
- 强调未探索的功能
- 解决与支持相关的痛点
- 根据历史个性化激励措施
[基于分析创建针对性电子邮件活动]
think为 LLMs 提供一个专门的空间进行复杂的推理和分析。
参数:
thought(字符串,必需):要记录的思维过程、推理或分析描述: think 工具接受 LLM 需要执行的任何结构化思考。这可以包括:
使用模式: 当 LLM 需要参与复杂的推理时,会自动使用此工具。该工具不会检索新信息或进行更改——它只是提供了一个结构化思考的空间。
think-tool-mcp/
├── src/
│ ├── index.ts # CLI 入口点
│ └── server.ts # MCP 服务器实现
├── examples/
│ └── example_usage.md # 使用示例
├── dist/ # 编译后的 JavaScript
├── package.json
├── tsconfig.json
└── README.md
# 安装依赖
npm install
# 构建项目
npm run build
# 开发模式运行
npm run dev
# 启动构建的服务器
npm start
欢迎贡献!请随意提交 Pull Request。对于重大变更,请先打开一个 Issue 来讨论您想要改变的内容。
git checkout -b feature/amazing-feature)git commit -m '添加一些精彩功能')git push origin feature/amazing-feature)服务器无法启动:
工具未出现在 AI 平台上:
权限错误:
npx 而不是全局安装用于开发和调试:
npm run dev
这将以 TypeScript 直接运行服务器,并提供更多详细的错误信息。
本项目采用 MIT 许可证——详情请参阅 LICENSE 文件。
Abhinav Mangla