返回市场
思考工具MCP

思考工具MCP

作者:abhinav-mangla10 星标更新:2025-08-12

项目介绍

技术文档摘要

MCP Think Tool Server

npm 版本 许可证 TypeScript MCP

<a href="https://glama.ai/mcp/servers/@abhinav-mangla/think-tool-mcp"> <img width="380" height="200" src="https://gips2.baidu.com/it/u=3970332795,3557498601&fm=3081&app=3081&f=PNG?w=760&h=400" alt="Think Tool Server MCP 服务器" /> </a>

一个实现“思考”工具的 Model Context Protocol (MCP) 服务器,用于增强大型语言模型(LLMs)的复杂推理能力。此工具为 LLMs 提供了一个专门的空间,在解决问题时进行结构化思考,显著提高了在需要遵守政策和多步骤推理的复杂场景中的性能。

🧠 概述

Think Tool MCP 服务器基于 Anthropic 的研究,该研究表明为 LLMs 提供一个专门的“思考空间”可以极大地提高其在复杂任务上的表现。此工具允许任何兼容的 LLM(如 Claude、GPT-4 等):

  • 将复杂问题分解成可管理的步骤
  • 进行结构化的推理和分析
  • 在决策过程中验证政策合规性
  • 处理并综合来自多个工具调用的信息
  • 在长时间的推理链中保持上下文和逻辑流程

正如 Anthropic 的博客文章 所描述的,think 工具在不同语言模型上展示了显著的改进,特别是在需要复杂推理和政策遵循的任务上。

✨ 功能

  • 🔧 结构化思考空间:为 LLMs 提供一个专门的环境来进行复杂的推理
  • 📝 记忆辅助:帮助在长时间的工具调用链中保持上下文
  • 🎯 政策验证:能够仔细检查政策合规性
  • 🔍 问题分解:支持将复杂问题分解成步骤
  • ⚡ 轻量级:最小的开销和高效的 MCP 实现
  • 🔌 易于集成:与流行的 AI 平台(如 Cursor、Claude Desktop 等)简单设置
  • 🛠️ TypeScript:使用 TypeScript 构建,确保类型安全和更好的开发体验
  • 🌐 通用兼容性:适用于任何支持 Model Context Protocol 的 LLM

🚀 平台配置

Cursor IDE

需求:Cursor 版本 0.45.6 或更高版本

  1. 打开 Cursor 设置 (Cmd/Ctrl + ,)
  2. 导航到 功能MCP 服务器
  3. 点击 "+ 添加新 MCP 服务器"
  4. 配置服务器:
    • 名称think-tool-mcp(或您喜欢的名称)
    • 类型命令
    • 命令npx -y think-tool-mcp
  5. 保存并重启 Cursor

Claude Desktop

添加到您的 claude_desktop_config.json

{
  "mcpServers": {
    "think-tool": {
      "command": "npx",
      "args": ["-y", "think-tool-mcp"]
    }
  }
}

配置文件位置

  • macOS~/Library/Application Support/Claude/claude_desktop_config.json
  • Windows:%APPDATA%\Claude\claude_desktop_config.json

其他 MCP 兼容平台

此服务器适用于任何支持 Model Context Protocol 的平台。请参阅您平台的文档以获取 MCP 服务器配置信息。

📊 性能分析

Anthropic 的广泛研究表明,当 LLMs 使用 think 工具时,性能有了显著提升。以下结果展示了在不同基准测试和用例中的可测量影响。

τ-Bench (Tau-Bench) 结果

τ-Bench 是一个全面的基准测试,旨在测试 LLM 工具在现实客户服务场景中的使用情况。它评估了导航复杂对话、遵循详细政策指南以及在多次任务试验中保持一致性的能力。

航空领域性能

航空领域代表了一个复杂的政策密集型环境,精确遵守详细的规则至关重要。

配置k=1k=2k=3k=4k=5
思考 + 优化提示0.5840.4440.3840.3560.340
单独使用思考工具0.4040.2540.1860.1400.100
延伸思考0.4120.2900.2320.1920.160
基线(无思考工具)0.3320.2060.1480.1160.100

关键发现

  • 相对提升 54% 在 pass^1 指标(0.584 对比基线 0.370)
  • 使用示例的优化提示显著提升了性能
  • 在所有试验一致性水平(k=1 到 k=5)上保持了改进

零售领域性能

零售领域有更简单的政策,即使没有广泛的提示,think 工具也能展示其优势。

配置k=1k=2k=3k=4k=5
思考工具(无提示)0.8120.7350.6850.6500.626
延伸思考0.7700.6810.6230.5810.548
基线0.7830.6950.6430.6070.583

关键发现

  • 提升 3.7% 在 pass^1 指标且无需额外提示
  • 展示了在不同复杂度级别上的有效性
  • 在多次试验中保持了一致的性能提升

SWE-Bench 结果

SWE-Bench 评估了在真实世界软件工程任务上的编码性能。think 工具帮助 Claude 3.7 Sonnet 达到了最先进的性能。

性能影响

  • 基线分数:62.3%(无 think 工具)
  • 使用 think 工具:64.9%(基于 1.6% 的改进估算)
  • 统计显著性:Welch 的 t 检验:t(38.89) = 6.71, p < .001, d = 1.47
  • 样本大小:30 个带有 think 工具的样本,144 个无 think 工具的样本

性能洞察

当 think 工具表现出色时

  1. 政策密集型环境:当需要遵守复杂规则时,最多可提升 54%
  2. 顺序决策制定:每个动作都建立在前一个动作之上时,显著提升
  3. 工具输出分析:处理来自多个工具调用的结果时,性能增强
  4. 复杂领域导航:在具有挑战性的领域(如航空与零售)中获益更多

优化因素

  1. 特定领域的提示:针对特定用例定制的例子显著提高了效果
  2. 复杂度相关性:更复杂的领域从结构化思考中受益更多
  3. 一致性改进:在多次试验运行中保持了改进,表明了稳健性
  4. 错误减少:帮助 LLMs 更有效地处理边缘案例和不寻常的情况

比较分析

方法航空领域 (k=1)零售领域 (k=1)实施努力
基线0.3320.783
延伸思考0.412 (+24%)0.770 (-1.7%)平台依赖
思考工具0.404 (+22%)0.812 (+3.7%)最小
思考 + 优化提示0.584 (+76%)N/A

关键收获:think 工具提供了显著的性能提升,而实施开销极小,使其成为增强 LLM 在复杂推理场景中能力的绝佳选择。

📦 安装

快速开始使用 npx(推荐)

最快的方式开始:

npx -y think-tool-mcp

全局安装

为了在项目之间持久使用:

npm install -g think-tool-mcp

本地开发安装

为了贡献或本地开发:

git clone https://github.com/abhinav-mangla/think-tool-mcp.git
cd think-tool-mcp
npm install
npm run build
npm start

🎯 使用示例

复杂问题解决

人类:帮我优化我们公司的供应链,有 5 个仓库和 12 个零售点。

LLM:我会帮你优化你的供应链。让我系统地思考一下这个问题。

[使用思考工具]
思考:这是一个复杂的优化问题,需要:
1. 分析仓库与零售点之间的距离
2. 计算所有配对之间的运输成本
3. 评估交货时间限制
4. 考虑库存容量
5. 分析需求模式

我需要将其作为线性规划问题来制定,并考虑成本最小化和交货时间限制……

[根据分析进行结构化解决方案]

政策遵循

人类:我可以退货吗?这个产品已经打开并且超过 45 天,没有收据。

LLM:让我仔细检查我们的退货政策。

[使用思考工具]
思考:分析这个退货请求:
- 商品:已过标准 30 天窗口期 45 天
- 没有收据
- 包装已打开

政策考虑:
- 标准退货要求 30 天 + 收据
- 可能提供购买验证的商店信用
- 商品类别影响政策(电子产品 vs 衣物)
- 会员可能有延长窗口期
- 经理有权批准

[提供符合政策的响应及可用选项]

多工具分析

人类:找出 60 天以上未活跃的高级用户,并创建重新激活活动。

LLM:我会查询数据库并创建有针对性的活动。

[运行数据库查询]
[使用思考工具]
思考:查询结果显示有 342 名未活跃的高级用户。主要模式:
- 45% 在 6-12 个月订阅组内
- 72% 最后活动是“查看仪表板”
- 仅 8% 使用了最新功能
- 28% 在变得不活跃之前有过支持票

活动策略:
- 根据使用模式细分用户
- 强调未探索的功能
- 解决与支持相关的痛点
- 根据历史个性化激励措施

[基于分析创建针对性电子邮件活动]

🔧 API 参考

可用工具

think

为 LLMs 提供一个专门的空间进行复杂的推理和分析。

参数

  • thought(字符串,必需):要记录的思维过程、推理或分析

描述: think 工具接受 LLM 需要执行的任何结构化思考。这可以包括:

  • 步骤式的分析
  • 政策验证工作流
  • 多标准决策
  • 来自多个来源的信息综合
  • 复杂的推理链

使用模式: 当 LLM 需要参与复杂的推理时,会自动使用此工具。该工具不会检索新信息或进行更改——它只是提供了一个结构化思考的空间。

🏗️ 开发

项目结构

think-tool-mcp/
├── src/
│   ├── index.ts          # CLI 入口点
│   └── server.ts         # MCP 服务器实现
├── examples/
│   └── example_usage.md  # 使用示例
├── dist/                 # 编译后的 JavaScript
├── package.json
├── tsconfig.json
└── README.md

从源代码构建

# 安装依赖
npm install

# 构建项目
npm run build

# 开发模式运行
npm run dev

# 启动构建的服务器
npm start

贡献

欢迎贡献!请随意提交 Pull Request。对于重大变更,请先打开一个 Issue 来讨论您想要改变的内容。

  1. 分叉仓库
  2. 创建您的功能分支 (git checkout -b feature/amazing-feature)
  3. 提交您的更改 (git commit -m '添加一些精彩功能')
  4. 推送到分支 (git push origin feature/amazing-feature)
  5. 打开 Pull Request

📋 要求

  • Node.js:版本 16 或更高版本
  • npm:随 Node.js 一起提供
  • MCP 兼容平台:Cursor、Claude Desktop 或其他支持 MCP 的应用程序

🔍 故障排除

常见问题

服务器无法启动

  • 确保已安装 Node.js 16+
  • 检查 MCP 配置中的命令路径是否正确
  • 确认没有端口冲突

工具未出现在 AI 平台上

  • 确认 MCP 服务器已正确配置
  • 在配置更改后重启您的 AI 平台
  • 查看平台特定的 MCP 文档

权限错误

  • 在 Unix 系统上,确保二进制文件可执行
  • 尝试使用 npx 而不是全局安装

调试模式

用于开发和调试:

npm run dev

这将以 TypeScript 直接运行服务器,并提供更多详细的错误信息。

📚 学习更多

📄 许可证

本项目采用 MIT 许可证——详情请参阅 LICENSE 文件。

👤 作者

Abhinav Mangla

🙏 致谢

  • Anthropic 因其 think 工具的研究和方法论
  • Model Context Protocol 团队因其优秀的框架
  • 开源社区因贡献和反馈

<p align="center"> <i>一次思考,增强 AI 推理。</i> </p>