返回市场
文档获取MCP服务器

文档获取MCP服务器

作者:wolfyy9707 星标更新:2025-03-22

项目介绍

获取MCP服务器文档

一个用于获取网页内容并具有递归探索能力的模型上下文协议(MCP)服务器。此服务器使LLMs能够自主地探索网页和文档以了解特定主题。

概览

Docs Fetch MCP Server 提供了一种简单而强大的方式让LLMs检索和探索网页内容。它支持以下功能:

  • 从任何网页中提取干净、可读的内容
  • 根据指定深度递归探索链接页面
  • 在同一域内遍历链接以收集全面的信息
  • 智能过滤导航链接,专注于内容丰富的页面

当用户希望LLMs通过探索文档或网页内容来学习特定主题时,此工具特别有用。

功能

  • 内容提取:干净地从网页中提取主要内容,移除导航、广告和其他无关元素
  • 链接分析:识别并提取页面中的链接,并评估其相关性
  • 递归探索:在同一个域内跟随链接到相关的内容,直到指定的深度
  • 并行处理:高效地爬取内容,同时发出请求并进行适当的错误处理
  • 强大的错误处理:优雅地处理网络问题、超时和格式不正确的页面
  • 双策略方法:首先使用快速的axios请求,对于更复杂的页面则使用puppeteer作为后备
  • 防止超时:实现全局超时处理,确保在MCP时间限制内可靠运行
  • 部分结果:即使某些页面未能完全加载,也返回可用内容

使用

该服务器提供了一个单一的MCP工具:

fetch_doc_content

获取网页内容,并具备探索链接页面至指定深度的能力。

参数:

  • url(字符串,必需):要抓取的网页URL
  • depth(数字,可选,默认值:1):目录/链接探索的最大深度(1-5)

返回:

{
  "rootUrl": "https://example.com/docs",
  "explorationDepth": 2,
  "pagesExplored": 5,
  "content": [
    {
      "url": "https://example.com/docs",
      "title": "文档",
      "content": "主页内容...",
      "links": [
        {
          "url": "https://example.com/docs/topic1",
          "text": "主题1"
        },
        ...
      ]
    },
    ...
  ]
}

安装

  1. 克隆此仓库:
git clone https://github.com/wolfyy970/docs-fetch-mcp.git
cd docs-fetch-mcp
  1. 安装依赖项:
npm install
  1. 构建项目:
npm run build
  1. 配置您的MCP设置在您的Claude客户端中:
{
  "mcpServers": {
    "docs-fetch": {
      "command": "node",
      "args": [
        "/path/to/docs-fetch-mcp/build/index.js"
      ],
      "env": {
        "MCP_TRANSPORT": "pipe"
      }
    }
  }
}

依赖项

  • @modelcontextprotocol/sdk:MCP服务器SDK
  • puppeteer:用于网页交互的无头浏览器
  • axios:用于发送请求的HTTP客户端

开发

要在开发模式下运行服务器:

npm run dev

许可证

MIT </中文翻译>