返回市场
mcp服务器获取

mcp服务器获取

作者:MaartenSmeets10 星标更新:2025-06-11

项目介绍

获取MCP服务器

Fetch MCP Logo

这是一个使用浏览器自动化、OCR以及多种提取方法提供网页内容抓取能力的模型上下文协议服务器。该服务器使LLMs能够从网页中检索和处理内容,即使这些网页需要JavaScript渲染或使用了防止简单抓取的技术。

可用工具

  • fetch - 使用浏览器自动化和多方法提取(包括OCR)从互联网上抓取一个URL。
    • url (字符串,必需):要抓取的URL
    • raw (布尔值,可选):获取请求页面的实际HTML内容,不进行简化(默认:false)

服务器使用多种方法来提取内容:

  1. 使用undetected-chromedriver进行浏览器自动化
  2. 使用pytesseract并带有布局检测的OCR
  3. 使用requests/BeautifulSoup进行HTML提取
  4. 文档解析(PDF、DOCX、PPTX)
  5. 原始markdown转换方法

服务器采用复杂的评分系统来选择最佳结果,考虑以下因素:

  1. 基础内容得分(最高50分)

    • 根据内容长度给予分数(每100个字符1分,最多50分)
    • 对极短的内容(<100个字符)进行扣分
  2. 结构加分(最高20分)

    • 对具有良好段落结构的内容给予分数
    • 更多的段落表明更好的内容组织
  3. 质量扣分

    • 检测并扣分错误消息
    • 对包含错误指示器的内容降低分数
    • 验证内容结构和可读性

评分系统确保无论使用哪种提取方法,都能选出最可靠和高质量的内容。调试日志可用于跟踪评分决策。

提示

  • fetch
    • 抓取一个URL并使用浏览器自动化将其内容提取为markdown
    • 参数:
      • url (字符串,必需):要抓取的URL

安装

使用Docker

要使用Docker安装并运行mcp-server-fetch,请按照以下步骤操作:

  1. 构建Docker镜像:

    docker build -t mcp-server-fetch .
    
  2. 运行Docker容器:

    docker run --rm -i mcp-server-fetch
    

配置

配置Roo Code或Claude应用

在您的Claude设置中添加:

{
  "mcpServers": {
    "fetch": {
      "command": "docker",
      "args": [
        "run",
        "--rm",
        "-i",
        "mcp-server-fetch"
      ],
      "disabled": false,
      "alwaysAllow": []
    }
  }
}

自定义 - 用户代理

默认情况下,根据请求是否来自模型(通过工具),或者是由用户发起(通过提示),服务器将使用以下用户代理之一:

ModelContextProtocol/1.0 (Autonomous; +https://github.com/modelcontextprotocol/servers)

ModelContextProtocol/1.0 (User-Specified; +https://github.com/modelcontextprotocol/servers)

可以通过在配置中的args列表中添加参数--user-agent=YourUserAgent来自定义用户代理。

浏览器自动化和OCR

服务器现在包括高级内容提取功能:

  • 自动处理cookie同意横幅
  • 全页截图捕获
  • 使用pytesseract并带有布局检测的OCR
  • 多种提取方法,并自动选择最佳结果

贡献

我们鼓励贡献以帮助扩展和改进mcp-server-fetch。无论是希望添加新工具、增强现有功能,还是改善文档,您的意见都是宝贵的。

有关其他MCP服务器和实现模式的例子,请参见: https://github.com/modelcontextprotocol/servers

欢迎提交拉取请求!请自由地提出新想法、修复bug或改进,使mcp-server-fetch更加强大和有用。

许可

mcp-server-fetch在MIT许可下发布。这意味着您可以在遵守MIT许可条款和条件的情况下自由使用、修改和分发软件。更多详情,请参阅项目存储库中的LICENSE文件。