返回市场
抓取采集-MCP

抓取采集-MCP

作者:cyberchitta57 星标更新:2025-10-01

项目介绍

scrapling-fetch-mcp

License PyPI version

一个MCP服务器,帮助AI助手从实现机器人检测的网站获取文本内容,弥合了你在浏览器中能看到的内容与AI能访问的内容之间的差距。

使用目的

此工具优化用于从实现机器人检测的网站低量检索文档和参考资料(仅限文本/HTML)。它未被设计或测试用于通用站点抓取或数据采集。

注意:该项目是在与Claude Sonnets 3.7和4.5合作下开发的,并使用了LLM Context

安装

要求

  • Python 3.10+
  • uv 包管理器

安装

# 安装 scrapling-fetch-mcp
uv tool install scrapling-fetch-mcp

# 安装浏览器二进制文件(必需 - 大型下载)
uvx --from scrapling-fetch-mcp scrapling install

重要:浏览器安装会下载数百MB的数据,必须在首次使用前完成。如果MCP服务器在首次使用时超时,浏览器可能仍在后台安装。等待几分钟后再次尝试。

与Claude Desktop设置

将以下配置添加到你的Claude Desktop MCP设置中:

MacOS~/Library/Application Support/Claude/claude_desktop_config.json
Windows%APPDATA%\Claude\claude_desktop_config.json

{
  "mcpServers": {
    "scrapling-fetch": {
      "command": "uvx",
      "args": ["scrapling-fetch-mcp"]
    }
  }
}

更新配置后,请重启Claude Desktop。

功能

此MCP服务器提供了两种工具,当您要求其获取网络内容时,Claude可以自动使用这些工具:

  • 页面抓取:支持分页的完整网页抓取
  • 模式提取:使用正则表达式模式查找并提取特定内容

AI根据您的请求决定使用哪种工具。您只需自然地提问:

"你能获取 https://example.com/api 的文档吗?"
"找到该页面上所有关于'认证'的提及"
"从他们的主页获取安装说明"

防护模式

这些工具支持三种级别的机器人检测绕过:

  • 基础:快速(1-2秒),适用于大多数网站
  • 隐身:中等(3-8秒),处理更多防护
  • 最大隐身:最慢(10+秒),适用于高度保护的网站

Claude默认以基础模式开始,并在需要时升级。

最佳实践提示

  • 自然提问即可 - Claude会处理技术细节
  • 对于大页面,Claude可以自动翻页
  • 对于特定搜索,说明您要找什么,Claude将使用模式匹配
  • 返回的元数据有助于Claude决定是否翻页或搜索

限制

  • 仅设计用于文本内容(文档、文章、参考资料)
  • 不适用于大量抓取或数据采集
  • 可能不适用于需要身份验证的网站
  • 性能因网站复杂性和防护级别而异

基于Scrapling构建,用于具有机器人检测绕过的网络抓取。

许可证

Apache 2.0