返回市场
网页爬虫API-MCP

网页爬虫API-MCP

作者:WebCrawlerAPI2 星标更新:2025-09-11

项目介绍

WebcrawlerAPI MCP Server

WebcrawlerAPI 是一个强大的网络抓取和网站爬行服务,允许您轻松地从任何网站提取数据。

此 MCP(模型上下文协议)服务器将 WebcrawlerAPI 的抓取功能直接集成到兼容 MCP 的应用程序中,如 Claude Code,从而实现与您的 AI 工作流程的集成。您可以从 WebcrawlerAPI 控制台 开始使用您的免费 API 密钥。

配置

  1. WebcrawlerAPI 控制台 获取您的 API 密钥。
  2. 设置环境变量:
    export WEBCRAWLER_API_KEY="your-api-key-here"
    

在 Claude Code 中使用

使用 npx 将此服务器添加到您的 Claude Code 配置中:

npx webcrawler-mcp

或者将其添加到您的 MCP 设置配置中:

{
  "mcpServers": {
    "webcrawler": {
      "command": "npx",
      "args": ["-y", "webcrawler-mcp"],
      "env": {
        "WEBCRAWLER_API_KEY": "your-api-key-here"
      }
    }
  }
}

可用工具

webcrawler-scrape

从任何网页抓取内容并以 Markdown 格式返回。

参数:

  • url(必需):要抓取的网页的 URL
  • prompt(可选):用于从页面中提取特定信息的可选提示

示例用法:

使用 webcrawler-scrape 工具获取 https://example.com 的内容

带有提示进行有针对性的提取:

使用 webcrawler-scrape 工具抓取 https://news.ycombinator.com,并使用提示“提取所有文章标题及其对应的 URL”

该工具将以 Markdown 格式返回抓取的内容,包括页面标题和 HTTP 状态码。当使用提示时,API 将专注于提取您请求的具体信息。

作为独立应用运行

您也可以将服务器作为独立应用程序运行:

通过 npm

npm install
npm run build
npm start

通过 npx

npx webcrawler-mcp

HTTP 模式

要在 HTTP 模式下运行而不是 stdio:

USE_HTTP=true npx webcrawler-mcp
# 或
npm run start:http

HTTP 服务器默认在端口 8080 上启动,具有以下端点:

  • 健康检查:http://localhost:8080/health
  • MCP 端点:http://localhost:8080/mcp

环境变量

  • WEBCRAWLER_API_KEY:您的 WebcrawlerAPI.com API 密钥(必需)
  • USE_HTTP:设置为 "true" 使用 HTTP 传输而不是 stdio
  • PORT:HTTP 服务器端口(默认:8080)

开发

npm install
npm run dev  # 监视模式
npm run build