返回市场
MCP网页抓取器

MCP网页抓取器

作者:lmorg2 星标更新:2025-07-20

项目介绍

mcp-web-scraper

此包使用Google Chrome的无头API来抓取网页供AI/LLM代理使用。

由于它默认使用Chrome作为用户代理,因此任何需要JavaScript(例如单页应用程序)的网站也应可以通过此工具进行解析。

它支持通过Go(Go语言)使用LangChainGo调用,或作为MCP服务器运行。

MCP服务器

首先使用go编译代码:

go build .

Claude桌面

{
  "mcpServers": {
    "mcp-web-scraper": {
      "command": "/path/to/mcp-web-scraper",
      "args": []
    }
  }
}

Visual Studio Code

{
  "mcp": {
    "servers": {
      "mcp-web-scraper": {
        "command": "/path/to/mcp-web-scraper",
        "args": []
      }
    }
  }
}

LangChainGo工具

集成到langchain非常简单:

import 	"github.com/lmorg/mcp-web-scraper/langchain"

func example() {
    scraper := langchain.NewScraper()
}

请参阅langchaingo文档了解如何使用其库中的工具。

备用模式

如果未安装Google Chrome

如果您没有安装Google Chrome,那么mcp-web-scraper将回退到使用Go的HTTP用户代理。

这在大多数情况下都能工作,但您可能无法获取需要JavaScript渲染的网站内容。

Markdown支持

默认情况下,此模块会查找<article>并将其转换为Markdown。

如果页面没有呈现为某种描述的文章(例如不是博客、技术文档等),则此模块将回退到返回HTML。

返回的任何HTML文档都会移除特定的HTML标签(如<script><svg>和HTML注释),以减少LLM解析所需的标记。