返回市场
星座AI抓取器mcp

星座AI抓取器mcp

作者:shAsh8bit2 星标更新:2025-05-28

项目介绍

@constellix/ai-scraper-mcp

一个模型上下文协议(MCP)服务器,用于从网页中提取结构化数据。此工具通过提供智能接口来填补LLM与网络数据提取之间的空白,从而实现网站抓取。

在线体验

试用平台 → https://constellix.vercel.app/

特性

  • 基于AI的数据提取:使用自然语言查询从网页中提取结构化数据
  • CSS选择器生成:根据自然语言描述生成网页元素的CSS选择器
  • XPath生成:根据自然语言描述生成网页元素的XPath表达式
  • 支持多种查询类型:可以使用自然语言或结构化的类似GraphQL的查询

安装

# 安装并运行
npm i @constellix/ai-scraper-mcp

# 将您的API密钥设置为环境变量
GEMINI_API_KEY="your-api-key-here"

MCP配置:

{
    "mcpServers": {
        "ai-scraper":{
            "command": "npx",
            "args": [
                "-y",
                "@constellix/ai-scraper-mcp"
            ],
            "env": {
                "GEMINI_API_KEY" : "YOUR_API_KEY"
            }
        }
    }
}

然后在您的MCP兼容客户端(如Claude、Cursor等)中,您可以使用ai-scraper工具从网站中提取数据。

可用工具

1. get-data-by-query

使用自然语言或结构化查询语言从网页中提取结构化数据。

输入模式:

{
  "url": "string", // 要从中提取数据的网页URL
  "query": "string" // 自然语言查询或结构化查询
}

2. get-css-selector

使用自然语言或结构化查询语言为网页元素生成CSS选择器。

输入模式:

{
  "url": "string", // 要分析的网页URL
  "query": "string" // 自然语言查询或结构化查询
}

3. get-xpath

使用自然语言或结构化查询语言为网页元素生成XPath表达式。

输入模式:

{
  "url": "string", // 要分析的网页URL
  "query": "string" // 自然语言查询或结构化查询
}

查询类型

自然语言查询

示例:

  • "列出页面上的所有产品"
  • "找到主要导航菜单"
  • "提取所有博客文章标题及其发布时间"

结构化查询(类似于GraphQL)

{
  products_list[]{
    product_name,
    product_price,
    product_image
  }
}

您还可以指定数据类型或添加自然语言描述:

{
  products_list[]{
    product_name (string),
    product_price (number),
    product_image (string)
  }
}

或者带有描述:

{
  products_list (由棉制成的产品)[]{
    product_name,
    product_price,
    product_image
  }
}

依赖项

此包依赖于@constellix/ai-scraper包,该包提供了增强Playwright功能的AI能力。