返回市场
普瑞斯姆-MCP服务器

普瑞斯姆-MCP服务器

作者:pinkpixel-dev2 星标更新:2025-06-02

项目介绍

MseeP.ai 安全评估徽章

🔍 Prysm MCP 服务器

Prysm MCP(模型上下文协议)服务器使像 Claude 这样的AI助手能够以高精度和灵活性抓取网页内容。

✨ 特性

  • 🎯 多种抓取模式:选择专注(速度)、平衡(默认)或深入(彻底)模式
  • 🧠 内容分析:分析URL以确定最佳抓取方法
  • 📄 格式灵活性:将结果格式化为 Markdown、HTML 或 JSON
  • 🖼️ 图像支持:可选提取甚至下载图像
  • 🔍 智能滚动:配置单页应用程序的滚动行为
  • 📱 响应式:适应不同的网站布局和结构
  • 💾 文件输出:将格式化的结果保存到您首选的目录

🚀 快速开始

安装

# 推荐:安装优化版LLM
npm install -g @pinkpixel/prysm-mcp

# 或者安装标准版
npm install -g prysm-mcp

# 或者克隆并构建
git clone https://github.com/pinkpixel-dev/prysm-mcp.git
cd prysm-mcp
npm install
npm run build

集成指南

我们提供了详细的集成指南,适用于流行的MCP兼容应用:

使用

有多种方式设置 Prysm MCP 服务器:

使用 mcp.json 配置

根据上述指南,在适当位置创建一个 mcp.json 文件。

{
  "mcpServers": {
    "prysm-scraper": {
      "description": "具有自定义输出目录的 Prysm 网页抓取器",
      "command": "npx",
      "args": [
        "-y",
        "@pinkpixel/prysm-mcp"
      ],
      "env": {
        "PRYSM_OUTPUT_DIR": "${workspaceFolder}/scrape_results",
        "PRYSM_IMAGE_OUTPUT_DIR": "${workspaceFolder}/scrape_results/images"
      }
    }
  }
}

🛠️ 工具

服务器提供以下工具:

scrapeFocused

快速网页抓取,优化速度(较少滚动,仅主要内容)。

请使用专注模式抓取 https://example.com

可用参数:

  • url(必需):要抓取的URL
  • maxScrolls(可选):最大滚动尝试次数(默认:5)
  • scrollDelay(可选):滚动之间的延迟(毫秒,默认:1000)
  • scrapeImages(可选):是否在结果中包含图像
  • downloadImages(可选):是否本地下载图像
  • maxImages(可选):最大提取图像数量
  • output(可选):下载图像的输出目录

scrapeBalanced

平衡的网页抓取方法,具有良好的覆盖率和合理的速度。

请使用平衡模式抓取 https://example.com

可用参数:

  • scrapeFocused,但默认值不同
  • maxScrolls 默认:10
  • scrollDelay 默认:2000
  • 添加 timeout 参数以限制总抓取时间(默认:30000毫秒)

scrapeDeep

最大提取网页抓取(较慢但彻底)。

请使用深度模式抓取 https://example.com 并进行最大滚动

可用参数:

  • scrapeFocused,但默认值不同
  • maxScrolls 默认:20
  • scrollDelay 默认:3000
  • maxImages 默认:100

formatResult

将抓取的数据格式化为不同的结构化格式(Markdown、HTML、JSON)。

将抓取的数据格式化为 Markdown

可用参数:

  • data(必需):要格式化的抓取数据
  • format(必需):输出格式 - "markdown"、"html" 或 "json"
  • includeImages(可选):是否在输出中包含图像(默认:true)
  • output(可选):保存格式化结果的文件路径

您还可以通过指定输出路径将格式化的结果保存到文件:

将抓取的数据格式化为 Markdown 并保存到 "my-results/output.md"

⚙️ 配置

输出目录

默认情况下,当保存格式化结果时,文件将保存到 ~/prysm-mcp/output/。您可以按以下两种方式自定义:

  1. 环境变量:设置环境变量到您首选的目录:
# Linux/macOS
export PRYSM_OUTPUT_DIR="/path/to/custom/directory"
export PRYSM_IMAGE_OUTPUT_DIR="/path/to/custom/image/directory"

# Windows (命令提示符)
set PRYSM_OUTPUT_DIR=C:\path\to\custom\directory
set PRYSM_IMAGE_OUTPUT_DIR=C:\path\to\custom\image\directory

# Windows (PowerShell)
$env:PRYSM_OUTPUT_DIR="C:\path\to\custom\directory"
$env:PRYSM_IMAGE_OUTPUT_DIR="C:\path\to\custom\image\directory"
  1. 工具参数:直接调用工具时指定输出路径:
# 对于一般结果
将抓取的数据格式化为 Markdown 并保存到 "/absolute/path/to/file.md"

# 抓取时下载图像
请抓取 https://example.com 并将图像下载到 "/absolute/path/to/images"
  1. MCP 配置:在您的 MCP 配置文件(例如 .cursor/mcp.json)中,可以设置这些环境变量:
{
  "mcpServers": {
    "prysm-scraper": {
      "command": "npx",
      "args": ["-y", "@pinkpixel/prysm-mcp"],
      "env": {
        "PRYSM_OUTPUT_DIR": "${workspaceFolder}/scrape_results",
        "PRYSM_IMAGE_OUTPUT_DIR": "${workspaceFolder}/scrape_results/images"
      }
    }
  }
}

如果未指定 PRYSM_IMAGE_OUTPUT_DIR,它将默认为 PRYSM_OUTPUT_DIR 内的一个名为 images 的子文件夹。

如果您只提供相对路径或文件名,它将相对于配置的输出目录保存。

路径处理规则

formatResult 工具按照以下方式处理路径:

  • 绝对路径:按提供的路径使用(/home/user/file.md
  • 相对路径:相对于配置的输出目录保存(subfolder/file.md
  • 仅文件名:保存在配置的输出目录中(output.md
  • 目录路径:如果路径指向一个目录,则基于内容和时间戳自动生成文件名

🏗️ 开发

# 安装依赖
npm install

# 构建项目
npm run build

# 在本地运行服务器
node bin/prysm-mcp

# 调试 MCP 通信
DEBUG=mcp:* node bin/prysm-mcp

# 设置自定义输出目录
PRYSM_OUTPUT_DIR=./my-output PRYSM_IMAGE_OUTPUT_DIR=./my-output/images node bin/prysm-mcp

通过 npx 运行

您可以直接使用 npx 运行服务器而不进行安装:

# 使用默认设置运行
npx @pinkpixel/prysm-mcp

# 使用自定义输出目录运行
PRYSM_OUTPUT_DIR=./my-output PRYSM_IMAGE_OUTPUT_DIR=./my-output/images npx @pinkpixel/prysm-mcp

📋 许可证

MIT

🙏 致谢

Pink Pixel 开发

Model Context ProtocolPuppeteer 提供技术支持