返回市场
媒体爬虫_mcp_服务器

媒体爬虫_mcp_服务器

作者:Bowenwin34 星标更新:2025-08-02

项目介绍

🔥 MediaCrawler_MCP_Server - MediaCrawler 的 MCP 服务器 🕷️

🔗 MediaCrawler 仓库地址

https://github.com/NanmiCoder/MediaCrawler

🔧 基于 MediaCrawler 的改进

  • Python 版本:所有包版本适用于 Python 3.13,以支持 MCP 的使用。
  • MySQL 存储:如果表已存在,初始化不会覆盖原始数据。

✨ 更多设置(配置)可以在 MediaCrawler 仓库中找到。

🧰 可用的 MCP 工具

  1. crawl_search(platform: str, store_type: str, keywords: str) - 根据关键词启动媒体平台的爬虫。
  2. crawl_detail(platform: str, store_type: str, video_id: list) - 根据视频ID启动媒体平台的爬虫。
  3. crawl_creator(platform: str, store_type: str, creator_id: list) - 根据创作者ID启动媒体平台的爬虫。

📦 Python 包安装

# 进入项目目录
cd MediaCrawler_MCP_Server

# 使用 uv sync 命令来保证 Python 版本和相关依赖包的一致性
uv sync

🌐 浏览器驱动安装

# 安装浏览器驱动
uv run playwright install

⚙️ 设置

设置环境变量:

MYSQL_DB_HOST=localhost     # 数据库主机
MYSQL_DB_PORT=3306         # 可选:数据库端口(未指定时默认为 3306)
MYSQL_DB_USER=your_username
MYSQL_DB_PWD=your_password
MYSQL_DB_NAME=your_database
CRAWLER_MAX_NOTES_COUNT=20 # 想要爬取的笔记数量
MAX_CONCURRENCY_NUM=1 # 并发爬虫的数量
ENABLE_GET_COMMENTS=true # 是否爬取评论

🚀 使用

添加到 claude_desktop_config.jsoncline_mcp_settings.json

"mediacrawler": {
      "disabled": false,
      "timeout": 600,
      "type": "stdio",
      "command": "uv",
      "args": [
        "--directory",
        "path/to/MediaCrawler_MCP_Server",
        "run",
        "main.py"
      ],
      "env": {
        "MYSQL_DB_HOST": "localhost",
        "MYSQL_DB_PORT": "3306",
        "MYSQL_DB_USER": "your_username",
        "MYSQL_DB_NAME": "your_database",
        "MYSQL_DB_PWD": "your_password",
        "CRAWLER_MAX_NOTES_COUNT": "20",
        "MAX_CONCURRENCY_NUM": "1",
        "ENABLE_GET_COMMENTS": "true"
      }
  }

🌰 示例

  1. 帮我爬取b站视频资料,关键词为"钱",存储模式为mysql。
  2. 帮我爬取b站视频号为BV1d54y1g7db,BV1Sz4y1U77N的视频存储模式为json。
  3. 帮我爬取b站up主视频资料,其id为20813884,存储模式为csv。