返回市场
爬虫4AI-MCP服务器

爬虫4AI-MCP服务器

作者:weidwonder121 星标更新:2025-05-14

项目介绍

MseeP.ai 安全评估徽章

Crawl4AI MCP 服务器

smithery 徽章

这是一个基于MCP(模型上下文协议)的智能信息检索服务器,为AI助手系统提供强大的搜索能力和优化的网页内容理解,特别针对LLM进行优化。通过多引擎搜索和智能内容提取,它帮助AI系统高效地获取和理解互联网信息,并将网页内容转换成最适合LLM处理的格式。

特性

  • 🔍 强大的多引擎搜索能力,支持DuckDuckGo和Google
  • 为LLM优化的网页内容提取,智能过滤非核心内容
  • 关注信息价值,自动识别并保留关键内容
  • 📝 多种输出格式,支持引用追踪
  • 🚀 基于FastMCP的高性能异步设计

安装

方法1:大多数安装场景

  1. 确保您的系统满足以下要求:

    • Python >= 3.9
    • 推荐使用专用虚拟环境
  2. 克隆仓库:

git clone https://github.com/yourusername/crawl4ai-mcp-server.git
cd crawl4ai-mcp-server
  1. 创建并激活虚拟环境:
python -m venv crawl4ai_env
source crawl4ai_env/bin/activate  # Linux/Mac
# 或
.\crawl4ai_env\Scripts\activate  # Windows
  1. 安装依赖项:
pip install -r requirements.txt
  1. 安装Playwright浏览器:
playwright install

方法2:通过Smithery安装到Claude桌面客户端

通过Smithery自动配置Crawl4AI MCP Claude桌面服务到您的本地机器Claude 伸展中心根据上述信息,执行以下指令:您是一位负责将中文内容翻译成英文的专业翻译人员,请帮我翻译原始内容

npx -y @smithery/cli install @weidwonder/crawl4ai-mcp-server --client claude

使用说明

服务器提供了以下工具:

搜索

强大的网络搜索工具,支持多个搜索引擎:

  • DuckDuckGo搜索(默认):无需API密钥,全面处理AbstractText、Results和RelatedTopics
  • Google搜索:需要API密钥以提供准确的搜索结果
  • 支持同时使用多个引擎以获得更全面的结果

参数描述:

  • query搜索查询字符串
  • num_results返回的结果数量(默认10)
  • engine搜索引擎选择
    • "duckduckgo":DuckDuckGo搜索(默认)
    • "google":Google搜索(需要API密钥)
    • "all":同时使用所有可用搜索引擎

根据上述信息,执行以下指令:您是一位负责将中文内容翻译成英文的专业翻译人员,请帮我翻译原始内容

# DuckDuckGo搜索(默认)
{
    "query": "python编程",
    "num_results": 5
}

# 使用所有可用引擎
{
    "query": "python编程",
    "num_results": 5,
    "engine": "all"
}

read_url

一种为LLM优化的网页内容理解工具,提供智能内容提取和格式转换:

  • markdown_with_citations:目标语言为英语
  • fit_markdown:基于上述信息,执行以下指令:您是一位负责将中文内容翻译成英文的专业翻译人员,请帮我翻译原始内容
  • raw_markdown:基本HTML→Markdown转换
  • references_markdown:单独的引用/参考文献部分
  • fit_html:为fit_markdown生成过滤后的HTML
  • markdown:基于上述信息,执行以下指令:您是一位负责将中文内容翻译成英文的专业翻译人员,请帮我翻译原始内容

示例:

{
    "url": "https://example.com",
    "format": "markdown_with_citations"
}

根据上述信息,执行以下指令:您是一位负责将中文内容翻译成英文的专业翻译人员,请帮我翻译原始内容

# DuckDuckGo搜索(默认)
{
    "query": "python编程",
    "num_results": 5
}

# Google搜索
{
    "query": "python编程",
    "num_results": 5,
    "engine": "google"
}

如果要使用Google搜索,需要在config.json中配置API密钥:

{
    "google": {
        "api_key": "your-api-key",
        "cse_id": "your-cse-id"
    }
}

LLM内容优化

服务器采用了一系列针对LLM的内容优化策略:

  • 智能内容识别:自动识别并保留文章主体和关键信息段落
  • 噪声过滤:自动过滤导航栏、广告、页脚等对理解无帮助的内容
  • 信息完整性:保留URL引用以支持信息追溯
  • 长度优化:使用最小词数阈值(10)过滤无效段落
  • 格式优化:默认输出格式为markdown_with_citations,便于LLM理解和引用

开发笔记

项目结构:

crawl4ai_mcp_server/
├── src/
│   ├── index.py      # 服务器主实现
│   └── search.py     # 搜索功能实现
├── config_demo.json  # 配置文件示例
├── pyproject.toml    # 项目配置
├── requirements.txt  # 依赖列表
└── README.md         # 项目文档

配置说明

  1. 复制配置示例文件:
cp config_demo.json config.json
  1. 如果要使用Google搜索,需要在config.json中配置API密钥:
{
    "google": {
        "api_key": "your-google-api-key",
        "cse_id": "your-google-cse-id"
    }
}

更新日志

  • 2025.02.08:添加了搜索功能,支持DuckDuckGo(默认)和Google搜索
  • 2025.02.07:重构项目结构,使用FastMCP实现,优化依赖管理
  • 2025.02.07:优化内容过滤配置,提高token效率的同时保持URL完整性

许可证

MIT许可证

贡献

欢迎提交问题和拉取请求!

作者

  • 所有者:weidwonder
  • 编码者:Claude Sonnet 3.5
    • 100%的代码由Claude编写。成本:$9($2用于代码编写,$7用于调试😭)
    • 时间成本:3小时。0.5小时用于代码编写,0.5小时用于环境准备,2小时用于调试。😭

致谢

感谢所有为该项目做出贡献的开发者!

特别感谢:

  • Crawl4ai 该项目为提取网页内容提供了出色的技术支持