返回市场
MCP网页抓取器

MCP网页抓取器

作者:navin40784 星标更新:2025-06-10

项目介绍

增强型MCP网页抓取器

一款功能强大且具有高级隐身特性和防检测能力的MCP服务器。

✨ 增强特性

🛡️ 隐身与防检测

  • 用户代理轮换:循环使用真实的浏览器用户代理
  • 高级头部信息:通过适当的头部信息模拟真实浏览器行为
  • 请求定时:随机延迟以显得像人类操作
  • 会话管理:持久会话并正确处理cookie
  • 重试逻辑:智能重试策略,带有退避机制

🔧 内容处理

  • 智能编码检测:自动检测并处理不同的文本编码
  • 多种解析策略:通过不同的解析方法进行回退
  • 内容清理:移除乱码并规范化内容
  • HTML实体解码:正确处理HTML实体和特殊字符

🌐 提取能力

  • 增强文本提取:更好地过滤和清理文本内容
  • 智能链接处理:将相对URL转换为绝对URL,并筛选外部链接
  • 图像元数据:提取全面的图像信息
  • 文章内容检测:识别并提取主要文章内容
  • 综合元数据:提取Open Graph、Twitter Cards、Schema.org数据

🕷️ 爬虫特性

  • 深度限制爬行:根据可配置的深度限制爬行网站
  • 内容聚焦爬行:针对特定类型的内容(文章、产品)
  • 速率限制:内置延迟以避免过载服务器
  • 域名过滤:保持在目标域名边界内

🚀 可用工具

1. scrape_website_enhanced

增强型网络抓取,具备隐身特性和多种提取类型。

参数:

  • url(必需):要抓取的URL
  • extract_type: "text","links","images","metadata" 或 "all"
  • use_javascript:启用JavaScript渲染(默认:true)
  • stealth_mode:启用隐身特性(默认:true)
  • max_pages:最大处理页面数(默认:5)
  • crawl_depth:爬行深度(默认:0)

2. extract_article_content

从网页中智能提取主要内容。

参数:

  • url(必需):要提取内容的URL
  • use_javascript:启用JavaScript渲染(默认:true)

3. extract_comprehensive_metadata

提取所有可用的元数据,包括SEO、社交媒体和技术数据。

参数:

  • url(必需):要提取元数据的URL
  • include_technical:包含技术元数据(默认:true)

4. crawl_website_enhanced

具备隐身特性和内容过滤的高级网站爬行。

参数:

  • url(必需):爬行的起始URL
  • max_pages:最大爬行页面数(默认:1[END_OF_TEXT]