
这是一个使用浏览器自动化、OCR以及多种提取方法提供网页内容抓取能力的模型上下文协议服务器。该服务器使LLMs能够从网页中检索和处理内容,即使这些网页需要JavaScript渲染或使用了防止简单抓取的技术。
fetch - 使用浏览器自动化和多方法提取(包括OCR)从互联网上抓取一个URL。
url (字符串,必需):要抓取的URLraw (布尔值,可选):获取请求页面的实际HTML内容,不进行简化(默认:false)服务器使用多种方法来提取内容:
服务器采用复杂的评分系统来选择最佳结果,考虑以下因素:
基础内容得分(最高50分)
结构加分(最高20分)
质量扣分
评分系统确保无论使用哪种提取方法,都能选出最可靠和高质量的内容。调试日志可用于跟踪评分决策。
url (字符串,必需):要抓取的URL要使用Docker安装并运行mcp-server-fetch,请按照以下步骤操作:
构建Docker镜像:
docker build -t mcp-server-fetch .
运行Docker容器:
docker run --rm -i mcp-server-fetch
在您的Claude设置中添加:
{
"mcpServers": {
"fetch": {
"command": "docker",
"args": [
"run",
"--rm",
"-i",
"mcp-server-fetch"
],
"disabled": false,
"alwaysAllow": []
}
}
}
默认情况下,根据请求是否来自模型(通过工具),或者是由用户发起(通过提示),服务器将使用以下用户代理之一:
ModelContextProtocol/1.0 (Autonomous; +https://github.com/modelcontextprotocol/servers)
或
ModelContextProtocol/1.0 (User-Specified; +https://github.com/modelcontextprotocol/servers)
可以通过在配置中的args列表中添加参数--user-agent=YourUserAgent来自定义用户代理。
服务器现在包括高级内容提取功能:
我们鼓励贡献以帮助扩展和改进mcp-server-fetch。无论是希望添加新工具、增强现有功能,还是改善文档,您的意见都是宝贵的。
有关其他MCP服务器和实现模式的例子,请参见: https://github.com/modelcontextprotocol/servers
欢迎提交拉取请求!请自由地提出新想法、修复bug或改进,使mcp-server-fetch更加强大和有用。
mcp-server-fetch在MIT许可下发布。这意味着您可以在遵守MIT许可条款和条件的情况下自由使用、修改和分发软件。更多详情,请参阅项目存储库中的LICENSE文件。