返回市场
pdf知识检索mcp服务器

pdf知识检索mcp服务器

作者:hyson66620 星标更新:2025-05-23

项目介绍

基本功能

产品定位

PDF RAG MCP Server 是一个基于 PDF 处理和语义搜索的文档知识库系统,旨在为用户提供高效的文档管理和检索能力。

核心特性

  • PDF 文档上传与处理:上传 PDF 文件并自动提取、分块和向量化内容
  • 实时处理状态:在文档处理过程中通过 WebSocket 实现实时状态更新
  • 语义搜索:在整个已处理文档中进行基于向量的语义搜索
  • MCP 协议支持:使用模型上下文协议(Model Context Protocol)与如 Cursor 等 AI 工具集成
  • 现代 Web 界面:使用 React/Chakra UI 前端进行文档管理和查询
  • 快速依赖管理:使用 uv 进行高效的 Python 依赖管理

适用场景

  • 需要管理大量 PDF 文档并进行检索的场景
  • 需要将文档知识库与 AI 工具集成的场景
  • 需要实时监控文档处理进度的场景

使用教程

先决条件

  • Python 3.8 或更高版本
  • uv - 快速的 Python 包安装器和解析器
  • Git
  • Cursor(可选,用于 MCP 集成)

安装指南

  1. 克隆仓库:

    git clone https://github.com/yourusername/PdfRagMcpServer.git
    cd PdfRagMcpServer
    
  2. 如果尚未安装,请安装 uv:

    curl -sS https://astral.sh/uv/install.sh | bash
    
  3. 使用 uv 安装依赖项:

    uv init .
    uv venv
    source .venv/bin/activate
    uv pip install -r backend/requirements.txt
    
  4. 启动应用程序:

    uv run run.py
    
  5. 访问 Web 界面:http://localhost:8000

调试方法

  • 确认端口 8000 没有被其他应用占用
  • 检查 WebSocket 连接是否正常工作
  • 确保您的 PDF 包含可提取文本
  • 查看后端日志以获取详细的错误信息