项目介绍
基本功能
产品定位
PDF RAG MCP Server 是一个基于 PDF 处理和语义搜索的文档知识库系统,旨在为用户提供高效的文档管理和检索能力。
核心特性
- PDF 文档上传与处理:上传 PDF 文件并自动提取、分块和向量化内容
- 实时处理状态:在文档处理过程中通过 WebSocket 实现实时状态更新
- 语义搜索:在整个已处理文档中进行基于向量的语义搜索
- MCP 协议支持:使用模型上下文协议(Model Context Protocol)与如 Cursor 等 AI 工具集成
- 现代 Web 界面:使用 React/Chakra UI 前端进行文档管理和查询
- 快速依赖管理:使用 uv 进行高效的 Python 依赖管理
适用场景
- 需要管理大量 PDF 文档并进行检索的场景
- 需要将文档知识库与 AI 工具集成的场景
- 需要实时监控文档处理进度的场景
使用教程
先决条件
- Python 3.8 或更高版本
- uv - 快速的 Python 包安装器和解析器
- Git
- Cursor(可选,用于 MCP 集成)
安装指南
-
克隆仓库:
git clone https://github.com/yourusername/PdfRagMcpServer.git
cd PdfRagMcpServer
-
如果尚未安装,请安装 uv:
curl -sS https://astral.sh/uv/install.sh | bash
-
使用 uv 安装依赖项:
uv init .
uv venv
source .venv/bin/activate
uv pip install -r backend/requirements.txt
-
启动应用程序:
uv run run.py
-
访问 Web 界面:http://localhost:8000
调试方法
- 确认端口 8000 没有被其他应用占用
- 检查 WebSocket 连接是否正常工作
- 确保您的 PDF 包含可提取文本
- 查看后端日志以获取详细的错误信息