项目介绍
OpenAI OCR MCP Server
一个使用OpenAI视觉能力提供OCR(光学字符识别)功能的Model Context Protocol (MCP)服务器。此服务器与Cursor IDE集成,提供从图像中无缝提取文本的功能。
特性
- 图像文本提取:使用OpenAI的GPT-4.1-mini视觉模型从各种图像格式中提取文本。
- 自动文本文件创建:自动保存提取的文本及其源图像。
- 基于内容的文件命名:使用独特的内容哈希进行有序文件管理。
- 多种图像格式支持:支持JPG、PNG、GIF和WebP格式。
- 强大的错误处理:全面的验证和错误报告。
- 详细的日志记录:调试友好的日志记录用于故障排除。
技术细节
视觉模型
- 使用OpenAI的GPT-4.1-mini模型。
- 优化了从图像中提取文本的功能。
- 支持高细节图像分析。
- 通过OpenAI的视觉API处理图像。
文件处理
- 自动文本文件创建。
- 基于内容的哈希生成。
- 支持多种图像格式。
- 内置文件大小验证。
安装
- 克隆仓库
- 安装依赖项:
npm install
- 构建TypeScript代码:
npm run build
- 在
.env文件中设置您的OpenAI API密钥:
OPENAI_API_KEY=your_api_key_here
使用方法
在Cursor IDE中
- 在Cursor设置中配置MCP服务器。
- 通过Cursor的命令面板使用OCR工具。
- 选择要处理的图像文件。
- 提取的文本将会:
- 显示在Cursor中。
- 作为文本文件保存在图像旁边。
文本文件输出
对于每个处理过的图像,服务器会创建一个具有以下命名约定的文本文件:
{原始图像名称}-{内容哈希}.txt
示例:
- 输入图像:
document.jpg
- 输出文件:
document-a1b2c3d4.txt
内容哈希是一个从提取的文本生成的独特8位哈希值,确保:
- 不同文本内容具有唯一的文件名。
- 源图像和提取文本之间的轻松匹配。
- 当同一图像产生不同结果时的版本跟踪。
支持的图像格式
文件大小限制
- 最大文件大小:5MB
- 超过此限制的文件将被拒绝并显示错误消息。
错误处理
服务器提供了常见问题的详细错误消息:
- 无效的图像格式
- 文件大小超出限制
- 文件访问问题
- API密钥问题
- 文本提取失败
开发
从源码构建
npm run build
运行测试
npm test
调试
服务器提供了包括以下内容的详细日志:
- API密钥验证
- 文件处理步骤
- 文本提取结果
- 文件保存操作
环境变量
OPENAI_API_KEY:您的OpenAI API密钥(必需)
- 支持标准(
sk-...)和项目特定(sk-proj-...)API密钥。
贡献
欢迎贡献!请随意提交Pull Request。
许可证
MIT许可证
</中文翻译>