返回市场
OpenAI光学字符识别MCP

OpenAI光学字符识别MCP

作者:cjus5 星标更新:2025-04-21

项目介绍

OpenAI OCR MCP Server

一个使用OpenAI视觉能力提供OCR(光学字符识别)功能的Model Context Protocol (MCP)服务器。此服务器与Cursor IDE集成,提供从图像中无缝提取文本的功能。

特性

  • 图像文本提取:使用OpenAI的GPT-4.1-mini视觉模型从各种图像格式中提取文本。
  • 自动文本文件创建:自动保存提取的文本及其源图像。
  • 基于内容的文件命名:使用独特的内容哈希进行有序文件管理。
  • 多种图像格式支持:支持JPG、PNG、GIF和WebP格式。
  • 强大的错误处理:全面的验证和错误报告。
  • 详细的日志记录:调试友好的日志记录用于故障排除。

技术细节

视觉模型

  • 使用OpenAI的GPT-4.1-mini模型。
  • 优化了从图像中提取文本的功能。
  • 支持高细节图像分析。
  • 通过OpenAI的视觉API处理图像。

文件处理

  • 自动文本文件创建。
  • 基于内容的哈希生成。
  • 支持多种图像格式。
  • 内置文件大小验证。

安装

  1. 克隆仓库
  2. 安装依赖项:
    npm install
    
  3. 构建TypeScript代码:
    npm run build
    
  4. .env文件中设置您的OpenAI API密钥:
    OPENAI_API_KEY=your_api_key_here
    

使用方法

在Cursor IDE中

  1. 在Cursor设置中配置MCP服务器。
  2. 通过Cursor的命令面板使用OCR工具。
  3. 选择要处理的图像文件。
  4. 提取的文本将会:
    • 显示在Cursor中。
    • 作为文本文件保存在图像旁边。

文本文件输出

对于每个处理过的图像,服务器会创建一个具有以下命名约定的文本文件:

{原始图像名称}-{内容哈希}.txt

示例:

  • 输入图像:document.jpg
  • 输出文件:document-a1b2c3d4.txt

内容哈希是一个从提取的文本生成的独特8位哈希值,确保:

  • 不同文本内容具有唯一的文件名。
  • 源图像和提取文本之间的轻松匹配。
  • 当同一图像产生不同结果时的版本跟踪。

支持的图像格式

  • JPEG/JPG
  • PNG
  • GIF
  • WebP

文件大小限制

  • 最大文件大小:5MB
  • 超过此限制的文件将被拒绝并显示错误消息。

错误处理

服务器提供了常见问题的详细错误消息:

  • 无效的图像格式
  • 文件大小超出限制
  • 文件访问问题
  • API密钥问题
  • 文本提取失败

开发

从源码构建

npm run build

运行测试

npm test

调试

服务器提供了包括以下内容的详细日志:

  • API密钥验证
  • 文件处理步骤
  • 文本提取结果
  • 文件保存操作

环境变量

  • OPENAI_API_KEY:您的OpenAI API密钥(必需)
  • 支持标准(sk-...)和项目特定(sk-proj-...)API密钥。

贡献

欢迎贡献!请随意提交Pull Request。

许可证

MIT许可证 </中文翻译>