返回市场
提取者-mcp

提取者-mcp

作者:fitzlf2 星标更新:2025-07-18

项目介绍

Extractous MCP Server

用于通过extractous库从各种文件格式中提取文本的模型上下文协议(MCP)服务器。

特性

  • 从多种文件格式(PDF、DOCX、HTML、带有OCR的图像、带有语音转文字的音频/视频)中提取文本
  • 获取文件元数据以及提取的文本
  • 支持MIME类型覆盖
  • 列出支持的文件格式

安装

# 安装依赖
uv pip install -e .

# 或者使用pip
pip install extractous-mcp

使用方法

作为MCP服务器

# 运行服务器
extractous-mcp

# 或者直接运行
python -m extractous_mcp.server

可用工具

  1. extract_text

    • 从文件中提取文本
    • 参数:file_path(必需),mime_type(可选)
  2. extract_text_with_metadata

    • 从文件中提取文本和元数据
    • 参数:file_path(必需),mime_type(可选)
  3. get_supported_formats

    • 获取支持的文件格式列表
    • 无参数

示例用法

# 从PDF文件中提取文本
extract_text("/path/to/document.pdf")

# 使用特定的MIME类型提取
extract_text("/path/to/file", mime_type="application/pdf")

# 获取带有元数据的文本
extract_text_with_metadata("/path/to/document.docx")

# 检查支持的格式
get_supported_formats()

支持的格式

  • 文档:PDF、DOC、DOCX、RTF、ODT
  • 电子表格:XLS、XLSX、ODS、CSV
  • 演示文稿:PPT、PPTX、ODP
  • 网页:HTML、HTM、XML
  • 文本:TXT、MD、JSON、YAML、YML
  • 图像:JPG、JPEG、PNG、TIFF、BMP、GIF(带OCR)
  • 音频:MP3、WAV、FLAC、M4A、OGG(语音转文字)
  • 视频:MP4、AVI、MOV、MKV、WEBM

开发

# 在开发模式下安装
uv pip install -e .

# 运行测试
python -m pytest tests/