返回市场
视频提取服务器

视频提取服务器

作者:SealinGp6 星标更新:2025-05-27

项目介绍

MCP 视频与音频文本提取服务器

这是一个提供从各种视频平台和音频文件中提取文本能力的MCP服务器。该服务器通过实现模型上下文协议(MCP)来提供对音频转录服务的标准访问。

支持的平台

此服务支持从多个平台下载视频并提取音频,包括但不限于:

  • YouTube
  • Bilibili
  • TikTok
  • Instagram
  • Twitter/X
  • Facebook
  • Vimeo
  • Dailymotion
  • SoundCloud

完整的支持平台列表,请访问yt-dlp 支持站点

核心技术

该项目利用OpenAI的Whisper模型通过MCP工具进行音频到文本处理。服务器暴露了四个主要工具:

  1. 视频下载:从支持的平台上下载视频
  2. 音频下载:从支持的平台上提取视频中的音频
  3. 视频文本提取:从视频中提取文本(下载并转录)
  4. 音频文件文本提取:从音频文件中提取文本

MCP集成

此服务器是使用模型上下文协议构建的,它提供了:

  • 向LLMs公开工具的标准方式
  • 对视频内容和音频文件的安全访问
  • 与MCP客户端如Claude Desktop的集成

特性

  • 基于Whisper的高质量语音识别
  • 多语言文本识别
  • 支持多种音频格式(mp3、wav、m4a等)
  • 符合MCP标准的工具接口
  • 大文件异步处理

技术栈

  • Python 3.10+
  • 模型上下文协议(MCP)Python SDK
  • yt-dlp(YouTube视频下载)
  • openai-whisper(核心音频到文本引擎)
  • pydantic

系统需求

  • FFmpeg(音频处理所需)
  • 最低8GB内存
  • 推荐GPU加速(NVIDIA GPU + CUDA)
  • 足够的磁盘空间(用于模型下载和临时文件)

首次运行重要通知

**重要:**首次运行时,系统会自动下载Whisper模型文件(约1GB)。根据您的网络条件,此过程可能需要几分钟到几十分钟。模型文件会被缓存到本地,后续运行无需再次下载。

安装

使用uv(推荐)

使用uv不需要特定安装。我们将使用uvx直接运行视频提取服务器:

curl -LsSf https://astral.sh/uv/install.sh | sh

安装FFmpeg

FFmpeg是音频处理所需的。您可以通过多种方法安装它:

# Ubuntu或Debian
sudo apt update && sudo apt install ffmpeg

# Arch Linux
sudo pacman -S ffmpeg

# MacOS
brew install ffmpeg

# Windows(使用Chocolatey)
choco install ffmpeg

# Windows(使用Scoop)
scoop install ffmpeg

使用

配置Claude/Cursor

在您的Claude/Cursor设置中添加:

"mcpServers": {
  "video-extraction": {
    "command": "uvx",
    "args": ["mcp-video-extraction"]
  }
}

可用的MCP工具

  1. 视频下载:从支持的平台上下载视频
  2. 音频下载:从支持的平台上提取视频中的音频
  3. 视频文本提取:从视频中提取文本(下载并转录)
  4. 音频文件文本提取:从音频文件中提取文本

配置

服务可以通过环境变量进行配置:

Whisper配置

  • WHISPER_MODEL:Whisper模型大小(tiny/base/small/medium/large),默认值:'base'
  • WHISPER_LANGUAGE:转录的语言设置,默认值:'auto'

YouTube下载配置

  • YOUTUBE_FORMAT:下载的视频格式,默认值:'bestaudio'
  • AUDIO_FORMAT:提取的音频格式,默认值:'mp3'
  • AUDIO_QUALITY:音频质量设置,默认值:'112'

存储配置

  • TEMP_DIR:临时文件存储位置,默认值:'/tmp/mcp-video'

下载设置

  • DOWNLOAD_RETRIES:下载重试次数,默认值:10
  • FRAGMENT_RETRIES:片段下载重试次数,默认值:10
  • SOCKET_TIMEOUT:套接字超时时间(秒),默认值:30

性能优化提示

  1. GPU加速:

    • 安装CUDA和cuDNN
    • 确保已安装PyTorch的GPU版本
  2. 模型尺寸调整:

    • tiny:最快但准确率较低
    • base:速度和准确率平衡
    • large:最高准确率但需要更多资源
  3. 使用SSD存储临时文件以提高I/O性能

注意事项

  • Whisper模型(约1GB)需要在首次运行时下载
  • 确保有足够的磁盘空间用于临时音频文件
  • 下载YouTube视频需要稳定的网络连接
  • 推荐使用GPU以加快音频处理速度
  • 处理长视频可能需要较长时间

MCP集成指南

此服务器可以与任何兼容MCP的客户端一起使用,例如:

  • Claude Desktop
  • 自定义MCP客户端
  • 其他启用MCP的应用程序

有关MCP的更多信息,请访问模型上下文协议

文档

中文版文档,请参阅README_zh.md

许可证

MIT