这是一个提供从各种视频平台和音频文件中提取文本能力的MCP服务器。该服务器通过实现模型上下文协议(MCP)来提供对音频转录服务的标准访问。
此服务支持从多个平台下载视频并提取音频,包括但不限于:
完整的支持平台列表,请访问yt-dlp 支持站点。
该项目利用OpenAI的Whisper模型通过MCP工具进行音频到文本处理。服务器暴露了四个主要工具:
此服务器是使用模型上下文协议构建的,它提供了:
**重要:**首次运行时,系统会自动下载Whisper模型文件(约1GB)。根据您的网络条件,此过程可能需要几分钟到几十分钟。模型文件会被缓存到本地,后续运行无需再次下载。
使用uv不需要特定安装。我们将使用uvx直接运行视频提取服务器:
curl -LsSf https://astral.sh/uv/install.sh | sh
FFmpeg是音频处理所需的。您可以通过多种方法安装它:
# Ubuntu或Debian
sudo apt update && sudo apt install ffmpeg
# Arch Linux
sudo pacman -S ffmpeg
# MacOS
brew install ffmpeg
# Windows(使用Chocolatey)
choco install ffmpeg
# Windows(使用Scoop)
scoop install ffmpeg
在您的Claude/Cursor设置中添加:
"mcpServers": {
"video-extraction": {
"command": "uvx",
"args": ["mcp-video-extraction"]
}
}
服务可以通过环境变量进行配置:
WHISPER_MODEL:Whisper模型大小(tiny/base/small/medium/large),默认值:'base'WHISPER_LANGUAGE:转录的语言设置,默认值:'auto'YOUTUBE_FORMAT:下载的视频格式,默认值:'bestaudio'AUDIO_FORMAT:提取的音频格式,默认值:'mp3'AUDIO_QUALITY:音频质量设置,默认值:'112'TEMP_DIR:临时文件存储位置,默认值:'/tmp/mcp-video'DOWNLOAD_RETRIES:下载重试次数,默认值:10FRAGMENT_RETRIES:片段下载重试次数,默认值:10SOCKET_TIMEOUT:套接字超时时间(秒),默认值:30GPU加速:
模型尺寸调整:
使用SSD存储临时文件以提高I/O性能
此服务器可以与任何兼容MCP的客户端一起使用,例如:
有关MCP的更多信息,请访问模型上下文协议。
中文版文档,请参阅README_zh.md
MIT