返回市场
MCP服务器

MCP服务器

作者:DefiBax6 星标更新:2025-03-22

项目介绍

音频录音MCP服务器

这是一个用于录制音频并使用OpenAI的Whisper模型进行转录的MCP服务器。设计为Goose自定义扩展或独立的MCP服务器。

特性

  • 从默认麦克风录制音频
  • 使用Whisper对录音进行转录
  • 作为自定义扩展与Goose AI代理集成
  • 包含常见录音场景的提示

安装

# 从源代码安装
git clone https://github.com/DefiBax/voice-recorder-mcp.git
cd voice-recorder-mcp
pip install -e .

使用方法

作为独立的MCP服务器

# 使用默认设置运行(base.en模型)
voice-recorder-mcp

# 使用特定的Whisper模型
voice-recorder-mcp --model medium.en

# 调整采样率
voice-recorder-mcp --sample-rate 44100

使用MCP Inspector测试

MCP Inspector提供了一个交互界面来测试您的服务器:

# 安装MCP Inspector
npm install -g @modelcontextprotocol/inspector

# 使用检查器运行您的服务器
npx @modelcontextprotocol/inspector voice-recorder-mcp

与Goose AI代理一起使用

  1. 打开Goose并进入设置 > 扩展 > 添加 > 命令行扩展

  2. 将名称设置为voice-recorder

  3. 在命令字段中输入voice-recorder-mcp可执行文件的完整路径:

    /full/path/to/voice-recorder-mcp
    

    或者对于特定模型:

    /full/path/to/voice-recorder-mcp --model medium.en
    

    要找到路径,请运行:

    which voice-recorder-mcp
    
  4. 基本功能不需要环境变量

  5. 开始与Goose的对话,并介绍录音器: "我希望您能根据voice-recorder返回的转录内容采取行动。例如,如果我口述一个计算如1+1,请返回结果。"

可用工具

  • start_recording: 开始从默认麦克风录制音频
  • stop_and_transcribe: 停止录制并将音频转录为文本
  • record_and_transcribe: 录制指定时长的音频并进行转录

Whisper模型

此扩展支持各种大小的Whisper模型:

模型速度准确度内存占用使用场景
tiny.en最快最低最小测试、快速转录
base.en日常使用(默认)
small.en中等更好中等好的平衡
medium.en重要录音
large最慢最高非常高关键转录

.en后缀表示专用于英语的模型,这些模型在处理英语内容时更快更准确。

要求

  • Python 3.12+
  • 音频输入设备(麦克风)

配置

您可以使用环境变量配置服务器:

# 设置Whisper模型
export WHISPER_MODEL=small.en

# 设置音频采样率
export SAMPLE_RATE=44100

# 设置最大录音时长(秒)
export MAX_DURATION=120

# 然后运行服务器
voice-recorder-mcp

故障排除

常见问题

  • 没有音频被录制:检查您的麦克风权限和设置
  • 模型下载错误:确保初始模型下载时有稳定的网络连接
  • 与Goose集成:确保命令路径正确
  • 音频质量问题:尝试调整采样率(默认:16000)

贡献

欢迎贡献!请随意提交Pull Request。

  1. 分叉仓库
  2. 创建您的功能分支(git checkout -b feature/amazing-feature
  3. 提交更改(git commit -m '添加一些精彩的功能'
  4. 推送到分支(git push origin feature/amazing-feature
  5. 打开Pull Request

许可证

本项目采用MIT许可证 - 详情请参阅LICENSE文件。