S

SealinGp

speech-processingmultimedia-processing

14 查看 · 2026-07-07 更新

MCP 视频与音频文本提取服务器

这是一个提供从各种视频平台和音频文件中提取文本功能的MCP服务器。该服务器实现了模型上下文协议(MCP),以提供对音频转录服务的标准化访问。

支持的平台

本服务支持从多个平台下载视频并从中提取音频,包括但不限于:

  • YouTube
  • Bilibili
  • TikTok
  • Instagram
  • Twitter/X
  • Facebook
  • Vimeo
  • Dailymotion
  • SoundCloud

完整的支持平台列表,请访问 yt-dlp 支持的站点

核心技术

该项目通过MCP工具使用OpenAI的Whisper模型进行音频到文本的处理。服务器公开了四个主要工具:

  1. 视频下载:从支持的平台上下载视频
  2. 音频下载:从支持平台上的视频中提取音频
  3. 视频文本提取:从视频中提取文本(下载并转录)
  4. 音频文件文本提取:从音频文件中提取文本

MCP集成

此服务器基于模型上下文协议构建,提供了:

  • 向大型语言模型暴露工具的标准方式
  • 对视频内容和音频文件的安全访问
  • 与如Claude Desktop等MCP客户端的集成

功能特点

  • 基于Whisper的高质量语音识别
  • 多语言文本识别
  • 支持多种音频格式(mp3, wav, m4a等)
  • 符合MCP标准的工具接口
  • 异步处理大文件

技术栈

  • Python 3.10+
  • 模型上下文协议(MCP)Python SDK
  • yt-dlp (YouTube视频下载)
  • openai-whisper (核心音频到文本引擎)
  • pydantic

系统要求

  • FFmpeg(音频处理必需)
  • 至少8GB RAM
  • 推荐GPU加速(NVIDIA GPU + CUDA)
  • 足够的磁盘空间(用于模型下载及临时文件)

首次运行重要提示

重要: 在首次运行时,系统将自动下载Whisper模型文件(约1GB)。根据您的网络状况,这一过程可能需要几分钟到几十分钟不等。模型文件会被本地缓存,在后续运行中无需再次下载。

安装

使用uv(推荐)

当使用uv时不需要特定安装步骤。我们将直接使用uvx来运行视频提取服务器:

bash curl -LsSf https://astral.sh/uv/install.sh | sh

安装FFmpeg

FFmpeg是音频处理所必需的。您可以通过多种方法安装它:

bash

Ubuntu 或 Debian

sudo apt update && sudo apt install ffmpeg

Arch Linux

sudo pacman -S ffmpeg

MacOS

brew install ffmpeg

Windows (使用Chocolatey)

choco install ffmpeg

Windows (使用Scoop)

scoop install ffmpeg

使用说明

Claude/Cursor配置

在您的Claude/Cursor设置中添加如下内容:

json "mcpServers": { "video-extraction": { "command": "uvx", "args": ["mcp-video-extraction"] } }

可用的MCP工具

  1. 视频下载:从支持的平台上下载视频
  2. 音频下载:从支持平台上的视频中提取音频
  3. 视频文本提取:从视频中提取文本(下载并转录)
  4. 音频文件文本提取:从音频文件中提取文本

配置

服务可通过环境变量进行配置:

Whisper配置

  • WHISPER_MODEL:Whisper模型大小(tiny/base/small/medium/large),默认: base
  • WHISPER_LANGUAGE:转录的语言设置,默认: auto

YouTube下载配置

  • YOUTUBE_FORMAT:下载视频格式,默认: bestaudio
  • AUDIO_FORMAT:提取音频格式,默认: mp3
  • AUDIO_QUALITY:音频质量设置,默认: 192

存储配置

  • TEMP_DIR:临时文件存储位置,默认: /tmp/mcp-video

下载设置

  • DOWNLOAD_RETRIES:下载重试次数,默认: 10- FRAGMENT_RETRIES: 片段下载重试次数,默认:10
  • SOCKET_TIMEOUT: 套接字超时时间(秒),默认:30

性能优化提示

  1. GPU 加速:

    • 安装 CUDA 和 cuDNN
    • 确保安装了 PyTorch 的 GPU 版本
  2. 模型大小调整:

    • tiny: 速度最快但准确性较低
    • base: 速度和准确性平衡
    • large: 准确性最高但需要更多资源
  3. 使用 SSD 存储临时文件以提高 I/O 性能

注意事项

  • Whisper 模型(约 1GB)在首次运行时需要下载
  • 确保有足够的磁盘空间用于临时音频文件
  • 下载 YouTube 视频需要稳定的网络连接
  • 推荐使用 GPU 以加快音频处理速度
  • 处理长视频可能需要相当长的时间

MCP 集成指南

此服务器可以与任何兼容 MCP 的客户端一起使用,例如:

  • Claude Desktop
  • 自定义 MCP 客户端
  • 其他支持 MCP 的应用程序

有关 MCP 的更多信息,请访问 Model Context Protocol

文档

中文版文档请参阅 README_zh.md

许可证

MIT

来源