Agent♥︎Age
Catalog

io.github.chicogong/ffvoice

Official

by chicogong · C++

Offline speech-to-text & speaker diarization MCP server: transcribe audio on-device, no cloud

io.github.chicogong/ffvoice — Offline Speech-to-Text & Speaker Diarization MCP Server

This MCP server provides offline speech-to-text transcription and speaker diarization. It transcribes audio on-device without cloud use, focusing on real-time transcription workflows and related audio-processing tasks.

🛠️ Key Features

  • Offline ASR (speech recognition)
  • Speaker diarization
  • Speech-to-text transcription
  • Noise suppression (rnnoise)
  • Voice activity detection (VAD)
  • Subtitle generation

🚀 Use Cases

  • Real-time transcription pipelines
  • Generating subtitles from audio
  • Identifying and separating multiple speakers in recordings

⚡ Developer Benefits

  • Works with Model Context Protocol (MCP)
  • Emphasizes C++20 (cpp20) implementation
  • Supports audio-processing tooling such as VAD and noise suppression
  • Fits applications using AI agents (ai-agent) and speech recognition

⚠️ Limitations

  • Described as offline; cloud-based transcription is not indicated by the provided data

Topics

audio-processingspeech-to-textwhispercpp20aimachine-learningnoise-suppressionoffline-asrreal-time-transcriptionrnnoisespeech-recognitionsubtitle-generationvadai-agentclaudemcpmcp-servermodel-context-protocolpythonspeaker-diarization