Voicebox — локальная voice-студия

GitHub: jamiepine/voicebox, MIT license.

Локальная альтернатива связке ElevenLabs (генерация речи) + WisprFlow (диктовка), полностью работает на своей машине.

Стек: Tauri (Rust) + React/TS фронт, FastAPI (Python) бэк, SQLite, инференс через MLX (Apple Silicon) или PyTorch (CUDA/ROCm/CPU).

Возможности:

  • Клонирование голоса по короткому сэмплу, 7 TTS-движков на выбор (Qwen3-TTS, Chatterbox, Kokoro, HumeAI TADA и др.)
  • STT через Whisper, локальная LLM (Qwen3) для очистки диктовки и “личностей” голосов
  • MCP-сервер — AI-агенты (Claude Code, Cursor) могут вызывать voicebox.speak и озвучивать ответ клонированным голосом
  • REST API (/generate, /speak, /transcribe, /profiles), глобальный хоткей диктовки в любое приложение
  • Пост-обработка (reverb, pitch shift, compression), “Stories editor” для мультитрек-мультиголос композиций

Установка: DMG/MSI под macOS/Windows, Docker (docker compose up). Под Linux готового билда нет — только сборка из исходников (Bun + Rust + Python 3.11+ + Tauri, just setup && just dev).

Why relevant: пересекается с molvi-voice-input (офлайн-диктовка), но шире — TTS с клонированием голоса + MCP-интеграция прямо в Claude Code/Cursor (агент может отвечать голосом). Не под VPS-сценарий (сервер claude) — требует сборки из исходников под Linux, нет прекомпилированного билда. Скорее кандидат для десктоп-использования или как референс для собственной MCP-TTS интеграции в claudeclaw/ccbot.

How to apply: при разговоре про голосовой ввод/вывод, TTS/STT для ботов, MCP-инструменты для агентов — держать в уме как готовый референс архитектуры (особенно MCP speak tool паттерн).