Voicebox — локальная voice-студия
GitHub: jamiepine/voicebox, MIT license.
Локальная альтернатива связке ElevenLabs (генерация речи) + WisprFlow (диктовка), полностью работает на своей машине.
Стек: Tauri (Rust) + React/TS фронт, FastAPI (Python) бэк, SQLite, инференс через MLX (Apple Silicon) или PyTorch (CUDA/ROCm/CPU).
Возможности:
- Клонирование голоса по короткому сэмплу, 7 TTS-движков на выбор (Qwen3-TTS, Chatterbox, Kokoro, HumeAI TADA и др.)
- STT через Whisper, локальная LLM (Qwen3) для очистки диктовки и “личностей” голосов
- MCP-сервер — AI-агенты (Claude Code, Cursor) могут вызывать
voicebox.speakи озвучивать ответ клонированным голосом - REST API (
/generate,/speak,/transcribe,/profiles), глобальный хоткей диктовки в любое приложение - Пост-обработка (reverb, pitch shift, compression), “Stories editor” для мультитрек-мультиголос композиций
Установка: DMG/MSI под macOS/Windows, Docker (docker compose up). Под Linux готового билда нет — только сборка из исходников (Bun + Rust + Python 3.11+ + Tauri, just setup && just dev).
Why relevant: пересекается с molvi-voice-input (офлайн-диктовка), но шире — TTS с клонированием голоса + MCP-интеграция прямо в Claude Code/Cursor (агент может отвечать голосом). Не под VPS-сценарий (сервер claude) — требует сборки из исходников под Linux, нет прекомпилированного билда. Скорее кандидат для десктоп-использования или как референс для собственной MCP-TTS интеграции в claudeclaw/ccbot.
How to apply: при разговоре про голосовой ввод/вывод, TTS/STT для ботов, MCP-инструменты для агентов — держать в уме как готовый референс архитектуры (особенно MCP speak tool паттерн).