Голосовой конвейер
Текст ↔ речь ↔ текст в предсказуемом пайплайне.
Для кого: Кто делает озвучку гидов, подкастов, дубляж, транскрибацию
Порядок использования
- 1Faster-Whisper🎙️ Голос и Аудио
Faster-Whisper — речь → текст
Ускоренная версия Whisper для быстрого распознавания речи и преобразования аудио в текст
- 2Whisper Base🎙️ Голос и Аудио
Piper / Kokoro / Supertonic — локальный TTS
AI-модель для распознавания речи и перевода аудио в текст с возможностью локального запуска
- 3
- 4Kokoro TTS🎙️ Голос и Аудио
Voicebox / VoiceStudio — локальная студия
Лёгкая AI-модель для быстрой генерации естественной речи из текста, которую можно запускать локально
- 5Supertonic🎙️ Голос и Аудио
GPT-SoVITS-Russian — русскоязычный клон
Быстрая локальная AI-модель для синтеза речи из текста (TTS). Работает на устройстве через ONNX, без облака и API
- 6
- 7
- 8VoiceStudio🎙️ Голос и Аудио
VoiceStudio
Локальная AI-студия для клонирования и генерации голоса, дубляжа, транскрибации и создания аудиокниг. Поддерживает 16 TTS и 11 ASR-движков
- 9GPT-SoVITS-Russian🎙️ Голос и Аудио
GPT-SoVITS-Russian
Дообученная версия GPT-SoVITS для синтеза речи на русском и китайском языках
- 10
- 11ElevenLabs🎙️ Голос и Аудио
ElevenLabs
Генерирует реалистичную речь, клонирует голоса, озвучивает текст и делает дубляж
Есть MP3/WAV озвучки + текстовая расшифровка исходника; можно вставить в страницу/видео.
Клонировать чужой голос без прав — в ProektMap только свой/лицензированный материал.