Войти
Все стеки
STT/TTS

Голосовой конвейер

Текст ↔ речь ↔ текст в предсказуемом пайплайне.

Для кого: Кто делает озвучку гидов, подкастов, дубляж, транскрибацию

Порядок использования

  1. 1
    Faster-Whisper🎙️ Голос и Аудио

    Faster-Whisper — речь → текст

    Ускоренная версия Whisper для быстрого распознавания речи и преобразования аудио в текст

  2. 2
    Whisper Base🎙️ Голос и Аудио

    Piper / Kokoro / Supertonic — локальный TTS

    AI-модель для распознавания речи и перевода аудио в текст с возможностью локального запуска

  3. 3
    Piper🎙️ Голос и Аудио

    Qwen3-TTS — русский и дизайн голоса

    Быстрый локальный синтезатор речи, который превращает текст в естественную озвучку без подключения к облачным сервисам

  4. 4
    Kokoro TTS🎙️ Голос и Аудио

    Voicebox / VoiceStudio — локальная студия

    Лёгкая AI-модель для быстрой генерации естественной речи из текста, которую можно запускать локально

  5. 5
    Supertonic🎙️ Голос и Аудио

    GPT-SoVITS-Russian — русскоязычный клон

    Быстрая локальная AI-модель для синтеза речи из текста (TTS). Работает на устройстве через ONNX, без облака и API

  6. 6
    Qwen3-TTS🎙️ Голос и Аудио

    Auphonic — выровнять громкость

    AI-модели для реалистичной генерации речи, дизайна голоса и клонирования голоса. Поддерживают русский язык

  7. 7
    Voicebox🎙️ Голос и Аудио

    ElevenLabs — облачный запасной вариант

    Локальная AI-студия для клонирования голоса, генерации речи и транскрибации. Поддерживает несколько TTS-моделей и работу с AI-агентами

  8. 8
    VoiceStudio🎙️ Голос и Аудио

    VoiceStudio

    Локальная AI-студия для клонирования и генерации голоса, дубляжа, транскрибации и создания аудиокниг. Поддерживает 16 TTS и 11 ASR-движков

  9. 9
    GPT-SoVITS-Russian🎙️ Голос и Аудио

    GPT-SoVITS-Russian

    Дообученная версия GPT-SoVITS для синтеза речи на русском и китайском языках

  10. 10
    Auphonic🎙️ Голос и Аудио

    Auphonic

    AI-сервис для автоматической обработки и улучшения качества аудио и видео: шумоподавление, выравнивание громкости, очистка голоса, транскрибация и монтаж

  11. 11
    ElevenLabs🎙️ Голос и Аудио

    ElevenLabs

    Генерирует реалистичную речь, клонирует голоса, озвучивает текст и делает дубляж

Definition of Done

Есть MP3/WAV озвучки + текстовая расшифровка исходника; можно вставить в страницу/видео.

Типичная ошибка

Клонировать чужой голос без прав — в ProektMap только свой/лицензированный материал.

Связи в ProektMap

Конструктор голосового гида Готовые решения Арсенал: короткие видео

Другие стеки

🖥️ Локальный AI на ПК📱 Локальный AI в кармане💻 Агент-кодер / вайбкодинг🧩 Агенты, скиллы и рабочий контур