5 мин чтения

Как устроен голосовой AI: STT, LLM и TTS в одном пайплайне

Разбираем технический стек голосового ассистента от распознавания до произношения.

Голосовой AI работает в три этапа. Speech-to-Text (STT) — распознавание речи клиента в текст. Здесь важны скорость (реалтайм, без паузы) и качество распознавания русского языка. Топ-решения: Whisper (OpenAI), Yandex SpeechKit, Google Speech. Для русского лучший баланс — Yandex SpeechKit.

LLM — мозг системы. Текст вопроса + контекст диалога + сценарий → AI формулирует ответ. Здесь используем тот же стек, что и для текстовых ботов: GPT-4o, Claude, Gemini. Ключевое — скорость генерации: паузы более 1–2 секунд воспринимаются как сбой.

Text-to-Speech (TTS) — произношение ответа. ElevenLabs даёт лучшее качество голоса, OpenAI TTS быстрее и дешевле, Yandex SpeechKit оптимален для русскоязычных проектов. Весь пайплайн — STT → LLM → TTS — занимает 1–2 секунды. Это воспринимается как нормальная пауза в разговоре.

Готовы обсудить проект?

Получить расчёт ← Вернуться к тарифу