Из чего состоит голосовой цикл? Верни JSON {"pipeline": [список из 2+ звеньев], "why": "кратко"}.
Полный голосовой циклГолосовой ассистент — это цикл из нескольких звеньев: речь пользователя, затем STT (в текст), затем LLM (понимание и ответ), затем TTS (озвучка), и снова слушаем. Ключевое ограничение — ЗАДЕРЖКА: каждое звено добавляет секунды, а в живом разговоре пауза больше 1-2 секунд ощущается как тормоз. Поэтому используют потоковый STT, быстрые модели, стриминг ответа и начинают озвучку до готовности всего текста. Плюс нужна логика очередности (когда пользователь закончил говорить) и обработка перебиваний. Правило: голосовой ассистент — конвейер STT→LLM→TTS, где всё решает суммарная задержка; оптимизируй каждое звено и стримь, иначе диалог ощущается медленным.