Возьми ОДНУ свою настоящую задачу (рабочую или бытовую), где голос мог бы помочь. Опиши её и подбери подходящее умение голосового AI. Верни JSON {"task":"...","capability":"...","why":"..."}, где capability — одно из: conversation, dictation, transcription, synthesis.
Голосовой AI умеет четыре разные вещи, и путать их — первая ошибка новичка. Первое — живой разговор: ты говоришь, ассистент слышит и отвечает голосом почти без паузы, можно перебивать и уточнять, как с человеком по телефону. Второе — диктовка: твоя речь превращается в текст, ты говоришь вместо того, чтобы печатать. Третье — транскрибация: длинная запись (встреча, лекция) раскладывается в текст с разделением по говорящим. Четвёртое — синтез речи: текст озвучивается естественным голосом с нужной интонацией. Механика проста: везде посередине стоит модель, которая переводит звук в смысл и обратно. Приём профи: не спрашивай себя «как использовать голосовой AI», а сначала назови задачу — и уже под неё выбирай умение. Диктовать письмо — диктовка; понять двухчасовой созвон — транскрибация плюс сводка. Инсайд: голос выигрывает там, где руки заняты или мысль длиннее, чем удобно печатать. Типичная ошибка — пытаться надиктовать идеально с первого раза; голос силён как черновик, который потом чистит AI.