Como incorporar o reconhecimento de fala? Retorne JSON {"steps": [lista de mais de 2 etapas], "why": "short"}.
A fala em texto (STT, fala em texto) transforma áudio em texto, que é posteriormente processado pelo modelo. Como incorporar: selecione um modo - streaming (transcrição conforme ocorre a fala, para diálogo ao vivo) ou lote (carregou um arquivo - texto recebido, para gravações); leve em consideração fatores de precisão – ruído, sotaque, termos, idioma (muitas vezes o idioma deve ser especificado explicitamente); lidar com erros de reconhecimento (o STT comete erros, especialmente em nomes e números - deixe o usuário verificar e corrigir); passe o texto para o LLM para obter significado. STT é a entrada, não o fim: a transcrição bruta quase sempre precisa ser limpa ou entendida. Regra: STT dá o texto, mas não a compreensão - o modelo segue o significado e monitora a qualidade por meio de ruído, linguagem e verificação de erros.