LearnAI
Módulo 14 · Aplicativos de voz e multimodais (Pro) · Lição 1/5
← Para o catálogo
Tarefa

Fala para Texto (STT)

Como incorporar o reconhecimento de fala? Retorne JSON {"steps": [lista de mais de 2 etapas], "why": "short"}.

Desbloqueie o acesso para enviar soluções para análise instantânea de IA.Comece de graça
Entrada de voz no produto
💡 Uma teoria

A fala em texto (STT, fala em texto) transforma áudio em texto, que é posteriormente processado pelo modelo. Como incorporar: selecione um modo - streaming (transcrição conforme ocorre a fala, para diálogo ao vivo) ou lote (carregou um arquivo - texto recebido, para gravações); leve em consideração fatores de precisão – ruído, sotaque, termos, idioma (muitas vezes o idioma deve ser especificado explicitamente); lidar com erros de reconhecimento (o STT comete erros, especialmente em nomes e números - deixe o usuário verificar e corrigir); passe o texto para o LLM para obter significado. STT é a entrada, não o fim: a transcrição bruta quase sempre precisa ser limpa ou entendida. Regra: STT dá o texto, mas não a compreensão - o modelo segue o significado e monitora a qualidade por meio de ruído, linguagem e verificação de erros.

Como é avaliado · aprovado 70

  • 1JSON válido sem texto ao redor30%
  • 2Existe uma matriz steps e why35%
  • 3Mais de 2 etapas: modo stream/lote, fatores de precisão, tratamento de erros, passagem para LLM35%
Sua solicitaçãoClaude ⌄