A IA multimodal é adequada e o que fará? Retorne JSON {"suitable": "sim ou não", "how": "como aplicar"}.
Os modelos modernos não se limitam ao texto - são multimodais: compreendem imagens e alguns também compreendem áudio e vídeo. Você pode mostrar à modelo uma foto de um recibo, uma captura de tela de um erro, um gráfico, um diagrama - e ela irá descrevê-lo, extrair dados e explicar. Nos bastidores, a imagem também se transforma em tokens (visuais) e se enquadra no mesmo contexto do texto. Isso abre tarefas que são inacessíveis à IA de texto: analisar uma nota manuscrita, extrair uma tabela de uma captura de tela, entender o que há de errado em uma foto. Multimodalidade é a IA que vê o mundo, e não apenas lê sobre ele.