LearnAI
Módulo 15 · IA multimodal (Pro) · Lição 1/5
← Para o catálogo
Tarefa

IA pode ver

A IA multimodal é adequada e o que fará? Retorne JSON {"suitable": "sim ou não", "how": "como aplicar"}.

Desbloqueie o acesso para enviar soluções para análise instantânea de IA.Comece de graça
Multimodalidade
💡 Uma teoria

Os modelos modernos não se limitam ao texto - são multimodais: compreendem imagens e alguns também compreendem áudio e vídeo. Você pode mostrar à modelo uma foto de um recibo, uma captura de tela de um erro, um gráfico, um diagrama - e ela irá descrevê-lo, extrair dados e explicar. Nos bastidores, a imagem também se transforma em tokens (visuais) e se enquadra no mesmo contexto do texto. Isso abre tarefas que são inacessíveis à IA de texto: analisar uma nota manuscrita, extrair uma tabela de uma captura de tela, entender o que há de errado em uma foto. Multimodalidade é a IA que vê o mundo, e não apenas lê sobre ele.

Como é avaliado · aprovado 70

  • 1JSON válido sem texto ao redor30%
  • 2Existem campos suitable e how35%
  • 3Sim - mostre a foto, extraia os campos na estrutura35%
Sua solicitaçãoClaude ⌄