LearnAI
Módulo 15 · IA multimodal (Pro) · Lección 1/5
← Al catálogo
Tarea

La IA puede ver

¿Es adecuada la IA multimodal y qué hará? Devuelve JSON {"suitable": "sí o no", "how": "cómo aplicar"}.

Desbloquee el acceso para enviar soluciones para una revisión instantánea de la IA.Empieza gratis
Multimodalidad
💡 Un pedazo de teoría

Los modelos modernos no se limitan al texto: son multimodales: entienden imágenes y algunos también entienden audio y vídeo. Puede mostrarle a la modelo una foto de un recibo, una captura de pantalla de un error, un gráfico, un diagrama, y ​​ella lo describirá, extraerá datos y explicará. Debajo del capó, la imagen también se convierte en tokens (visuales) y cae en el mismo contexto que el texto. Esto abre tareas que son inaccesibles para la IA de texto: analizar una nota escrita a mano, extraer una tabla de una captura de pantalla, comprender qué está mal en una foto. La multimodalidad es una IA que ve el mundo y no sólo lee sobre él.

¿Cómo se evalúa · aprobado? 70

  • 1JSON válido sin texto alrededor30%
  • 2Hay campos suitable y how35%
  • 3Sí: mostrar foto, extraer campos en la estructura35%
Tu mensajeClaude ⌄