¿Es adecuada la IA multimodal y qué hará? Devuelve JSON {"suitable": "sí o no", "how": "cómo aplicar"}.
Los modelos modernos no se limitan al texto: son multimodales: entienden imágenes y algunos también entienden audio y vídeo. Puede mostrarle a la modelo una foto de un recibo, una captura de pantalla de un error, un gráfico, un diagrama, y ella lo describirá, extraerá datos y explicará. Debajo del capó, la imagen también se convierte en tokens (visuales) y cae en el mismo contexto que el texto. Esto abre tareas que son inaccesibles para la IA de texto: analizar una nota escrita a mano, extraer una tabla de una captura de pantalla, comprender qué está mal en una foto. La multimodalidad es una IA que ve el mundo y no sólo lee sobre él.