L’intelligenza artificiale multimodale è adatta e cosa farà? Restituisce JSON {"suitable": "sì o no", "how": "come presentare domanda"}.
I modelli moderni non si limitano al testo: sono multimodali: comprendono le immagini e alcuni comprendono anche audio e video. Puoi mostrare alla modella la foto di una ricevuta, uno screenshot di un errore, un grafico, un diagramma e lei lo descriverà, estrarrà i dati e spiegherà. Dietro le quinte, anche l'immagine si trasforma in token (visivo) e rientra nello stesso contesto del testo. Ciò apre attività inaccessibili all’intelligenza artificiale del testo: analizzare una nota scritta a mano, estrarre una tabella da uno screenshot, capire cosa c’è che non va in una foto. La multimodalità è l’intelligenza artificiale che vede il mondo e non si limita a leggerlo.