L’IA multimodale est-elle adaptée et à quoi servira-t-elle ? Renvoyez JSON {"suitable": "oui ou non", "how": "comment postuler"}.
Les modèles modernes ne se limitent pas au texte : ils sont multimodaux : ils comprennent les images, et certains comprennent également l'audio et la vidéo. Vous pouvez montrer au modèle une photo d'un reçu, une capture d'écran d'une erreur, un graphique, un diagramme - et elle le décrira, extraira les données et expliquera. Sous le capot, l’image se transforme également en jetons (visuels) et s’inscrit dans le même contexte que le texte. Cela ouvre des tâches inaccessibles à l’IA textuelle : analyser une note manuscrite, extraire un tableau d’une capture d’écran, comprendre ce qui ne va pas sur une photo. La multimodalité est une IA qui voit le monde et ne se contente pas de le lire.