LearnAI
Module 15 · IA multimodale (Pro) · Leçon 1/5
← Vers le catalogue
Tâche

L'IA peut voir

L’IA multimodale est-elle adaptée et à quoi servira-t-elle ? Renvoyez JSON {"suitable": "oui ou non", "how": "comment postuler"}.

Débloquez l’accès pour soumettre des solutions pour un examen instantané par l’IA.Commencez gratuitement
Multimodalité
💡 Un morceau de théorie

Les modèles modernes ne se limitent pas au texte : ils sont multimodaux : ils comprennent les images, et certains comprennent également l'audio et la vidéo. Vous pouvez montrer au modèle une photo d'un reçu, une capture d'écran d'une erreur, un graphique, un diagramme - et elle le décrira, extraira les données et expliquera. Sous le capot, l’image se transforme également en jetons (visuels) et s’inscrit dans le même contexte que le texte. Cela ouvre des tâches inaccessibles à l’IA textuelle : analyser une note manuscrite, extraire un tableau d’une capture d’écran, comprendre ce qui ne va pas sur une photo. La multimodalité est une IA qui voit le monde et ne se contente pas de le lire.

Comment est-il évalué · réussite 70

  • 1JSON valide sans texte autour30%
  • 2Il y a les champs suitable et how35%
  • 3Oui - afficher la photo, extraire les champs dans la structure35%
Votre inviteClaude ⌄