LearnAI
Modul 15 · Multimodale KI (Pro) · Lektion 1/5
← Zum Katalog
Aufgabe

KI kann sehen

Ist multimodale KI geeignet und was wird sie leisten? Geben Sie JSON zurück {"suitable": "yes or no", "how": "how to apply"}.

Schalten Sie den Zugriff frei, um Lösungen zur sofortigen KI-Überprüfung einzureichen.Starten Sie kostenlos
Multimodalität
💡 Ein Stück Theorie

Moderne Modelle beschränken sich nicht nur auf Text – sie sind multimodal: Sie verstehen Bilder, manche auch Audio und Video. Sie können dem Model ein Foto einer Quittung, einen Screenshot eines Fehlers, eine Grafik, ein Diagramm zeigen – und sie wird es beschreiben, Daten extrahieren und erklären. Unter der Haube verwandelt sich das Bild auch in (visuelle) Token und fällt in den gleichen Kontext wie der Text. Dies eröffnet Aufgaben, die der Text-KI nicht zugänglich sind: eine handschriftliche Notiz analysieren, eine Tabelle aus einem Screenshot herausziehen, verstehen, was auf einem Foto falsch ist. Multimodalität ist KI, die die Welt sieht und nicht nur darüber liest.

Wie wird es bewertet · bestanden 70

  • 1Gültiges JSON ohne umgebenden Text30%
  • 2Es gibt Felder suitable und how35%
  • 3Ja – Foto anzeigen, Felder in Struktur extrahieren35%
Ihre AufforderungClaude ⌄