Is multimodale AI geschikt en wat gaat het doen? Retourneer JSON {"suitable": "ja of nee", "how": "hoe toe te passen"}.
Moderne modellen beperken zich niet tot tekst - ze zijn multimodaal: ze begrijpen afbeeldingen, en sommige begrijpen ook audio en video. Je kunt het model een foto van een bon laten zien, een screenshot van een fout, een grafiek, een diagram - en zij zal het beschrijven, gegevens extraheren en uitleggen. Onder de motorkap verandert de afbeelding ook in tokens (visueel) en valt in dezelfde context als de tekst. Dit opent taken die ontoegankelijk zijn voor tekst-AI: een handgeschreven notitie ontleden, een tabel uit een screenshot halen, begrijpen wat er mis is in een foto. Multimodaliteit is AI die de wereld ziet, en er niet alleen over leest.