Multimodal yapay zeka uygun mu ve ne yapacak? JSON'u döndürün {"suitable": "evet veya hayır", "how": "nasıl başvurulur"}.
Modern modeller metinle sınırlı değildir; çok modludurlar: görüntüleri anlarlar, bazıları da ses ve videoyu anlar. Modele bir makbuzun fotoğrafını, bir hatanın ekran görüntüsünü, bir grafiği, bir diyagramı gösterebilirsiniz; o da bunu açıklayacak, verileri çıkaracak ve açıklayacaktır. Kapağın altında resim de simgesel öğelere (görsel) dönüşüyor ve metinle aynı bağlama giriyor. Bu, metin yapay zekasının erişemeyeceği görevlerin önünü açar: el yazısıyla yazılmış bir notu ayrıştırmak, ekran görüntüsünden bir tablo çıkarmak, bir fotoğrafta neyin yanlış olduğunu anlamak. Çok modluluk, dünyayı sadece okumakla kalmayıp, gören yapay zekadır.