Czy multimodalna sztuczna inteligencja jest odpowiednia i jakie będzie jej działanie? Zwróć JSON {"suitable": "tak lub nie", "how": "jak złożyć wniosek"}.
Nowoczesne modele nie ograniczają się do tekstu – są multimodalne: rozumieją obrazy, a niektóre rozumieją także dźwięk i wideo. Możesz pokazać modelce zdjęcie paragonu, zrzut ekranu błędu, wykres, diagram - a ona to opisze, wydobędzie dane i wyjaśni. Pod maską obraz również zamienia się w żetony (wizualne) i wpada w ten sam kontekst co tekst. Otwiera to zadania niedostępne dla tekstowej AI: analizowanie odręcznej notatki, wyciąganie tabeli ze zrzutu ekranu, zrozumienie, co jest nie tak na zdjęciu. Multimodalność to sztuczna inteligencja, która widzi świat, a nie tylko o nim czyta.