LearnAI
Moduł 15 · Multimodalna sztuczna inteligencja (Pro) · Lekcja 1/5
← Do katalogu
Zadanie

AI widzi

Czy multimodalna sztuczna inteligencja jest odpowiednia i jakie będzie jej działanie? Zwróć JSON {"suitable": "tak lub nie", "how": "jak złożyć wniosek"}.

Odblokuj dostęp, aby przesyłać rozwiązania do natychmiastowej oceny AI.Zacznij za darmo
Multimodalność
💡 Kawałek teorii

Nowoczesne modele nie ograniczają się do tekstu – są multimodalne: rozumieją obrazy, a niektóre rozumieją także dźwięk i wideo. Możesz pokazać modelce zdjęcie paragonu, zrzut ekranu błędu, wykres, diagram - a ona to opisze, wydobędzie dane i wyjaśni. Pod maską obraz również zamienia się w żetony (wizualne) i wpada w ten sam kontekst co tekst. Otwiera to zadania niedostępne dla tekstowej AI: analizowanie odręcznej notatki, wyciąganie tabeli ze zrzutu ekranu, zrozumienie, co jest nie tak na zdjęciu. Multimodalność to sztuczna inteligencja, która widzi świat, a nie tylko o nim czyta.

Jak jest oceniane · zaliczenie 70

  • 1Prawidłowy JSON bez tekstu wokół niego30%
  • 2Istnieją pola suitable i how35%
  • 3Tak - pokaż zdjęcie, wyodrębnij pola do struktury35%
Twoja zachętaClaude ⌄