LearnAI
Modul 15 · AI multimoda (Pro) · Pelajaran 1/5
← Ke katalog
Tugas

AI bisa melihat

Apakah AI multimodal cocok dan apa fungsinya? Kembalikan JSON {"suitable": "ya atau tidak", "how": "cara melamar"}.

Buka kunci akses untuk mengirimkan solusi untuk peninjauan AI instan.Mulai secara gratis
Multimodalitas
💡 Sepotong teori

Model modern tidak terbatas pada teks - mereka multimodal: mereka memahami gambar, dan beberapa juga memahami audio dan video. Anda dapat menunjukkan kepada model foto tanda terima, tangkapan layar kesalahan, grafik, diagram - dan dia akan menjelaskannya, mengekstrak data, dan menjelaskannya. Di balik terpal, gambar juga berubah menjadi token (visual) dan berada dalam konteks yang sama dengan teks. Ini membuka tugas-tugas yang tidak dapat diakses oleh AI teks: menguraikan catatan tulisan tangan, mengeluarkan tabel dari tangkapan layar, memahami apa yang salah dalam sebuah foto. Multimodalitas adalah AI yang melihat dunia, dan tidak hanya membaca tentangnya.

Bagaimana penilaiannya · kelulusan 70

  • 1JSON valid tanpa teks di sekitarnya30%
  • 2Ada bidang suitable dan how35%
  • 3Ya - tampilkan foto, ekstrak bidang ke dalam struktur35%
Perintah AndaClaude ⌄