Apakah AI multimodal cocok dan apa fungsinya? Kembalikan JSON {"suitable": "ya atau tidak", "how": "cara melamar"}.
Model modern tidak terbatas pada teks - mereka multimodal: mereka memahami gambar, dan beberapa juga memahami audio dan video. Anda dapat menunjukkan kepada model foto tanda terima, tangkapan layar kesalahan, grafik, diagram - dan dia akan menjelaskannya, mengekstrak data, dan menjelaskannya. Di balik terpal, gambar juga berubah menjadi token (visual) dan berada dalam konteks yang sama dengan teks. Ini membuka tugas-tugas yang tidak dapat diakses oleh AI teks: menguraikan catatan tulisan tangan, mengeluarkan tabel dari tangkapan layar, memahami apa yang salah dalam sebuah foto. Multimodalitas adalah AI yang melihat dunia, dan tidak hanya membaca tentangnya.