AI đa phương thức có phù hợp không và nó sẽ làm được những gì? Trả về JSON {"suitable": "có hoặc không", "how": "cách đăng ký"}.
Các mô hình hiện đại không giới hạn ở văn bản - chúng đa phương thức: chúng hiểu hình ảnh và một số còn hiểu cả âm thanh và video. Bạn có thể cho người mẫu xem ảnh biên nhận, ảnh chụp màn hình lỗi, biểu đồ, sơ đồ - và cô ấy sẽ mô tả, trích xuất dữ liệu và giải thích. Dưới mui xe, hình ảnh cũng biến thành mã thông báo (hình ảnh) và rơi vào cùng bối cảnh với văn bản. Điều này mở ra các tác vụ mà AI nhắn tin không thể tiếp cận được: phân tích ghi chú viết tay, lấy bảng từ ảnh chụp màn hình, hiểu điều gì sai trong ảnh. Đa phương thức là AI có khả năng nhìn thế giới chứ không chỉ đọc về nó.