マルチモーダル AI は適していますか?また、それは何をするのでしょうか? JSON {"suitable": "はいまたはいいえ"、"how": "申請方法"} を返します。
最新のモデルはテキストに限定されず、マルチモーダルです。画像を理解し、音声やビデオも理解するものもあります。モデルにレシートの写真、エラーのスクリーンショット、グラフ、図を見せると、彼女はそれを説明し、データを抽出して説明します。内部では、画像もトークン (視覚的) に変わり、テキストと同じコンテキストに分類されます。これにより、手書きのメモを解析したり、スクリーンショットから表を抽出したり、写真の何が間違っているかを理解したりするなど、テキスト AI ではアクセスできないタスクが可能になります。マルチモダリティとは、世界について読むだけでなく、世界を見る AI です。