LearnAI
モジュール 15 · マルチモーダル AI (プロ) · レッスン 1/5
← カタログへ
タスク

AIは見える

マルチモーダル AI は適していますか?また、それは何をするのでしょうか? JSON {"suitable": "はいまたはいいえ"、"how": "申請方法"} を返します。

アクセスのロックを解除して、AI による即時レビューのためにソリューションを送信します。無料で始める
マルチモダリティ
💡 理論の一部

最新のモデルはテキストに限定されず、マルチモーダルです。画像を理解し、音声やビデオも理解するものもあります。モデルにレシートの写真、エラーのスクリーンショット、グラフ、図を見せると、彼女はそれを説明し、データを抽出して説明します。内部では、画像もトークン (視覚的) に変わり、テキストと同じコンテキストに分類されます。これにより、手書きのメモを解析したり、スクリーンショットから表を抽出したり、写真の何が間違っているかを理解したりするなど、テキスト AI ではアクセスできないタスクが可能になります。マルチモダリティとは、世界について読むだけでなく、世界を見る AI です。

どのように評価されますか? 合格 70

  • 1周囲にテキストのない有効な JSON30%
  • 2フィールド suitable と how があります35%
  • 3はい - 写真を表示し、フィールドを構造体に抽出します35%
あなたのプロンプトClaude ⌄