シーンを分解してみましょう。 JSON を返す {"subject":"...","action":"...","setting":"...","shot":"...","style":"..."}: subject - 誰/何を、 action - 1 つのアクション、 setting - どこで、いつ、 shot - プランとアングル (クローズ/ミディアム/一般、カメラレベル)、style - ビジュアルスタイル。
ビデオ プロンプトには、映画の静止画のようなスケルトンがあります。それを部分に分解します: 主題 (誰/何を)、アクション (彼が何をしているか)、環境 (いつ、どこで)、ショット (クローズアップ、中、一般)、視点 (目の高さ、上、下)、光と雰囲気 (暖かい夕日、寒い朝)、スタイル (リアリズム、水彩、3D)。ニューラル ネットワークは、監督の要求のように説明を読み取ります。各パーツの名前が正確であればあるほど、ユーザーの代わりに考え出す必要はなくなります。重要なテクニックは、シーンごとに 1 つのアクションです。 「子供が紙飛行機を飛ばす」は持ちこたえますが、「走ったり、ジャンプしたり、キャッチしたり、笑ったり」はばらばらになって人工物になってしまいます。 2 番目のテクニック: 最初に写真のような高密度の静的フレームを記述し、その後で動きを追加します。モデルは最初に安定した構成を構築し、次にそれをアニメーション化します。典型的な間違いは、アクションではなく感情を記述することです。「雰囲気」や「叙事詩」はモデルによってあまり理解されていません。これを目に見えるものに置き換えます。「カメラがゆっくりとズームインし、光線の中に塵が点在する」。ルールは単純です。アクションが画面上に表示できない場合、モデルはそれを無視します。
アクセスのロックを解除して、AI による即時レビューのためにソリューションを送信します。