「美しいマグカップ」という漠然としたリクエストを構造化されたプロンプトに変えます。 JSON のみを返します: {"prompt":"...","style":"...","details":"..."} - prompt で被写体、環境、光を 1 つのフレーズで収集し、style で視覚スタイルを示し、details でマテリアル、角度、形式を追加します。
画像ジェネレーターは人間のように描画しません。何百万もの「写真 + キャプション」のペアでトレーニングされ、オブジェクト、スタイル、光がどのように見えるかを記憶します。テキストを指定すると、モデルはランダムなノイズから始まり、それを段階的に除去して、画像を説明の意味に近づけます。これには 2 つの影響があります。まず、言葉が具体的であればあるほど、ニューラル ネットワークはユーザーに代わって考えなくなります。ニューラル ネットワークは、「平均的なインターネット ユーザー」の漠然としたリクエストに応えます。 2 番目: 常にランダムなノイズから開始されるため、同じプロンプトでも異なる画像が表示されます。これはバグではなく、オプションを取得する方法です。機能するレバー: アンカー名詞 (フレーム内に正確に何があるか)、素材と光の形容詞、スタイルと形式の表示。インサイダー テクニック: プロンプトを「レイヤー」(主題、環境、光、スタイル) で記述します。モデルは最初の単語により強く反応するため、主要なものを先頭に置きます。 2 番目のトリック: 画像が気に入ったら、シードを修正し、一度に 1 単語ずつ変更します。典型的な初心者の間違いは、属性ではなく感情 (「美しい、すごい」) を読み込むことです。モデルはあなたの「美しさ」を知りません。彼女は「柔らかな拡散光」、「セラミック」、「クローズアップ」を知っています。