LearnAI
Новинки AI · Видео и анимация · レッスン 7/10
← カタログへ
タスク

話すアバターとリップシンク

しゃべるアバターを用意します。 JSON を返す {"avatar":"...","script":"...","emotion":"...","voice":"..."}: avatar - 外観と計画の説明、script - 「彼らの言うとおり」のレプリカ 10 ~ 18 語、emotion - レプリカごとに 1 つの感情、 voice — 声のキャラクター (音色、テンポ)。

アクセスのロックを解除して、AI による即時レビューのためにソリューションを送信します。
撮影なしのアナウンサー
💡 理論の一部

話すアバターは、ハーネス内の 2 つのエンジンで構成されます。1 つは顔と表情を作成し、2 つ目は唇と音を同期させます (リップ シンク)。ニューラル ネットワークは音声を音素 (小さな音) に分割し、それらに一致する口の形を選択します。したがって、主要なルールは、脚本を彼らが書いたとおりに書くのではなく、彼らの言うとおりに書くことです。短いフレーズ、単純な単語、長い分詞句のないもの - そうしないと、唇が「噛む」ようになり、同期がずれていることが明らかになります。顔の表情のメカニズム: モデルは説明と句読点から感情を読み取るため、雰囲気 (「フレンドリーで、少し微笑んでいる」) と句読点でポーズを明確に示します。インサイダー: 1 行に 1 つの感情を入れてください。 3秒間の「喜び・怒り・悲しみ」の急激な変化により、顔は不自然な仮面へと変化する。 2 番目のテクニックは、1 秒あたり約 2 単語です。短いクリップに大量のテキストを詰め込むと、リップシンクが乱れてしまいます。ナレーションの長さを事前に計算してください。典型的な間違いは、略語と数字を使ってロボットのようなテキストを書くことです (「ROI が 27.4% 増加しました」)。モデルはそれを曲がって発音します。言葉で解読し、耳でテストしてください。

どのように評価されますか? 合格 70

  • 1周囲にテキストのない有効な JSON25%
  • 2avatar、script、emotion、voice のフィールドがあります25%
  • 3「彼らの言うとおり」の脚本を長めに書く35%
  • 41 行に 1 つの感情15%
あなたのプロンプトClaude ⌄
🔒

アクセスのロックを解除して、AI による即時レビューのためにソリューションを送信します。