しゃべるアバターを用意します。 JSON を返す {"avatar":"...","script":"...","emotion":"...","voice":"..."}: avatar - 外観と計画の説明、script - 「彼らの言うとおり」のレプリカ 10 ~ 18 語、emotion - レプリカごとに 1 つの感情、 voice — 声のキャラクター (音色、テンポ)。
話すアバターは、ハーネス内の 2 つのエンジンで構成されます。1 つは顔と表情を作成し、2 つ目は唇と音を同期させます (リップ シンク)。ニューラル ネットワークは音声を音素 (小さな音) に分割し、それらに一致する口の形を選択します。したがって、主要なルールは、脚本を彼らが書いたとおりに書くのではなく、彼らの言うとおりに書くことです。短いフレーズ、単純な単語、長い分詞句のないもの - そうしないと、唇が「噛む」ようになり、同期がずれていることが明らかになります。顔の表情のメカニズム: モデルは説明と句読点から感情を読み取るため、雰囲気 (「フレンドリーで、少し微笑んでいる」) と句読点でポーズを明確に示します。インサイダー: 1 行に 1 つの感情を入れてください。 3秒間の「喜び・怒り・悲しみ」の急激な変化により、顔は不自然な仮面へと変化する。 2 番目のテクニックは、1 秒あたり約 2 単語です。短いクリップに大量のテキストを詰め込むと、リップシンクが乱れてしまいます。ナレーションの長さを事前に計算してください。典型的な間違いは、略語と数字を使ってロボットのようなテキストを書くことです (「ROI が 27.4% 増加しました」)。モデルはそれを曲がって発音します。言葉で解読し、耳でテストしてください。
アクセスのロックを解除して、AI による即時レビューのためにソリューションを送信します。