ナレーション用のテキストを準備し、プレゼンテーションについて説明します。 JSON を返します {"script":"...","voice_style":"...","emphasis_notes":"..."}: 「耳用」の短いテキスト (最大 80 語)、音声スタイル (トーン、テンポ、感情)、および一時停止/強調および複雑な単語に関するメモ。
音声合成はあなたの声でテキストを読み上げ、それはあなたが書いたとおりに聞こえます。モデルはそれを文字通りに読み上げます。これは、目のためではなく「耳のために」書く必要があることを意味します。メカニズム: エンジンはテキスト、句読点、スタイルマークを取得し、それらを使用してイントネーション、一時停止、テンポを構築します。レバー。 1 つ目は、句読点がリズムを制御することです。ピリオドは休止を与え、省略記号は思慮深さを与え、短い文は自信に満ちたように聞こえ、長い文は重く聞こえます。次に、テキストだけでなく、音声 (落ち着いたアナウンサー、フレンドリー、エネルギッシュ)、感情、テンポなどのプレゼンテーションも設定します。 「これを読む」のと「友達に読むように、ゆっくり温かく読む」のでは結果が異なります。プロのトリック: 複雑な単語、名前、略語を発音どおりに書くか、分割します。そうしないと、エンジンが独自の方法でそれを読み取ります。 2 番目のテクニック: 意味を理解するために一息必要な場所に、意図的にポーズを置きます (コンマ、ピリオド、改行など)。スピーチの自然さは、声ではなくポーズに基づいています。典型的な間違いは、長い句点と脚注を含む「目で読むテキスト」を吹き替えに提出することです。崩れ落ちているように聞こえる。短く書き、事前に下書きを声に出して言います。
アクセスのロックを解除して、AI による即時レビューのためにソリューションを送信します。