准备配音文本并描述演示内容。返回 JSON {"script":"...","voice_style":"...","emphasis_notes":"..."}:“适合耳朵”的短文本(最多 80 个单词)、语音风格(语气、节奏、情感)以及关于停顿/强调和复杂单词的注释。
语音合成用你的声音读取文本,听起来和你写的一模一样——模型逐字读取。这意味着你需要“为耳朵而写”,而不是为眼睛而写。机制:引擎采用文本、标点符号和风格标记,并使用它们来构建语调、停顿和节奏。杠杆。首先是标点符号控制节奏:句号给人停顿,省略号给人深思熟虑,短句听起来自信,长句听起来沉重。其次,不仅要设置文本,还要设置演示文稿:声音(平静的播音员、友好的、充满活力的)、情感和节奏。 “读这个”和“热情地、慢慢地读它,就像给朋友读一样”给出了不同的结果。专业技巧:按照发音的方式写出复杂的单词、名称和缩写,或者将它们分解 - 否则引擎会以自己的方式读取它们。第二种技巧:在需要呼吸的地方故意放置停顿(用逗号、句号、换行)——语音的自然程度基于停顿,而不是声音。一个典型的错误是提交配音“用眼睛阅读的文本”,并带有很长的句号和脚注;听起来像是要崩溃了。写得简短,提前大声朗读草稿。
解锁提交解决方案以供即时 AI 审核的权限。