准备一个会说话的头像。返回 JSON {"avatar":"...","script":"...","emotion":"...","voice":"..."}:avatar - 外观和计划的描述,script - 副本 10-18 个单词“如他们所说”,emotion - 每个副本一种情感, voice — 声音特征(音色、节奏)。
会说话的化身是两个引擎:一个创建面部和面部表情,第二个使嘴唇与声音同步(唇形同步)。神经网络将语音分解为音素(小声音),并选择与之匹配的嘴部形状。因此,主要规则是:按照他们所说的方式编写脚本,而不是按照他们写的方式编写。简短的短语、简单的单词,没有长的分词短语——否则嘴唇会“咀嚼”,不同步就会很明显。面部表情的机制:模型从描述和标点符号中读取情绪,从而清楚地表明情绪(“友好,带着轻微的微笑”)并标点停顿。业内人士:每行保留一种情感。三秒内“喜-怒-哀”的急剧变化,让脸变成了不自然的面具。第二种技术大约是每秒 2 个单词:如果您将大量文本塞进一个短片中,口型同步就会变得混乱。提前计算好画外音的长度。一个典型的错误是用缩写和数字编写机器人文本(“ROI 增加了 27.4%”):模型会错误地发音。用文字解读它,用耳朵检验它。
解锁提交解决方案以供即时 AI 审核的权限。