이 비디오에 대한 다양한 목소리를 선택하십시오. JSON 반환 {"voice":"...","emotion":"...","tempo":"...","accent":"..."}: voice — 음성 음색, 성별 및 연령; emotion — 프레젠테이션의 감정; tempo — 말하는 속도; accent - 발음의 언어 및 문자. 추상적이지 않고 작업에 대한 각 필드를 정당화하십시오.
역학: 음성 합성은 두 단계로 이루어집니다. 먼저, 모델은 운율(높이, 소리 지속 시간, 일시 중지, 억양)을 예측한 다음 보코더가 이를 음파로 변환합니다. 모델이 구두점, 대소문자 및 지정된 매개변수를 통해 감정과 리듬을 추측하기 때문에 동일한 텍스트가 다르게 들립니다. 레버: 음색(남성/여성/중립), 나이, 감정, 템포, 언어 및 억양. 내부자: "쾌활한"이라는 단어가 아닌 상황에 맞는 설명과 정확한 구두점을 사용하여 감정을 정의하는 것이 더 안정적입니다. 마침표는 진정되고, 줄임표는 당기고, 느낌표는 에너지를 높입니다. 두 번째 통찰력: 광고의 경우 편안한 것보다 10-15% 더 빠른 음성을 사용하십시오. 편집 중에는 느린 음성이 느리게 들립니다. 초보자의 실수: 모든 것에 대해 하나의 "보편적으로 유쾌한 목소리"를 찾는 것입니다. 목소리는 캐스팅입니다. 오디오북의 내레이터는 역동적인 비디오를 죽일 것이고 쾌활한 세일즈맨은 명상을 읽지 않을 것입니다.