음성 인식을 삽입하는 방법은 무엇입니까? JSON {"steps": [2개 이상의 단계 목록], "why": "short"}를 반환합니다.
STT(Speech-to-Text)는 오디오를 텍스트로 변환하며, 이는 모델에 의해 추가 처리됩니다. 삽입 방법: 모드 선택 - 스트리밍(음성 발생 시 전사, 라이브 대화의 경우) 또는 배치(파일 업로드 - 수신된 텍스트, 녹음의 경우) 소음, 억양, 용어, 언어 등 정확도 요소를 고려합니다(종종 언어를 명시적으로 지정해야 함). 인식 오류를 처리합니다(STT는 특히 이름과 숫자에서 실수를 합니다. 사용자가 확인하고 수정하도록 합니다). 의미를 확인하기 위해 텍스트를 LLM에 전달합니다. STT는 끝이 아니라 입력입니다. 원시 기록은 거의 항상 정리되거나 이해되어야 합니다. 규칙: STT는 텍스트를 제공하지만 이해는 제공하지 않습니다. 모델은 의미를 따르고 소음, 언어 및 오류 검사를 통해 품질을 모니터링합니다.