LearnAI
모듈 14 · 음성 및 다중 모달 애플리케이션(Pro) · 수업 1/5
← 카탈로그로

음성을 텍스트로 변환(STT)

음성 인식을 삽입하는 방법은 무엇입니까? JSON {"steps": [2개 이상의 단계 목록], "why": "short"}를 반환합니다.

즉각적인 AI 검토를 위해 솔루션을 제출할 수 있는 액세스 권한을 잠금 해제하세요.무료로 시작하세요
제품 내 음성 입력
💡 이론의 일부

STT(Speech-to-Text)는 오디오를 텍스트로 변환하며, 이는 모델에 의해 추가 처리됩니다. 삽입 방법: 모드 선택 - 스트리밍(음성 발생 시 전사, 라이브 대화의 경우) 또는 배치(파일 업로드 - 수신된 텍스트, 녹음의 경우) 소음, 억양, 용어, 언어 등 정확도 요소를 고려합니다(종종 언어를 명시적으로 지정해야 함). 인식 오류를 처리합니다(STT는 특히 이름과 숫자에서 실수를 합니다. 사용자가 확인하고 수정하도록 합니다). 의미를 확인하기 위해 텍스트를 LLM에 전달합니다. STT는 끝이 아니라 입력입니다. 원시 기록은 거의 항상 정리되거나 이해되어야 합니다. 규칙: STT는 텍스트를 제공하지만 이해는 제공하지 않습니다. 모델은 의미를 따르고 소음, 언어 및 오류 검사를 통해 품질을 모니터링합니다.

평가 방법 · 합격 70

  • 1주변에 텍스트가 없는 유효한 JSON30%
  • 2steps 및 why 배열이 있습니다.35%
  • 32개 이상의 단계: 스트림/배치 모드, 정확도 요인, 오류 처리, LLM으로 전달35%
귀하의 프롬프트Claude ⌄