音声認識を埋め込むにはどうすればよいですか? JSON {"steps": [2 つ以上のステップのリスト], "why": "short"} を返します。
Speech to Text (STT、speech-to-text) は音声をテキストに変換し、モデルによってさらに処理されます。埋め込み方法: モードを選択します - ストリーミング (ライブダイアログの場合、音声が発生すると文字に起こします) またはバッチ (ファイルのアップロード - 受信したテキスト、録音の場合)。ノイズ、アクセント、用語、言語などの精度要素を考慮します (多くの場合、言語は明示的に指定する必要があります)。認識エラーを処理します (STT は、特に名前と番号に関して間違いを犯します。ユーザーが確認して修正できるようにします)。テキストを意味を理解するために LLM に渡します。 STT は入力であり、終わりではありません。ほとんどの場合、生のトランスクリプトをクリーンアップするか、意味を理解する必要があります。ルール: STT はテキストを提供しますが、理解はしません。モデルは意味に従い、ノイズ、言語、エラー チェックによって品質を監視します。