LearnAI
モジュール 14 · 音声およびマルチモーダル アプリケーション (Pro) · レッスン 1/5
← カタログへ
タスク

音声入力 (STT)

音声認識を埋め込むにはどうすればよいですか? JSON {"steps": [2 つ以上のステップのリスト], "why": "short"} を返します。

アクセスのロックを解除して、AI による即時レビューのためにソリューションを送信します。無料で始める
製品への音声入力
💡 理論の一部

Speech to Text (STT、speech-to-text) は音声をテキストに変換し、モデルによってさらに処理されます。埋め込み方法: モードを選択します - ストリーミング (ライブダイアログの場合、音声が発生すると文字に起こします) またはバッチ (ファイルのアップロード - 受信したテキスト、録音の場合)。ノイズ、アクセント、用語、言語などの精度要素を考慮します (多くの場合、言語は明示的に指定する必要があります)。認識エラーを処理します (STT は、特に名前と番号に関して間違いを犯します。ユーザーが確認して修正できるようにします)。テキストを意味を理解するために LLM に渡します。 STT は入力であり、終わりではありません。ほとんどの場合、生のトランスクリプトをクリーンアップするか、意味を理解する必要があります。ルール: STT はテキストを提供しますが、理解はしません。モデルは意味に従い、ノイズ、言語、エラー チェックによって品質を監視します。

どのように評価されますか? 合格 70

  • 1周囲にテキストのない有効な JSON30%
  • 2配列 steps と why があります35%
  • 32 つ以上のステップ: ストリーム/バッチ モード、精度係数、エラー処理、LLM へのパス35%
あなたのプロンプトClaude ⌄