LearnAI
मॉड्यूल 14 · वॉयस और मल्टीमॉडल एप्लिकेशन (प्रो) · पाठ 1/5
← कैटलॉग के लिए
काम

भाषण से पाठ (STT)

वाक् पहचान कैसे एम्बेड करें? JSON लौटाएं {"steps": [2+ चरणों की सूची], "why": "छोटा"}।

त्वरित एआई समीक्षा के लिए समाधान सबमिट करने के लिए एक्सेस अनलॉक करें।निःशुल्क प्रारंभ करें
उत्पाद में ध्वनि इनपुट
💡सिद्धांत का एक टुकड़ा

स्पीच टू टेक्स्ट (एसटीटी, स्पीच-टू-टेक्स्ट) ऑडियो को टेक्स्ट में बदल देता है, जिसे मॉडल द्वारा आगे संसाधित किया जाता है। एम्बेड कैसे करें: एक मोड चुनें - स्ट्रीमिंग (लाइव संवाद के लिए भाषण के रूप में प्रतिलेखन) या बैच (एक फ़ाइल अपलोड की गई - रिकॉर्डिंग के लिए पाठ प्राप्त हुआ); सटीकता कारकों को ध्यान में रखें - शोर, उच्चारण, शब्द, भाषा (अक्सर भाषा को स्पष्ट रूप से निर्दिष्ट किया जाना चाहिए); पहचान त्रुटियों को संभालें (एसटीटी गलतियाँ करता है, विशेष रूप से नामों और संख्याओं पर - उपयोगकर्ता को जाँचने और सही करने दें); अर्थ के लिए पाठ को एलएलएम पर भेजें। एसटीटी इनपुट है, अंत नहीं: कच्ची प्रतिलेख को लगभग हमेशा साफ करने या समझने की आवश्यकता होती है। नियम: एसटीटी पाठ देता है, लेकिन समझ नहीं - मॉडल अर्थ का पालन करता है, और शोर, भाषा और त्रुटि जांच द्वारा गुणवत्ता की निगरानी करता है।

इसका मूल्यांकन कैसे किया जाता है · उत्तीर्ण होना 70

  • 1इसके चारों ओर पाठ के बिना मान्य JSON30%
  • 2एक सरणी है steps और why35%
  • 32+ चरण: स्ट्रीम/बैच मोड, सटीकता कारक, त्रुटि प्रबंधन, एलएलएम में पास होना35%
आपका संकेतClaude ⌄