वाक् पहचान कैसे एम्बेड करें? JSON लौटाएं {"steps": [2+ चरणों की सूची], "why": "छोटा"}।
स्पीच टू टेक्स्ट (एसटीटी, स्पीच-टू-टेक्स्ट) ऑडियो को टेक्स्ट में बदल देता है, जिसे मॉडल द्वारा आगे संसाधित किया जाता है। एम्बेड कैसे करें: एक मोड चुनें - स्ट्रीमिंग (लाइव संवाद के लिए भाषण के रूप में प्रतिलेखन) या बैच (एक फ़ाइल अपलोड की गई - रिकॉर्डिंग के लिए पाठ प्राप्त हुआ); सटीकता कारकों को ध्यान में रखें - शोर, उच्चारण, शब्द, भाषा (अक्सर भाषा को स्पष्ट रूप से निर्दिष्ट किया जाना चाहिए); पहचान त्रुटियों को संभालें (एसटीटी गलतियाँ करता है, विशेष रूप से नामों और संख्याओं पर - उपयोगकर्ता को जाँचने और सही करने दें); अर्थ के लिए पाठ को एलएलएम पर भेजें। एसटीटी इनपुट है, अंत नहीं: कच्ची प्रतिलेख को लगभग हमेशा साफ करने या समझने की आवश्यकता होती है। नियम: एसटीटी पाठ देता है, लेकिन समझ नहीं - मॉडल अर्थ का पालन करता है, और शोर, भाषा और त्रुटि जांच द्वारा गुणवत्ता की निगरानी करता है।