स्पीच टू टेक्स्ट (STT) क्या है?
स्पीच टू टेक्स्ट (STT), जिसे ऑटोमैटिक स्पीच रिकग्निशन (ASR) भी कहते हैं, वह तकनीक है जो बोली गई भाषा को लिखे टेक्स्ट में बदलती है। यह ट्रांसक्रिप्शन, स्वचालित सबटाइटल, डिक्टेशन और वॉइस असिस्टेंट को चलाती है। सटीकता ज़्यादातर ऑडियो क्वालिटी, लहजे और शब्दावली पर निर्भर करती है। wawie पर स्पीच टू टेक्स्ट स्वचालित सबटाइटल चलाता है, जिन्हें आप एडिट, ट्रांसलेट और YouTube, TikTok या Instagram के लिए एक्सपोर्ट कर सकते हैं।
मुफ़्त अकाउंट बनाएँ 5,000 मुफ़्त क्रेडिट। किसी कार्ड की ज़रूरत नहीं।
अपडेट किया गया: 27 सितंबर 2026
स्पीच टू टेक्स्ट कैसे काम करता है?
स्पीच टू टेक्स्ट पहले ऑडियो को समय के साथ उसकी फ़्रीक्वेंसी की एक संक्षिप्त तस्वीर में बदलता है, आम तौर पर स्पेक्ट्रोग्राम में। बड़ी मात्रा में ट्रांसक्राइब की गई बोलचाल पर ट्रेन किया गया न्यूरल नेटवर्क उन फ़ीचर्स को संभावित ध्वनियों, शब्दों के टुकड़ों या अक्षरों से जोड़ता है। एक लैंग्वेज मॉडल, जो नेटवर्क में बना होता है या बाद में जोड़ा जाता है, संदर्भ के आधार पर सबसे संभावित शब्द चुनता है, ताकि सिस्टम एक जैसी आवाज़ वाले शब्दों में फ़र्क कर सके, जैसे हिंदी में कि और की। फिर पोस्ट-प्रोसेसिंग विराम चिह्न, जहाँ भाषा में हों वहाँ कैपिटल अक्षर, और संख्याओं का फ़ॉर्मेट जोड़ती है, और शब्दों या वाक्यांशों पर टाइमस्टैम्प लगाती है। सबटाइटल के लिए टेक्स्ट को बोलचाल के साथ टाइम की गई छोटी कैप्शन लाइनों में बाँटा जाता है और SRT या VTT जैसे फ़ॉर्मेट में एक्सपोर्ट किया जाता है।
स्पीच टू टेक्स्ट किस काम आता है?
स्पीच टू टेक्स्ट वहाँ इस्तेमाल होता है जहाँ बोले गए शब्दों को खोजने और पढ़ने लायक टेक्स्ट बनाना हो। वीडियो क्रिएटर इससे सबटाइटल और कैप्शन बनाते हैं, जो बिना आवाज़ के देखने वाले दर्शकों की मदद करते हैं और कंटेंट को बधिर और कम सुनने वाले लोगों के लिए सुलभ बनाते हैं। टीमें मीटिंग, इंटरव्यू और लेक्चर ट्रांसक्राइब करती हैं ताकि उन्हें खोजा और कोट किया जा सके। लेखक और प्रोफ़ेशनल बोलकर टाइप करने के लिए डिक्टेशन इस्तेमाल करते हैं। स्पीच टू टेक्स्ट AI डबिंग का पहला चरण भी है, जहाँ ट्रांसक्रिप्ट को दोबारा आवाज़ देने से पहले उसका अनुवाद किया जाता है। ट्रांसक्रिप्ट सर्च इंजन और AI असिस्टेंट को इंडेक्स करने लायक टेक्स्ट भी देती है।
- YouTube, TikTok और Instagram के लिए सबटाइटल और कैप्शन
- मीटिंग, इंटरव्यू और लेक्चर की ट्रांसक्रिप्ट
- डिक्टेशन और वॉइस टाइपिंग
- AI डबिंग का पहला चरण
स्पीच टू टेक्स्ट की सटीकता किन बातों पर निर्भर करती है?
स्पीच टू टेक्स्ट की सटीकता आम तौर पर वर्ड एरर रेट (WER) से मापी जाती है, यानी सही ट्रांसक्रिप्ट की तुलना में गलत, छूटे या जोड़े गए शब्दों का हिस्सा। माइक्रोफ़ोन के पास एक वक्ता की साफ़ ऑडियो सबसे अच्छे नतीजे देती है। बैकग्राउंड नॉइज़, संगीत, गूँज, एक-दूसरे की बात काटकर बोलते लोग, ऐसे लहजे जो मॉडल ने कम सुने हों, और ब्रांड नाम, मेडिकल शब्द या जार्गन जैसी ख़ास शब्दावली से सटीकता घटती है। एक ही वाक्य में हिंदी और अंग्रेज़ी मिलाकर बोलने से भी कुछ मॉडल चूक सकते हैं। तेज़ बोलचाल और कम क्वालिटी की रिकॉर्डिंग भी गलतियाँ बढ़ाती हैं। जो भी आप पब्लिश करें, उसके कैप्शन एक्सपोर्ट करने से पहले ट्रांसक्रिप्ट की समीक्षा करें और नाम व मुख्य शब्द ठीक करें।
स्पीच टू टेक्स्ट के उदाहरण
- एक YouTube क्रिएटर ट्यूटोरियल के लिए कैप्शन बनाता है, दो प्रोडक्ट नाम ठीक करता है और SRT फ़ाइल एक्सपोर्ट करता है।
- एक Reels क्रिएटर म्यूट पर देखने वाले दर्शकों के लिए शॉर्ट वीडियो में स्टाइल वाले कैप्शन बर्न करता है।
- एक शोधकर्ता रिकॉर्ड किए गए इंटरव्यू ट्रांसक्राइब करता है ताकि रिपोर्ट में उन्हें खोज और कोट कर सके।
- फ़ोन का डिक्टेशन फ़ीचर आपके बोलते ही मैसेज टाइप कर देता है।
अक्सर पूछे जाने वाले सवाल
स्पीच टू टेक्स्ट और टेक्स्ट टू स्पीच में क्या फ़र्क है?
ये उल्टी दिशाओं में काम करते हैं। स्पीच टू टेक्स्ट (STT) बोली गई ऑडियो सुनकर उसे लिखता है, और ट्रांसक्रिप्ट या सबटाइटल बनाता है। टेक्स्ट टू स्पीच (TTS) लिखा टेक्स्ट लेकर उसे सिंथेटिक आवाज़ में पढ़ता है। स्पीच टू टेक्स्ट बोलचाल को समझने के बारे में है, जबकि टेक्स्ट टू स्पीच उसे बनाने के बारे में। दोनों को अक्सर साथ इस्तेमाल किया जाता है, जैसे AI डबिंग में, जहाँ वीडियो को ट्रांसक्राइब, ट्रांसलेट और फिर दूसरी भाषा में दोबारा आवाज़ दी जाती है।
स्पीच टू टेक्स्ट कितना सटीक है?
व्यापक रूप से सपोर्ट की गई भाषाओं में साफ़ बोलचाल पर आधुनिक स्पीच टू टेक्स्ट बहुत सटीक है, और बची हुई ज़्यादातर गलतियाँ नामों, जार्गन, संख्याओं और एक साथ बोलते वक्ताओं में होती हैं। बैकग्राउंड नॉइज़, संगीत, गूँज, तेज़ बोलचाल और अनजान लहजों से सटीकता घटती है। इसे वर्ड एरर रेट (WER) से मापा जाता है: रेट जितना कम, उतना बेहतर। पब्लिश होने वाले वीडियो के कैप्शन की हमेशा समीक्षा करनी चाहिए। wawie पर हर कैप्शन एक्सपोर्ट से पहले एडिट किया जा सकता है, और आप इसे 5,000 क्रेडिट के साथ मुफ़्त टेस्ट कर सकते हैं, किसी कार्ड की ज़रूरत नहीं।
SRT और VTT सबटाइटल फ़ाइलें क्या होती हैं?
SRT (SubRip) और VTT (WebVTT) सबसे आम सबटाइटल फ़ाइल फ़ॉर्मेट में से दो हैं। दोनों प्लेन टेक्स्ट फ़ाइलें हैं जिनमें कैप्शन की एक सूची होती है, और हर कैप्शन में शुरू होने का समय, ख़त्म होने का समय और दिखाया जाने वाला टेक्स्ट होता है। SRT लगभग हर वीडियो प्लेटफ़ॉर्म और एडिटर में सपोर्ट होता है। WebVTT, HTML5 वीडियो का वेब स्टैंडर्ड है और अतिरिक्त स्टाइलिंग और पोज़िशनिंग सपोर्ट करता है। आप इनमें से कोई भी फ़ाइल अपने वीडियो के साथ अपलोड करते हैं, ताकि दर्शक कैप्शन चालू या बंद कर सकें।
कैप्शन और सबटाइटल में क्या फ़र्क है?
अमेरिका में कैप्शन का मतलब आम तौर पर उन दर्शकों के लिए उसी भाषा का टेक्स्ट होता है जो ऑडियो नहीं सुन सकते, इसलिए उनमें संगीत या हँसी जैसी ज़रूरी आवाज़ों का भी ज़िक्र होता है और वक्ताओं की पहचान भी हो सकती है। सबटाइटल का मतलब आम तौर पर सिर्फ़ डायलॉग की ट्रांसक्रिप्ट या अनुवाद होता है, उन दर्शकों के लिए जो सुन सकते हैं। ब्रिटेन में सबटाइटल शब्द अक्सर दोनों के लिए इस्तेमाल होता है, और हिंदी में भी दोनों शब्द अक्सर एक ही मतलब में बोले जाते हैं। क्लोज़्ड कैप्शन बंद किए जा सकते हैं, जबकि ओपन या बर्न-इन कैप्शन वीडियो की तस्वीर का हिस्सा होते हैं और हमेशा दिखते हैं।
संबंधित शब्द
- टेक्स्ट टू स्पीच (TTS): टेक्स्ट टू स्पीच लिखे हुए टेक्स्ट को स्वाभाविक लगने वाली बोली गई ऑडियो में बदलता है, जिसका इस्तेमाल वॉइसओवर, नैरेशन, एक्सेसिबिलिटी और वॉइस असिस्टेंट में होता है।
- AI डबिंग: AI डबिंग वीडियो की बोलचाल का अनुवाद करके उसे दूसरी भाषा में नई आवाज़ देती है, मूल टाइमिंग के साथ और चाहें तो मूल आवाज़ में।
- वॉइस आइसोलेशन: वॉइस आइसोलेशन आवाज़ को बैकग्राउंड नॉइज़, संगीत और कमरे की गूँज से अलग करता है, और साफ़ बोलचाल छोड़ता है जिसे आप पब्लिश, ट्रांसक्राइब या डब कर सकते हैं।
मुफ़्त अकाउंट बनाएँ 5,000 मुफ़्त क्रेडिट। किसी कार्ड की ज़रूरत नहीं।