इनपुट के लिए सर्वोत्तम अभ्यास (Best Practices for Input)
संख्याएँ (Numbers)
- संख्याएँ : टेक्स्ट-टू-स्पीच मॉडल को फ़ोन नंबर या मुद्रा (करेंसी) जैसे प्रारूपों के साथ कठिनाई हो सकती है।
- सुझाव : अस्पष्टता दूर करने के लिए संख्याओं को शब्दों में लिखें (उदाहरण के लिए, 1 के बजाय 'एक' लिखें)।
- फ़ोन नंबर : 123-456-7890 ← एक दो तीन, चार पाँच छह...
- मुद्रा : $45.67 ← पैंतालीस डॉलर और सड़सठ सेंट।
- संक्षिप्त रूप : स्पष्टता के लिए उन्हें विस्तार से और पूरा लिखें।
- د. ← डॉक्टर، ش. ← सड़क।
- लिंक/प्रतीक :
- moknah.io/docs ← moknah.io/docs (इसे वैसे ही लिखें जैसे
उच्चारण किया जाता है)।
- 100% ← सौ प्रतिशत।
अवलोकन (Overview)
'टेक्स्ट-टू-ऑडियो' (Text to Audio) या 'टेक्स्ट-टू-ऑडियो स्टूडियो' का उपयोग करके अपनी पहली ऑडियो फ़ाइल बनाना बेहद आसान है। हालाँकि, इन सुविधाओं का भरपूर लाभ उठाने के लिए कुछ बातों का ध्यान रखना आवश्यक है।
मार्गदर्शिका (Guide)
1
टेक्स्ट-टू-स्पीच (text-to-speech) पेज पर दिए गए इनपुट बॉक्स में अपना टेक्स्ट लिखें या पेस्ट करें।
बेहतरीन ऑडियो जनरेशन (ध्वनि निर्माण) के लिए आप हमेशा अपने टेक्स्ट में एक्सप्रेशन टैग्स (भाव-सूचक टैग) शामिल कर सकते हैं।
- भावनाओं (Emotions) को सक्रिय करने के लिए : कोष्ठक के भीतर टैग्स का उपयोग करें, जैसे [shouting] (चिल्लाना) या [breathing] (सांस लेना)। ये टैग्स बहुत प्रभावी हैं (पूरी सूची के लिए Voice Tags अनुभाग देखें)।
- यदि भावनाएँ (emotions) सक्रिय नहीं हैं : तो भी आप अपेक्षित प्रस्तुति का वर्णन कर सकते हैं (जैसे 'excited' या 'उत्साहित' लिखना) या से घिरे टैग्स का उपयोग कर सकते हैं; हालाँकि, ये टैग्स प्रायोगिक हैं और हो सकता है कि ये उतनी स्थिरता से काम न करें।
- नोट : सभी टैग्स (tags) अंग्रेज़ी भाषा में होने चाहिए, क्योंकि अन्य भाषाओं में इनका उपयोग प्रायोगिक माना जाता है और हो सकता है कि ये ठीक से काम न करें। हम भविष्य के अपडेट्स में इमोजी और बटनों का उपयोग करके इस प्रक्रिया को सरल बनाने पर काम कर रहे हैं।
- अक्षरों की सीमा और लंबा कंटेंट: स्टैंडर्ड ऑडियो जनरेशन बॉक्स को छोटे क्लिप्स के लिए डिज़ाइन किया गया है और इसमें केवल 1500 अक्षरों की क्षमता है (बेहतर गुणवत्ता के लिए हम प्रति जनरेशन लगभग 200 अक्षरों का सुझाव देते हैं)।
- बड़ी मात्रा में सामग्री के लिए: यदि आप ऑडियो को बिना किसी दोबारा एडिटिंग या जोड़ने (assembling) की आवश्यकता के एक ही निरंतर हिस्से के रूप में प्राप्त करना चाहते हैं—जैसे कि ऑडियोबुक्स या लंबे लेख—तो इस इनपुट बॉक्स का उपयोग न करें। इसके बजाय, 'टेक्स्ट-टू-ऑडियो स्टूडियो' (Text to Audio Studio) का उपयोग करें। यह स्टूडियो आपको पूरे दस्तावेज़ अपलोड करने और लंबी सामग्री के निर्माण को कुशलतापूर्वक स्वचालित (automate) करने की सुविधा देता है।
2
आवाज़ का चयन (Voice selection)
अपनी सूची में से उस आवाज़ को चुनें जिसका आप उपयोग करना चाहते हैं।
आवाज़ का चयन महत्वपूर्ण है; उदाहरण के लिए, यदि आप ऐसी आवाज़ चाहते हैं जो मानक अरबी (Fusha) में बात करे, तो बेहतर है कि शुरू से ही इसके लिए विशेष रूप से तैयार की गई आवाज़ चुनें, न कि किसी बोलचाल की बोली (dialect) के लिए बनी आवाज़। हालाँकि, इसका मतलब यह नहीं है कि यदि आप किसी विशिष्ट बोली वाली आवाज़ चुनते हैं तो वह टेक्स्ट को मानक अरबी में नहीं पढ़ेगी; बल्कि वह उसे पढ़ेगी और शायद उसमें अच्छी जीवंतता भी लाएगी। लेकिन, यदि आप 'इमोशन पैरामीटर' (emotion parameter) या 'टेम्परेचर' (temperature) को बढ़ाते हैं, तो इसके अप्रत्याशित परिणाम हो सकते हैं, क्योंकि आवाज़ उस बोली की ओर झुक जाएगी जिस पर उसे क्लोन (clone) किया गया था।
उदाहरण के लिए, मान लीजिए कि आप किसी विशिष्ट लहजे (dialect) में प्रस्तुति चाहते हैं। ऐसी स्थिति में, यदि आप 'इमोशन पैरामीटर' (भावना गुणांक) को सक्रिय नहीं करना चाहते और कोई सामान्य आवाज़ चुनते हैं, तो अभिव्यक्ति और गर्माहट (warmth) को बढ़ाने से प्रस्तुति आपके इच्छित लहजे के और करीब आ जाएगी। वैसे भी, वॉइस परफॉर्मेंस इनपुट के संदर्भ (context) पर आधारित होती है; यदि मॉडल इनपुट किए गए लहजे को समझ जाता है, तो वह उसकी नकल करने और उसे प्रस्तुत करने का प्रयास करेगा, भले ही चुनी गई आवाज़ विशेष रूप से उस लहजे के लिए न बनी हो। हमेशा याद रखें कि आप जितना अधिक अभ्यास करेंगे, सेटिंग्स और उनके संचालन के बारे में आपकी समझ उतनी ही बेहतर होगी, जिससे आप बेहतरीन परिणाम प्राप्त कर सकेंगे।
3
सेटिंग्स कॉन्फ़िगर करना (वैकल्पिक)
वांछित आउटपुट प्राप्त करने के लिए ऑडियो सेटिंग्स को समायोजित करें।
हम जिस डिफ़ॉल्ट (Default) सेटिंग की अनुशंसा करते हैं, वह नीचे दी गई तस्वीर में दिखाई गई है:
सेटिंग्स :
- रचनात्मकता गुणांक (तापमान) :
- उच्च = अधिक लचीलापन
- कम = अधिक जड़
- 'तापमान' (temperature) बढ़ाने से AI मॉडल को आवाज़ को नियंत्रित करने की अधिक स्वतंत्रता मिलती है, लेकिन इसे बहुत अधिक बढ़ाने से अजीब परिणाम सामने आ सकते हैं; वहीं, इसे शून्य पर रखने से आवाज़ का प्रदर्शन बहुत कठोर और बेजान हो जाएगा। इसलिए, इसे एक उपयुक्त मध्य-बिंदु पर सेट करना सबसे अच्छा है जो आपकी ज़रूरतों को पूरा करे।
- समानता: Similarity
- उच्चतम = मूल ध्वनि के समान
- कम = मूल ध्वनि से कम मिलता-जुलता
- मैचिंग गुणांक (matching coefficient) को बढ़ाने से क्लोन की गई आवाज़ और मूल आवाज़ में समानता बढ़ती है; हालाँकि, यदि रेफरेंस सैंपल साफ़ या उच्च गुणवत्ता वाला न हो, तो इसे अधिकतम स्तर पर ले जाने से आवाज़ में खड़खड़ाहट जैसी विकृतियाँ (distortions) आने का जोखिम रहता है। यदि आपको सटीक मिलान की आवश्यकता है और सैंपल साफ़ है, तो आप इसे अधिकतम स्तर पर सेट कर सकते हैं; अन्यथा, अधिक साफ़ और बेहतर परिणाम पाने के लिए इसे कम रखें।
- गति: Speed
- उच्चतर = तीव्रतर
- कम = धीमा
- आवाज़ की गति को अधिकतम सीमा तक बढ़ाने या न्यूनतम सीमा तक घटाने से उत्पन्न ध्वनि की गुणवत्ता कम हो सकती है; इसलिए, हम सलाह देते हैं कि केवल आवश्यकता पड़ने पर ही इस विकल्प का उपयोग किया जाए।
- अभिव्यक्ति- क्षमता : Expressiveness
- उच्चतम = भावनात्मक प्रस्तुति
- कम = तटस्थ लहज़ा
- इमोशन गुणांक (emotion coefficient) को बढ़ाने से आउटपुट स्वाभाविक प्रदर्शन के करीब आता है, लेकिन इसे अत्यधिक बढ़ाने से अजीब व्यवहार उत्पन्न होने का जोखिम रहता है; इसलिए, बड़ी मात्रा में ऑडियो जेनरेट करते समय—विशेषकर Voice Studio में—हम इसे शून्य पर रखने और विशिष्ट वाक्यों पर इसे प्रयोगात्मक रूप से बढ़ाने की सलाह देते हैं।
भावना संबंधी सेटिंग्स (Emotion Setting slides) :
हम जिस डिफ़ॉल्ट सेटिंग की अनुशंसा करते हैं, वह बगल की तस्वीर में दिखाई गई है:
यदि आप 'इमोशन' (Emotion) को सक्रिय (enable) करने का विकल्प चुनते हैं, जैसा कि ऊपर दी गई तस्वीर में दिखाया गया है, तो 'टेम्परेचर' (Temperature) को बढ़ाने की अनुशंसा की जाती है।
4
वांछित प्रोसेसिंग मोड (नॉर्मलाइज़ेशन) चुनें।
- बेसिक (Basic): बिना किसी अतिरिक्त बदलाव के अरबी भाषा के लिए उपयुक्त, और अरबी के अलावा अन्य भाषाओं के लिए भी उपयुक्त।
- आर्टिफिशियल इंटेलिजेंस (AI) से उन्नत: इसे विशेष रूप से अरबी भाषा के लिए डिज़ाइन किया गया है, ताकि यह संदर्भ को समझ सके, वाक्य या अनुच्छेद को विभाजित कर सके और उच्चारण के लिए उपयुक्त आवश्यक 'तशकील' (स्वर-चिह्न) लागू कर सके।
5
उत्पन्न करना (Generate)
अपनी ऑडियो फ़ाइल बनाने के लिए 'Text to Audio' पेज पर 'Run' बटन या 'Text to Audio Studio ' में ' Generate ' बटन पर क्लिक करें। स्टूडियो में, आप 'merge' (मर्ज) बटन पर क्लिक करके एक ही बार में हज़ारों लाइनों को जेनरेट कर सकते हैं।
'मकना' (Makna) गाइड में अगले लेख पर जाएँ।