यूज़र गाइड API संदर्भ

अक्सर पूछे जाने वाले सवाल और समस्या निवारण

आम सवाल और उनके समाधान

अक्सर पूछे जाने वाले सवाल

हर बार आउटपुट अलग क्यों होता है?

AI नॉन-डिटरमिनिस्टिक है। एक इंसान एक्टर की तरह, यह हर बार थोड़ी अलग परफॉर्मेंस देता है। इस बदलाव को कंट्रोल करने के लिए टेम्परेचर स्लाइडर का इस्तेमाल करें:

  • कम तापमान: अधिक एकसमान और अनुमान-योग्य आउटपुट
  • अधिक तापमान: अधिक विविधता और अभिव्यक्ति

आवाज़ का चुनाव इतना महत्वपूर्ण क्यों है?

आवाज़ चुनने का आउटपुट पर बहुत बड़ा असर पड़ता है। AI चुनी हुई आवाज़ की खूबियाँ अपना लेता है:

  • अगर आपको आत्म-चिंतन वाली आवाज़ चाहिए, तो ऐसी आवाज़ चुनें जो आत्म-चिंतनशील लगे।
  • अगर आपको जोशीली आवाज़ चाहिए, तो जोशीले सैंपल्स से क्लोन की गई आवाज़ चुनें।
  • अगर आपको कोई खास बोली चाहिए, तो उस बोली में ट्रेन की गई आवाज़ चुनें।
याद रखें: अच्छा इनपुट = अच्छा आउटपुट

अगर आप ऐसा ऑडियो देते हैं जिसमें शोर, गूँज (reverb) या एक से ज़्यादा बोलने वाले हों, तो AI ठीक से काम नहीं करेगा। सबसे अच्छे नतीजों के लिए हमेशा साफ़ और अच्छी क्वालिटी वाले सोर्स मटीरियल का इस्तेमाल करें।

क्रेडिट की गणना कैसे की जाती है?

क्रेडिट की गणना आपके टेक्स्ट में मौजूद कैरेक्टर की संख्या और चुने गए नॉर्मलाइज़ेशन मोड के आधार पर की जाती है:

  • बेसिक नॉर्मलाइज़ेशन: x1 क्रेडिट
  • AI-बेहतर नॉर्मलाइज़ेशन: x2 क्रेडिट

कौन सा ऑडियो फ़ॉर्मेट जनरेट होता है?

बेहतर क्वालिटी और कम्पैटिबिलिटी के लिए, सभी जेनरेट किए गए ऑडियो MP3 फ़ॉर्मैट में 128 या 192 kbps (44.1 kHz) पर दिए जाते हैं।

क्या कैरेक्टर की कोई सीमा है?

मोड कैरेक्टर लिमिट लगभग अवधि
भावनाएँ और बोलियाँ चालू हैं 3,000 कैरेक्टर ~3 मिनट
स्टैंडर्ड मोड 10,000 कैरेक्टर ~10 मिनट
टेक्स्ट से ऑडियो (त्वरित) 1,500 कैरेक्टर ~1.5 मिनट

लंबे कंटेंट के लिए, इसका इस्तेमाल करें टेक्स्ट-टू-ऑडियो स्टूडियो.

क्या मैं जेनरेट किए गए ऑडियो का कमर्शियल इस्तेमाल कर सकता हूँ?

हाँ, आपके सब्सक्रिप्शन की शर्तों के अनुसार, आपके अकाउंट से बनाए गए सभी ऑडियो का इस्तेमाल कमर्शियल कामों के लिए किया जा सकता है।


समस्या निवारण

ऑडियो रोबोट जैसा सुनाई देता है।

  • ज़्यादा नैचुरल वेरिएशन के लिए टेम्परेचर सेटिंग को बढ़ाकर देखें।
  • एक्सप्रेसिवनेस स्लाइडर को थोड़ा बढ़ाएँ।
  • भावपूर्ण कंटेंट के लिए ’इमोशन्स और डायलेक्ट्स मोड’ चालू करें।
  • एक अलग आवाज़ आज़माएँ जो आपके कंटेंट के स्टाइल से मेल खाती हो।

आउटपुट एक जैसा नहीं है या स्थिर नहीं है।

  • तापमान की सेटिंग कम करें
  • एक्सप्रेसिवनेस स्लाइडर को कम करें
  • लंबे प्रॉम्प्ट का इस्तेमाल करें (इमोशन्स मोड के लिए 250 से ज़्यादा कैरेक्टर का सुझाव दिया जाता है)
  • यह पक्का करें कि आपका सोर्स ऑडियो (वॉयस क्लोनिंग के लिए) साफ़ और बिना शोर वाला हो।

जनरेशन धीमी है।

  • लंबे टेक्स्ट को प्रोसेस करने में ज़्यादा समय लगता है।
  • AI-युक्त नॉर्मलाइज़ेशन के लिए अतिरिक्त प्रोसेसिंग की आवश्यकता होती है।
  • अपना इंटरनेट कनेक्शन चेक करें

अप्रत्याशित उच्चारण

  • अरबी टेक्स्ट के लिए AI-एन्हांस्ड नॉर्मलाइज़ेशन का इस्तेमाल करें (यह अपने-आप डायक्रिटिक्स जोड़ता है)
  • अस्पष्ट शब्दों में मैन्युअल रूप से डायक्रिटिक्स (तशकील) जोड़ें।
  • संख्याओं को अंकों के बजाय शब्दों में लिखें।
  • संक्षिप्त रूपों का पूरा रूप लिखें (जैसे, ’Dr.’ → ’Doctor’)
  • कोई दूसरी आवाज़ आज़माएँ - कुछ आवाज़ें कुछ शब्दों को बेहतर ढंग से बोल पाती हैं।

बोली ठीक से काम नहीं कर रही है

  • पक्का करें कि चुनी गई आवाज़ आपके टेक्स्ट की बोली से मेल खाती हो।
  • बोली वाले कंटेंट के लिए बेसिक नॉर्मलाइज़ेशन का इस्तेमाल करें (AI-एनहैंस्ड नहीं)
  • मॉडल को ’प्राइम’ करने के लिए अपने टेक्स्ट की शुरुआत किसी दमदार बोली वाले शब्द से करें।
  • भावनाओं और बोलियों का मोड चालू करें

वॉइस क्लोन असली आवाज़ जैसा नहीं लगता।

  • सिमिलैरिटी स्लाइडर को बढ़ाएँ
  • पक्का करें कि आपका ट्रेनिंग ऑडियो अच्छी क्वालिटी का हो (उसमें कोई शोर, गूँज या रिवर्ब न हो)।
  • यह जाँच लें कि ट्रेनिंग ऑडियो में शुरू से आखिर तक एक जैसा टोन और एनर्जी थी।
  • अगर सोर्स में नॉइज़ था, तो आर्टिफैक्ट्स को कम करने के लिए सिमिलैरिटी को घटा दें।

सपोर्ट से संपर्क करें

हमारी सपोर्ट टीम से यहाँ संपर्क करें support@moknah.io और हम किसी भी समस्या को हल करने में आपकी मदद करेंगे।