ध्वनि और प्रदर्शन का नियंत्रण
भावनाओं का मार्गदर्शन और नियंत्रण
'भावनाओं को सक्षम करने' (Enable Emotions) वाले बॉक्स को चुनने पर, आप संदर्भ और निर्धारित टैग्स का उपयोग करके अभिव्यक्ति के तरीके को नियंत्रित कर सकते हैं।
- संदर्भ-आधारित निर्देशन : मॉडल सीधे टेक्स्ट से संदर्भ की व्याख्या करता है। 'उत्साहपूर्वक कहा' जैसे वर्णनात्मक टेक्स्ट को जोड़ने या विस्मयादिबोधक चिह्नों का उपयोग करने से बातचीत के भाव पर असर पड़ेगा।
- ध्वनि-संकेत (आवाज़ से संबंधित): आवाज़ को निर्देशित करने के लिए इन संकेतों को पाठ (टेक्स्ट) के भीतर रखें।
नोट : प्रभाव चयनित ध्वनि पर निर्भर करता है।
- [हंसता है], [ज़ोर से हंसता है], [हंसने लगता है], [सांस फूलने की आवाज़]
- [फुसफुसाहट]
- [आह भरना], [साँस छोड़ना]
- [व्यंग्यात्मक], [जिज्ञासु], [उत्साहित], [रोते हुए], [नाक से आवाज़ निकालते हुए], [शरारतपूर्ण ढंग से]
- ध्वनि प्रभाव :
- [गोली चलने की आवाज़], [सराहना], [तालियाँ], [विस्फोट]
- [निगलना], [घूँट भरना]
- प्रायोगिक संकेत :
- [गाढ़ा X लहज़ा] (X की जगह मनचाहा लहज़ा लिखें, जैसे: [गाढ़ा लेबनानी लहज़ा])
- [गाता है], [वू], [पाद]
- विराम-चिह्न और पाठ की संरचना :
- पंक्ति पर बिंदु (…): ठहराव और भार (लय) जोड़ने के लिए।
- बड़े अक्षर: अधिक ज़ोर देने के लिए।
- मानक विराम चिह्न: स्वाभाविक वाक्-लय प्रदान करने के लिए।
महत्वपूर्ण सुझाव : इमोशनल मॉडल (भावनात्मक मॉडल) अभी 'अल्फा' चरण में है। बहुत छोटे निर्देशों के कारण असंगत परिणाम मिलने की संभावना रहती है। हम आपको 250 से अधिक अक्षरों वाले निर्देशों को आज़माने का सुझाव देते हैं। जब 'इमोशन्स इनेबल' (भावनाओं को सक्षम करने) वाला बॉक्स अनचेक (चयनित नहीं) होता है, तो सिस्टम स्थिरता और निरंतरता को प्राथमिकता देता है।
- निर्देश देने का तरीका :
- संदर्भ ही मुख्य है : वाक्य के स्वाभाविक प्रवाह पर ध्यान दें। आर्टिफिशियल इंटेलिजेंस (AI) टेक्स्ट को ठीक वैसे ही पढ़ेगा जैसा वह लिखा गया है।
- विराम चिह्न : इस तरह के चिह्नों का उपयोग करें।
- वाक्य संरचना:
- नोट : बहुत अधिक चिह्नों (marks) का उपयोग न करें, क्योंकि इससे अस्थिरता पैदा हो सकती है।
- नोट : यह सफल हो भी सकता है और नहीं भी, लेकिन यह संदर्भ पर निर्भर करता है। इसका उपयोग करते समय 'एक्सप्रेसिवनेस' (अभिव्यक्ति-क्षमता) और 'टेम्परेचर' (तापमान) को बढ़ाने का प्रयास करें।
- विराम चिह्न : छोटे ठहराव के लिए डैश (-) या हिचकिचाहट भरे लहज़े के लिए एलिप्सिस (...) का प्रयोग करें।
- कोई भावनात्मक संकेत नहीं : यहाँ कर्ली ब्रैकेट {} या ध्वनि-संबंधी संकेतों का उपयोग न करें; संभावना है कि AI उन्हें ज़ोर से पढ़ ले या नज़रअंदाज़ कर दे।
ऑडियो सेटिंग्स (उन्नत नियंत्रण)
आउटपुट को सटीकता से समायोजित करने के लिए इन मापदंडों को सेट करें।
- विश्वसनीयता गुणांक (स्थिरता)
- सीमा : अधिक कठोर (कम) ↔ अधिक लचीला (अधिक)।
- प्रभाव : उच्च तापमान (temperature) आर्टिफिशियल इंटेलिजेंस को अधिक स्वतंत्रता और अभिव्यक्ति क्षमता प्रदान करता है, लेकिन इससे अस्थिरता (हैलुसिनेशन) का जोखिम भी रहता है। कम तापमान आवाज़ को अधिक कठोर और स्थिर बनाता है।
- सुझाव : डिफ़ॉल्ट मान (लगभग 25-50) शुरुआत करने के लिए एक अच्छा बिंदु है।
- समानता
- दायरा : वॉयस-ओवर जैसा कम (न्यूनतम) ↔ वॉयस-ओवर जैसा (अधिकतम)।
- प्रभाव : इसे बढ़ाने से मूल संस्करण के साथ समानता बढ़ती है। हालाँकि, यदि संदर्भ ध्वनि (reference audio) में शोर (noise) है, तो उच्च समानता के कारण विकृतियाँ या खड़खड़ाहट (distortions/crackling) उत्पन्न हो सकती हैं।
- गति
- सीमा : 0.7 (धीमा) ↔ 1.2 (तेज़)। डिफ़ॉल्ट मान 1.0 है।
- प्रभाव : यह गति को नियंत्रित करता है। अत्यधिक मान गुणवत्ता को प्रभावित कर सकते हैं।
- अभिव्यंजनावाद
- दायरा : तटस्थ स्वर (न्यूनतम) ↔ भावनात्मक प्रस्तुति (अधिकतम)।
- प्रभाव : इसे बढ़ाने से आउटपुट सामान्य कार्य-निष्पादन के अधिक निकट आ जाता है। इसे अत्यधिक बढ़ाने से असामान्य व्यवहार का जोखिम पैदा हो सकता है।
'मकना' (Makna) गाइड में अगले लेख पर जाएँ।