Meilleures pratiques pour la saisie
Les nombres (Numbers)
- Nombres : les modèles de synthèse vocale peuvent rencontrer des difficultés avec certains formats, tels que les numéros de téléphone ou les devises.
- Recommandation : écrivez les nombres en toutes lettres pour éviter toute ambiguïté (par exemple, écrivez « un » au lieu de « 1 »).
- Numéros de téléphone : 123-456-7890 ← un deux trois, quatre cinq six...
- Devises : 45,67 $ ← Quarante-cinq dollars et soixante-sept cents.
- Abréviations : développez-les et écrivez-les en entier pour plus de clarté.
- Dr ← Docteur, Rue ← Rue.
- Liens/Symboles :
- moknah.io/docs ← moknah point i o slash docs (écrivez-la telle quelle
se prononce).
- 100 % ← cent pour cent.
Vue d'ensemble
Il est très simple de commencer à générer votre premier fichier audio à l'aide de la fonction de conversion de texte en audio ou du studio dédié (Text to Audio Studio). Toutefois, pour tirer le meilleur parti de ces fonctionnalités, il convient de prendre en compte certains aspects.
Le guide
1
Saisissez ou collez votre texte dans la zone de saisie de la page de conversion de texte en audio.
Vous pouvez toujours intégrer des balises expressives dans votre texte pour obtenir des performances optimales lors de la génération de la voix.
- Si vous activez les émotions (Emotions), utilisez des balises entre crochets, telles que [shouting] (cri) ou [breathing] (respiration). Ces balises sont très efficaces (consultez la section « Voice Tags » pour obtenir la liste complète) .
- Si les émotions ne sont pas activées : vous pouvez toujours décrire l'interprétation souhaitée (par exemple, en écrivant « excited ») ou utiliser des balises encadrées par , bien que ces balises soient expérimentales et puissent ne pas fonctionner avec la même fiabilité.
- Remarque : tous les tags doivent être en anglais, car leur utilisation dans d'autres langues est considérée comme expérimentale et pourrait ne pas fonctionner de manière fiable. Nous travaillons à simplifier ce processus grâce à l'utilisation d' emojis et de boutons dans les prochaines mises à jour.
- Limites de caractères et contenu long : le champ de génération audio standard est conçu pour des séquences courtes et ne peut contenir que 1 500 caractères (nous recommandons environ 200 caractères par génération pour une qualité optimale).
- Pour les volumes importants : si vous souhaitez obtenir un fichier audio continu et sans coupures — comme pour des livres audio ou des articles longs — n'utilisez pas ce champ de saisie. Utilisez plutôt le studio de conversion texte-audio (Text to Audio Studio). Ce studio vous permet de télécharger des documents complets et d'automatiser efficacement la production de contenus longs.
2
Sélection de la voix
Choisissez le son que vous souhaitez utiliser dans votre liste.
Le choix de la voix est important ; par exemple, si vous souhaitez une voix s'exprimant en arabe littéral (Fusha), il vaut mieux opter dès le départ pour une voix conçue à cet effet plutôt que pour une voix destinée à un dialecte familier. Cela ne signifie pas pour autant qu'une voix associée à un dialecte spécifique sera incapable de lire un texte en arabe littéral ; elle le lira effectivement, et pourra même lui conférer une belle expressivité. Toutefois, si vous augmentez le paramètre d'émotion ou la « température », vous risquez d'obtenir des résultats inattendus, car la voix aura tendance à basculer vers le dialecte sur lequel elle a été clonée.
Prenons un exemple : supposons que vous souhaitiez une interprétation dans un dialecte spécifique. Si vous choisissez une voix standard sans activer le paramètre d'émotion, le fait d'augmenter l'expressivité et la chaleur de la voix rapprochera davantage le rendu du dialecte visé. Quoi qu'il en soit, la performance vocale repose sur le contexte du texte d'entrée ; si le modèle saisit le dialecte utilisé, il tentera de l'imiter et de le reproduire, même si la voix sélectionnée n'est pas spécialisée dans ce dialecte. N'oubliez jamais que plus vous vous exercerez, mieux vous comprendrez l'équilibre à trouver entre les différents paramètres et leur manipulation, ce qui vous permettra d'obtenir des résultats impressionnants.
3
Configuration des paramètres (facultatif)
Ajustez les paramètres audio pour obtenir la sortie souhaitée.
Le paramètre par défaut que nous recommandons est illustré dans l'image ci-dessous :
Paramètres :
- Coefficient de créativité (Température) :
- Plus élevé = plus de flexibilité
- Moins = plus rigide
- Augmenter la « température » offre au modèle d'IA une plus grande liberté dans la modulation de la voix, mais une valeur trop élevée risque d'entraîner des résultats étranges ; à l'inverse, la réduire à zéro rendra la performance vocale rigide et dénuée de vie. Il est donc préférable de la régler sur une valeur intermédiaire adaptée à vos besoins.
- التطابق : Similitude
- Plus élevé = fidèle au son original
- Moins = moins ressemblant au son original
- Augmenter le coefficient de correspondance renforce la similitude avec le son original reproduit ; toutefois, le régler au maximum lorsque l'échantillon de référence n'est pas propre ou de haute qualité risque d'introduire des distorsions sonores, telles que des crépitements. Vous pouvez le régler au maximum si vous avez besoin d'une correspondance parfaite, à condition que l'échantillon soit propre ; dans le cas contraire, réduisez-le pour obtenir un résultat plus net et de meilleure qualité.
- Vitesse : Speed
- Plus élevé = plus rapide
- Moins = plus lent
- Augmenter la vitesse de la voix au maximum ou la réduire au minimum peut altérer la qualité de la voix générée ; par conséquent, nous recommandons de ne recourir à cette option qu'en cas de nécessité.
- L'expressivité : Expressiveness
- Plus élevé = déclamation émotive
- Moins = ton neutre
- Augmenter le coefficient d'émotion rapproche le résultat d'une interprétation naturelle, mais une augmentation excessive risque d'entraîner des comportements inhabituels ; par conséquent, lors de la génération audio en masse, notamment dans Voice Studio, nous recommandons de le maintenir à zéro et de l'ajuster de manière expérimentale sur des phrases spécifiques.
Paramètres d'émotion (diapositives de réglage de l'émotion) :
Le réglage par défaut que nous recommandons est illustré sur l'image ci-contre :
Si vous choisissez d'activer l'émotion (Enable Emotion), comme sur l'image ci-dessus, le réglage recommandé consiste à augmenter la température (Temperature).
4
Sélectionnez le mode de traitement souhaité (normalisation).
- Basique (Basic) : convient à la langue arabe sans aucun ajout, ainsi qu'aux langues autres que l'arabe.
- Optimisé par l'intelligence artificielle (IA) : conçu spécifiquement pour la langue arabe, il comprend le contexte, segmente la phrase ou le paragraphe et applique la vocalisation nécessaire adaptée à la prononciation.
5
Générer
Cliquez sur le bouton « Run » ( Générer ) sur la page « Text to Audio » ou sur le bouton « Generate » ( Générer ) dans « Text to Audio Studio » pour créer votre fichier audio. Dans le studio, vous pouvez générer des milliers de lignes en une seule fois en cliquant sur le bouton de fusion (merge).
Passez à l'article suivant du guide Makna.