Guide de l’utilisateur Référence de l’API

Synthèse vocale (TTS)

Convertissez du texte en un son naturel et réaliste grâce à la synthèse vocale par IA.

Comment générer de l’audio

Le processus de génération est simple :

  1. Texte source : Tapez ou collez votre texte dans la zone de saisie.
    Remarque

    La saisie de texte est extrêmement importante. Une saisie de qualité produit un bon résultat.

  2. Sélectionner la voix : Choisissez la voix que vous souhaitez utiliser dans votre liste de voix.
    Conseil

    Si vous souhaitez une voix joyeuse, sélectionnez une voix clonée à partir d’échantillons joyeux. Si vous recherchez un dialecte spécifique, choisissez une voix entraînée sur ce dialecte.

  3. Ajuster les paramètres : Configurez des paramètres tels que la vitesse ou la température (détaillés ci-dessous).
  4. Générer : Cliquez sur le bouton Exécuter pour créer votre fichier audio.

Modes et scénarios de génération

L’étape la plus importante consiste à décider s’il faut cocher la case « Activer le mode Émotions et dialectes ». Cela modifie la manière dont l’IA interprète votre texte.

Scénario A : Contenu expressif et lié aux personnages (avec émotions)

Idéal pour le jeu vidéo, l’animation et les livres audio, domaines nécessitant une palette d’émotions et une interaction entre les personnages.

Capacités Générer des dialogues naturels et réalistes avec une large palette d’émotions (rires, chuchotements, etc.).
Langues Prend en charge plus de 70 langues, dont : Afrikaans, arabe, arménien, assamais, azerbaïdjanais, biélorusse, bengali, bosnien, bulgare, catalan, cebuano, chichewa, croate, tchèque, danois, néerlandais, anglais, estonien, philippin, finnois, français, galicien, géorgien, allemand, grec, gujarati, haoussa, hébreu, hindi, hongrois, islandais, indonésien, irlandais, italien, japonais, javanais, kannada, kazakh, kirghiz, coréen, letton, lingala, lituanien, luxembourgeois, macédonien, malais, malayalam, chinois mandarin, marathi, népalais, norvégien, pachto, persan, polonais, portugais, pendjabi, roumain, russe, serbe, sindhi, slovaque, slovène, somali, espagnol, swahili, suédois, tamoul, télougou, thaï, turc, ukrainien, ourdou, vietnamien, gallois
Nombre maximal de caractères 3 000 par demande
Durée approximative ~3 minutes

Scénario B : Contenu professionnel et stable (émotion désactivée)

Idéal pour les vidéos d’entreprise, les supports d’apprentissage en ligne et les scénarios nécessitant une qualité vocale constante.

Capacités Offre une qualité vocale et une personnalité constantes, tout en préservant les caractéristiques uniques du locuteur.
Langues Prend en charge 29 langues : Anglais (États-Unis, Royaume-Uni, Australie, Canada), japonais, chinois, allemand, hindi, français (France, Canada), coréen, portugais (Brésil, Portugal), italien, espagnol (Espagne, Mexique), indonésien, néerlandais, turc, philippin, polonais, suédois, bulgare, roumain, arabe (Arabie saoudite, Émirats arabes unis), tchèque, grec, finnois, croate, malais, slovaque, danois, tamoul, ukrainien, russe
Nombre maximal de caractères 10 000 par demande
Durée approximative ~10 minutes

Maîtrise de la voix et de l’interprétation

Guidage et maîtrise des émotions

Lorsque la case « Activer les émotions » est cochée :

Pour une génération expressive, vous pouvez contrôler le rendu à l’aide du contexte et de balises spécifiques :

1. Prompting contextuel

Le modèle interprète le contexte directement à partir du texte. L’ajout d’indications descriptives, telles que « dit-elle avec enthousiasme », ou l’utilisation de points d’exclamation influencera l’émotion exprimée par la voix.

2. Balises audio (liées à la voix)

Insérez ces balises dans votre texte pour orienter la voix. Remarque : l’efficacité dépend de la voix sélectionnée.

Catégorie Étiquettes
Rire [laughs], [laughs harder], [starts laughing], [wheezing]
Chuchotement [whispers]
Respiration [sighs], [exhales]
Émotions [sarcastic], [curious], [excited], [crying], [snorts], [mischievously]

3. Effets sonores

[gunshot], [applause], [clapping], [explosion], [swallows], [gulps]

4. Balises expérimentales

  • Remplacez X par l’accent souhaité, par ex. [strong French accent]
  • [sings], [woo], [fart]

5. Ponctuation et structure du texte

  • Points de suspension (...) : Ajoutez des pauses et du poids.
  • Majuscules : Renforce l’accent
  • Ponctuation standard : Offre un rythme de parole naturel
Important

Le modèle émotionnel est en phase alpha. Les prompts très courts sont plus susceptibles de générer des résultats incohérents. Nous vous encourageons à tester des prompts de plus de 250 caractères.

Lorsque l’option « Activer les émotions » est décochée

Le système privilégie la stabilité et la cohérence.

  • Le contexte est primordial : Fiez-vous au rythme naturel de la phrase. L’IA lira le texte exactement tel qu’il est écrit.
  • Pauses : Utilisez des balises telles que <power/>, <exciting/>
    • Remarque : N’utilisez pas trop de balises, car cela pourrait entraîner une instabilité.
    • Essayez d’augmenter l’expressivité et la température lorsque vous l’utilisez.
  • Ponctuation : Utilisez des tirets (-) pour de courtes pauses ou des points de suspension (…) pour marquer l’hésitation.
  • Aucune étiquette d’émotion : N’utilisez pas d’accolades {} ni de balises audio ici ; l’IA risque de les lire à voix haute ou de les ignorer.

Paramètres vocaux (commandes avancées)

Ajustez ces curseurs pour affiner le résultat :

1. Température (stabilité)

Gamme Plus rigide (plus bas) ↔ Plus flexible (plus élevé)
Effet Une température plus élevée confère à l’IA davantage de liberté et d’expressivité, mais au risque d’une certaine instabilité (hallucinations). Une température plus basse rend la voix plus rigide et plus stable.
Recommandation Une valeur par défaut située entre 25 et 50 constitue un bon point de départ.

2. Similitude

Gamme Moins proche d’une voix hors champ (Plus bas) ↔ Similaire à une voix hors champ (Plus élevé)
Effet Augmenter ce paramètre renforce la ressemblance avec le clone original. Toutefois, si l’audio de référence contient du bruit, une similarité élevée risque de reproduire des artefacts ou des craquements.

3. Vitesse

Gamme 0,7 (plus lent) ↔ 1,2 (plus rapide). La valeur par défaut est 1,0.
Effet Contrôle la cadence. Des valeurs extrêmes peuvent affecter la qualité.

4. Expressivité

Gamme Ton neutre (plus bas) ↔ Expression émotionnelle (plus élevée)
Effet Augmenter ce paramètre rapproche le résultat d’une exécution naturelle. L’augmenter à l’excès risque d’entraîner un comportement étrange.

Normalisation de texte (prononciation)

La normalisation contribue à améliorer la prononciation des nombres, des dates et des textes complexes.

Modes de normalisation

Mode Crédits Idéal pour Fonction
Normalisation de base x1 Toutes les langues Normalisation standard du texte pour garantir un flux de parole naturel. Recommandée lors de l’utilisation de prompts axés sur l’émotion et pour des dialogues rédigés en dialecte.
Normalisation améliorée par l’IA x2 Contenu en langue arabe Optimisation complète du texte. Le système comprend le contexte, segmente les phrases et applique automatiquement les signes diacritiques (Tashkeel) afin que l’IA prononce correctement les mots arabes.
Note sur l’amélioration par IA

Si vous souhaitez générer des dialectes, la normalisation améliorée par l’IA risque de ne pas donner de bons résultats. Utilisez la normalisation de base pour les contenus dialectaux.

Bonnes pratiques pour la saisie

Nombres

Les modèles de synthèse vocale peuvent éprouver des difficultés avec des formats tels que les numéros de téléphone ou les devises.

Type Au lieu de Écrire
Numéros de téléphone 123-456-7890 « un deux trois, quatre cinq six... »
Devise $45.67 quarante-cinq dollars et soixante-sept cents
Abréviations Dr., St. « Docteur », « Rue »
URL moknah.io/docs moknah point io slash docs
Symboles 100% cent pour cent

Guide étape par étape

Pour commencer

Il est très simple de commencer à générer votre premier fichier audio à l’aide de Text to Audio ou de Text to Audio Studio. Toutefois, pour tirer le meilleur parti de ces fonctionnalités, il y a quelques points à garder à l’esprit.

Étape 1 : Saisissez votre texte

Saisissez ou collez votre texte dans la zone de saisie de la page « Texte vers audio ». Vous pouvez également inclure des balises expressives dans votre texte pour obtenir une qualité de synthèse vocale supérieure.

  • Si les « Émotions » sont activées : Utilisez des balises entre crochets comme [shouting] ou [breathing]. Ils sont très efficaces.
  • Si les « Émotions » sont désactivées : Vous pouvez toujours décrire l’interprétation souhaitée (par exemple, en écrivant « enthousiaste ») ou utiliser des balises telles que </xxxx>, bien qu’ils soient expérimentaux.
Remarques importantes

• Toutes les balises doivent être en anglais, car leur utilisation dans d’autres langues est expérimentale.
• La zone de génération vocale standard ne peut accueillir que 1 500 caractères (nous recommandons environ 200 caractères par génération pour une qualité optimale).
• Pour des volumes plus importants (livres audio, longs articles), utilisez plutôt le Text to Audio Studio.

Étape 2 : Sélection de la voix

Sélectionnez la voix que vous souhaitez utiliser dans votre liste.

Le choix de la voix est important ; par exemple, si vous souhaitez une voix qui s’exprime en arabe standard, il vaut mieux en choisir une dès le départ plutôt qu’une voix spécifique à un dialecte. Toutefois, si vous optez pour une voix dédiée à un dialecte particulier, celle-ci pourra tout de même lire un texte en arabe standard — et pourrait même lui conférer une certaine vitalité.

Conseil de pro

Si vous souhaitez obtenir une interprétation dans un dialecte spécifique sans pour autant activer le paramètre d’émotion, augmenter l’expressivité et la température permettra de rapprocher le rendu du dialecte visé. Plus vous vous exercerez, mieux vous comprendrez l’équilibre qu’il est possible d’atteindre grâce à votre maîtrise des réglages.

Étape 3 : Ajuster les paramètres (facultatif)

Modifiez les paramètres vocaux pour obtenir le résultat souhaité. Les valeurs par défaut recommandées sont indiquées ci-dessous :

Paramètres vocaux par défaut
Paramètres par défaut recommandés

Température

  • Plus élevé = Plus de flexibilité : Cela donne au modèle d’IA plus de liberté pour contrôler la voix, mais une augmentation significative risque d’entraîner des résultats étranges.
  • Plus bas = Plus rigide : Le réduire à zéro rendra la voix hors champ plus rigide et dénuée de vie.

Similitude

  • Plus élevé = Similaire à une voix hors champ : Cela renforce la ressemblance avec la voix clonée originale. Toutefois, maximiser ce paramètre lorsque l’échantillon de référence n’est pas propre risque d’introduire des artefacts audio, tels que des craquements.
  • Plus bas = Moins proche d’une voix hors champ : Réduisez-le pour obtenir un résultat plus propre si la source contient du bruit.

Vitesse

  • Plus élevé = Plus rapide / Plus bas = Plus lent : Augmenter au maximum ou réduire au minimum peut altérer la qualité. À n’utiliser qu’en cas de nécessité.

Expressivité

  • Plus élevé = Interprétation émotionnelle : Rapproche le résultat d’une interprétation naturelle, mais une augmentation excessive risque d’entraîner un comportement étrange.
  • Plus bas = Ton neutre : Pour la génération de voix à grande échelle, en particulier dans le Voice Studio, nous recommandons de maintenir cette valeur à zéro et de l’augmenter de manière expérimentale sur des lignes spécifiques.

Paramètres des émotions

Si vous choisissez d’activer les émotions, le réglage recommandé consiste à augmenter la température :

Paramètres d’émotion par défaut
Paramètres d’émotion par défaut
Paramètres d’émotion recommandés selon la température
Paramètres recommandés lorsque les émotions sont activées : augmentez la température.

Étape 4 : Choisir la normalisation

  • De base : Convient à l’arabe sans ajout, ainsi qu’à d’autres langues non arabes.
  • Amélioré par l’IA : Conçu exclusivement pour l’arabe : il comprend le contexte, segmente les phrases et applique les signes diacritiques appropriés à la prononciation.

Étape 5 : Générer

Cliquez sur le bouton « Run » dans Text to Audio ou sur le bouton « Generate » dans Text to Audio Studio pour créer votre fichier audio. Dans le studio, vous pouvez générer des milliers de lignes simultanément en cliquant sur le bouton de fusion.


Conversion de texte en audio

Un guide pour transformer du texte en parole avec Moknah

Interface de conversion texte-audio
Interface de conversion texte-audio

En se basant sur l’interface présentée ci-dessus, voici les étapes pour générer de l’audio :

  1. Saisissez le texte : Saisissez ou collez le texte que vous souhaitez convertir en parole dans la grande zone de saisie.
    Remarque : cet outil impose une limite de 1 500 caractères par requête.
  2. Sélectionnez une voix : Cliquez sur le menu déroulant intitulé « Sélectionner une voix ». Vous pouvez rechercher des voix spécifiques par nom, langue, genre, âge, cas d’utilisation ou dialecte.
  3. Mode de configuration (facultatif) :
    • Génération standard : Laissez la case « Activer le mode Émotions et dialectes » décochée pour une narration stable et professionnelle.
    • Mode Émotions et dialectes : Cochez cette case si vous souhaitez contrôler des émotions spécifiques ou utiliser des dialectes régionaux.
      Astuce : si cette option est cochée, utilisez des accolades pour les émotions (par ex. {Shouting}) et assurez-vous que le dialecte de votre texte correspond au dialecte de la voix sélectionnée.
  4. Choisir la normalisation :
    • Normalisation de base (x1 crédit) : Traitement standard pour un flux de parole naturel.
    • Normalisation améliorée par l’IA (x2 crédits) : Traitement avancé incluant la correction des coquilles et l’optimisation (recommandé pour les textes complexes ou l’arabe).
  5. Générer : Cliquez sur le bouton bleu « Run » en bas pour générer votre audio.
Option supplémentaire

Vous pouvez cliquer sur le bouton « Paramètres de la voix » en haut à gauche pour ajuster des paramètres avancés, tels que la vitesse ou la stabilité, avant de lancer la génération.


Studio de conversion texte-audio

Studio de conversion texte-audio
Interface du studio de conversion texte-audio

Conçu spécifiquement pour des projets de grande envergure tels que les livres audio, les podcasts et les voix off de longue durée. Contrairement à l’outil de synthèse vocale standard, qui traite des contenus courts, le Studio vous permet de gérer, de modifier et de générer des documents complets au sein d’un même espace de travail.

Caractéristiques principales

Importation en masse

Importez des livres ou des scripts complets directement sous forme de documents Word (.doc, .docx).

Fonctionnalité d’importation en masse
Importez directement des documents Word

Segmentation intelligente

Le système divise automatiquement le document que vous avez téléchargé en lignes ou en chapitres faciles à gérer. Cela vous permet de traiter chaque phrase ou paragraphe comme une unité distincte et d’y appliquer, si nécessaire, des paramètres ou des modifications spécifiques.

Segmentation intelligente
Segmentation automatique de texte

Traduction intégrée

Vous pouvez activer l’option « Traduction » lors de la configuration du projet pour traduire automatiquement l’intégralité du document importé dans plus de 100 langues avant la génération de l’audio.

Fonction de traduction
Activer la traduction lors de la configuration du projet

Production automatisée

Une fois votre projet configuré, vous pouvez générer l’audio pour l’ensemble du projet en une seule fois, d’un simple clic, à l’aide du bouton « Convertir ».

Bouton de conversion
Génération audio en un clic
Sortie audio générée
Sortie audio générée

Comment créer un projet Studio

  1. Informations sur le projet : Donnez un titre à votre projet (par ex. « Mon premier livre audio »).
  2. Source du contenu : Glissez-déposez votre fichier Word.
  3. Traitement de texte : Choisissez entre :
    • De base : Traitement rapide des textes standards.
    • Amélioré par l’IA : Traitement avancé (idéal pour l’arabe) garantissant une prononciation et des diacritiques corrects dans l’ensemble du document.
  4. Traduction (facultatif) : Activez l’option « Activer la traduction » si vous souhaitez que le texte source soit traduit dans une autre langue.
  5. Créer : Cliquez sur « Créer un projet ». Vous serez ensuite redirigé vers l’espace de travail, où vous pourrez examiner les segments et lancer le processus de génération en masse.
En savoir plus

Découvrez comment créer un livre audio en quelques étapes : Transformez un livre en livre audio en 15 minutes


Guide d’expert : Maîtriser la génération de voix arabe par IA

Compétences, astuces et bonnes pratiques

L’objectif ultime d’un créateur de voix par IA est de générer un son de la plus haute qualité avec un rendu le plus naturel possible, tout en minimisant la consommation de crédits. Chez Moknah, nous mettons à votre disposition des outils avancés pour réaliser des voix off professionnelles. Ce guide présente les compétences essentielles dont vous avez besoin.

1. L’art de la segmentation (préparation du texte)

Les modèles d’IA suivent littéralement la structure de votre texte. La manière dont vous le découpez détermine la qualité des performances, le rythme et le coût.

Le problème : le « bloc de texte »

Si vous collez un long paragraphe sans le scinder, le modèle le traite comme une seule ligne.

  • Conséquence : L’IA se précipite souvent pour terminer la longue phrase, ce qui donne une vitesse peu naturelle.
  • Coût : Si un seul mot est incorrect, vous devez régénérer le paragraphe entier, ce qui gaspille des crédits.

L’erreur : la division aléatoire

Si vous appuyez sur la touche « Entrée » au milieu d’une phrase, l’IA suit votre instruction et impose un arrêt (Sukoon/Tskeen) à la fin de chaque ligne.

  • Conséquence : Cela produit un son haché et décousu, et accroît les erreurs grammaticales.

La solution des pros : la segmentation consciente

  • Règle n° 1 : Diviser le texte en fonction de la ponctuation (virgules, points, points-virgules).
  • Règle n° 2 : Si le texte source manque de ponctuation, ajoutez-la vous-même, en particulier avant les conjonctions (par exemple « et », « mais »).
  • La règle d’or : Lisez le texte à voix haute. À chaque endroit où vous faites naturellement une pause pour reprendre votre souffle, commencez une nouvelle ligne.
  • Pour les contenus longs : Utilisez le Text to Audio Studio : il gère automatiquement la segmentation pour vous.

2. Diacritiques et normalisation (Tashkeel)

Question : Dois-je ajouter manuellement tous les signes diacritiques (le tashkeel) à l’ensemble du texte ?

Réponse : Non. Un excès de diacritiques ajoutés manuellement impose trop de contraintes au modèle, affaiblissant ainsi sa capacité à recourir à sa propre fonction d’autodiacritisation.

Solution A : Normalisation améliorée par l’IA (le bouton « magique »)

Cette fonctionnalité est votre arme secrète. Lorsqu’elle est sélectionnée, le système est automatiquement :

  1. Ajoute les signes diacritiques au texte arabe en fonction du contexte.
  2. Ajoute la ponctuation nécessaire.
  3. Corrige les coquilles.

Résultat : Il résout 99 % des problèmes de prononciation sans effort manuel.

Solution B : Diacritiques « stratégiques » manuels

Si vous utilisez la normalisation de base, suivez l’« approche minimaliste » :

  • Éléments à pourvoir de signes diacritiques : Seulement les mots difficiles à lire pour vous, ou les mots à double sens.
  • Comment : Il n’est pas nécessaire d’ajouter des signes diacritiques à l’ensemble du mot. Il suffit d’ajouter le signe diacritique à la lettre spécifique qui prête à confusion.
    Exemple : Pour distinguer « Kutiba » (il a été écrit) de « Kataba » (il a écrit), il suffit d’ajouter une damma sur la première lettre : كُتب

3. Règles de mise en forme du texte

Le modèle privilégie un texte épuré et simple. Respectez les règles de mise en forme suivantes :

✅ Faire ❌ Ne le faites pas
Convertir les nombres en toutes lettres (« Année deux mille vingt » au lieu de « 2020 ») Utilisez des puces
Utilisez des tirets (-) pour les incises. Utiliser l’espacement des caractères (Hello)
Utilisez des virgules pour les pauses naturelles. Utilisez des barres obliques ou des traits de soulignement (/ ou _)
Rédigez un texte clair et simple. Utilisez des points de suspension (...) pour séparer les phrases (à moins de vouloir adopter un ton « hésitant »).

L’astuce du « caractère étranger » (P, G, V, CH)

L’arabe ne possède pas certains sons comme le P, le G ou le V. Pour amener l’IA à prononcer correctement les noms étrangers dans un texte en arabe, utilisez des caractères ourdous ou persans :

Son cible Lettre Écriture arabe courante Prononciation correcte
P پ Pepsi Pepsi
G گ Google Google
CH چ Sandwich Sandwich

Référence des lettres ourdoues/persanes

Lettre Son Description Exemple
پ (Pe) /p/ Représente le son /p/, qui n’existe pas en arabe standard. J’ai voyagé au Pakistan avec mon ami.
چ (Che) /ch/ Représente le son /ch/ comme dans « chair » J’ai vu du thé délicieux en Inde.
ٹ (Ṭe) /ṭ/ T rétroflexe, plus fort et plus lourd que le « ت » arabe. J’ai travaillé dans une usine de fer-blanc.
ڈ (Ḍāl) /ḍ/ D rétroflexe, plus lourd que le « د » arabe. J’ai rencontré le médecin à l’hôpital.
ڑ (Re) /ṛ/ R rétroflexe, « r » fortement roulé J’ai habité dans un village près de la montagne.
گ (Gāf) /g/ Représente le son /g/ comme dans « go » Nous sommes allés au Gujarat pour un court voyage.
ں (Nūn Ghunnā) Consonne nasale /n/ « n » nasalisé, produit par le nez Voici Ahmed, de Médine.
ے (Baṛī Ye) /e/ long Voyelle « e » longue ou son « ya » final J’ai rencontré Ali à la mosquée.

4. Maîtrise de la performance et des émotions

Vous pouvez demander à l’IA d’adopter le jeu d’un acteur plutôt que celui d’un présentateur de journal télévisé. Cela s’effectue via les modes et les paramètres.

Niveau 1 : Choix du mode

Dans l’interface de génération, vous verrez une case à cocher : « Activer le mode Émotions et dialectes ».

A. Mode standard (case non cochée)

Idéal pour : Narration professionnelle, livres audio, e-learning.

  • Pauses : Pour forcer un silence, ajoutez cette balise sur une nouvelle ligne : <break time="1.5s"/>
  • Émotion subtile : Utilisez du contexte ou des balises descriptives à la fin d’une ligne (expérimental) : Elle a regardé les fleurs... <With Amazement/>
B. Mode Émotions et dialectes (case cochée)

Idéal pour : Drame, jeu vidéo, dialogues de personnages.

  • Étiquettes d’émotion : Utilisez des accolades {} avec l’émotion écrite en anglais au début de la phrase.
  • Syntaxe : {Emotion} Votre texte en arabe ici.
  • Exemples : {Shouting}, {Whispering}, {Laughing}, {Sighs}

Niveau 2 : Paramètres vocaux

Ajustez finement le résultat à l’aide des curseurs :

Cadre Inférieur Plus élevé Avertissement
Température Stable, régulier, légèrement robotique. Adapté aux actualités. Plus créatif et émotionnel. Un réglage trop élevé peut entraîner une instabilité ou des hallucinations auditives.
Similitude Moins fidèle à l’original Plutôt un clone original Maintenez une valeur élevée pour garantir la précision.
Expressivité Neutre Élargit la palette émotionnelle Pour les textes longs, maintenez une position plus basse afin de préserver la stabilité.

5. Maîtriser les dialectes

La règle d’or

Pour les dialectes arabes (saoudien, égyptien, jordanien, etc.), la voix DOIT correspondre au texte. Si vous écrivez en argot égyptien, vous devez choisir une voix entraînée au dialecte égyptien. N’essayez pas de faire parler une voix en arabe standard (Fusha) en argot ; le résultat sonnerait peu naturel.

L’astuce de l’amorçage

Pour aider l’IA à reconnaître immédiatement le dialecte, commencez votre texte par un mot dialectal « fort ».

Exemple : Au lieu de commencer par une phrase neutre, commencez par « Izayak, amel eh ? » (Comment allez-vous ?). Cela « conditionne » le modèle à rester dans l’« ambiance » égyptienne pour le reste du paragraphe.