请启用 JavaScript 以确保最佳体验。

正在加载页面

Makina 平台指南 —— 输入最佳实践 (Best Practices for Input)

十二月 10, 2025 خالد محمود 5 分钟阅读
Makina 平台指南 —— 输入最佳实践 (Best Practices for Input)

输入最佳实践 (Best Practices for Input)

数字 (Numbers)

  1. 数字:文本转语音模型在处理电话号码或货币等格式时,可能会遇到困难。
  2. 建议:将数字写成单词以消除歧义(例如,写“一”而不是“1”)。
  3. 电话号码:123-456-7890 ← 一二三、四五六……
  4. 货币:$45.67 ← 四十五美元六十七美分。
  5. 缩写:请将其展开并写出全称,以确保清晰明确。
  6. د. ← 博士,ش. ← 街。
  7. 链接/符号:
  8. moknah.io/docs ← moknah.io/docs(请按此拼写)

发音)。

  1. 100% ← 百分之百。

概述 (Overview)

利用“文本转语音”功能或“文本转语音工作室”(Text to Audio Studio)生成您的第一个音频文件非常简单。不过,为了充分利用这些功能,仍有一些事项需要注意。

指南

1

在“文本转语音”页面的输入框中输入或粘贴您的文本。

您始终可以在文本中加入表达性标签,以实现卓越的语音生成效果。

  1. 若启用情感(Emotions)功能,请使用方括号内的标签,例如 [shouting](喊叫)或 [breathing](呼吸)。这些标签非常有效(完整列表请参阅 Voice Tags 部分) 。
  2. 若未启用情感功能,您仍可描述所需的表现方式(例如输入“excited”表示兴奋),或使用包含在 标签内的标记;不过,这些标记属于实验性质,其运行稳定性可能不如预期。
  3. 注意:所有标签必须使用英语,因为使用其他语言属于实验性功能,可能无法稳定运行。我们正致力于在未来的更新中通过引入表情符号( Emoji )和按钮来简化这一流程。
  4. 字符限制与长文本内容:标准语音生成框专为短片段设计,仅支持最多 1500 个字符(为获得最佳音质,建议每次生成约 200 个字符)。
  5. 针对大批量内容:如果您希望生成一段连续完整的音频(无需后续编辑或拼接)——例如有声读物或长篇文章——请勿使用此输入框。建议改用“文本转音频工作室”(Text to Audio Studio)。该工作室支持上传完整文档,助您高效实现长篇内容的自动化制作。

2

语音选择 (Voice selection)

从列表中选择您想要使用的声音。

选择合适的声音至关重要;例如,如果您需要一个讲现代标准阿拉伯语的声音,最好从一开始就选择专为此设计的语音,而不是选择针对某种方言的声音。不过,这并不意味着选择了特定方言的声音就无法朗读标准阿拉伯语文本;实际上,它不仅能朗读,甚至可能赋予文本良好的生动感。但需要注意的是,如果调高情感参数(emotion parameter)或温度参数(temperature),可能会导致意想不到的结果,因为声音会倾向于表现出其原始克隆样本所对应的方言特征。

举个例子,假设你需要某种特定方言的演绎效果。在这种情况下,如果你不想启用情感参数,而是选择了一个通用音色,那么增加表现力和情感热度将使最终效果更接近你想要的方言风格。无论如何,语音表现都建立在输入内容的语境之上;只要模型理解了输入的方言特征,它就会尝试进行模仿和演绎,即便所选音色并非专门针对该方言。请务必记住,随着练习的深入,你将更透彻地掌握各项设置及其调节技巧,从而找到最佳平衡点,实现令人惊叹的效果。

3

调整设置(可选)

调整音频设置以获得所需的输出。

我们推荐的默认设置如下图所示:

设置:

  1. 创造力系数 (Temperature):
  2. 更高= 灵活性更高
  3. 更少= 更僵化
  4. 提高“温度”(Temperature)参数能赋予人工智能模型更大的音频控制自由度,但如果数值过高,可能会导致输出结果出现异常;反之,若将其降至零,音频表现则会变得生硬且缺乏生气。因此,将其设定在符合您需求的适中水平是最佳选择。
  5. 相似性: Similarity
  6. 最高= 类似于原始声音
  7. 更少= 与原声的相似度较低
  8. 提高匹配系数可增强与原始复刻声音的相似度;然而,若参考样本不够纯净或质量不高,将其调至最大值可能会引入杂音(如噼啪声)等失真现象。如果样本质量上乘且您需要完全匹配,可将其设为最大值;否则,建议降低该数值以获得更纯净、更优质的效果。
  9. 速度: Speed
  10. 更高= 更快
  11. 更少= 更慢
  12. 将语速调至最大或最小可能会降低生成音频的质量;因此,建议仅在必要时才使用此选项。


  1. 表现力:Expressiveness

  1. 最高= 充满情感的朗诵
  2. 较少= 中性语气
  3. 提高情感系数可使输出效果更接近自然表现,但过高设置可能会导致异常表现;因此,在进行大规模语音生成(特别是在 Voice Studio 中)时,建议将其保持为零,并针对特定句子进行试验性调整。

情感设定(Emotion Setting slides):

我们推荐的默认设置如图所示:

如果您选择启用情感(Enable Emotion),如图所示,建议的设置是提高温度(Temperature)值。

4

选择所需的处理模式(归一化)

  1. 基础型(Basic):适用于不带任何附加内容的阿拉伯语,也适用于非阿拉伯语的其他语言。
  2. 人工智能增强(AI-Enhanced):专为阿拉伯语设计,能够理解语境,对句子或段落进行切分,并添加符合发音要求的必要标音符号。

5

生成 (Generate)

点击“Text to Audio”页面上的“Run”(生成)按钮,或“Text to Audio Studio”中的“Generate”(生成)按钮,即可创建音频文件。在 Studio 中,您可以通过点击“Merge”(合并)按钮,一次性生成数千行内容。

转到“Makna”指南中的下一篇文章


خ

خالد محمود

喜欢这篇文章吗?

订阅我们的简报,获取关于阿拉伯语语音技术的最新见解与动态。

我们尊重您的隐私。您可以随时取消订阅。