用户指南 API 参考

文本转语音 (TTS)

利用 AI 语音合成技术,将文本转换为自然逼真的音频。

如何生成音频

生成过程很简单:

  1. 输入文本: 在输入框中键入或粘贴您的文本。
    注意

    文本输入至关重要。优质的输入能带来优质的输出。

  2. 选择语音: 从您的语音列表中选择您想要使用的语音。
    提示

    如果您想要欢快的声音,请选择基于欢快样本克隆的声音;如果您想要特定的方言,请选择基于该方言训练的声音。

  3. 调整设置: 配置速度或温度等设置(详情如下)。
  4. 生成: 点击“运行”按钮以创建音频文件。

生成模式与场景

最重要的一步是决定是否勾选“启用情感与方言模式”选项。这将改变 AI 解读您文本的方式。

场景 A:富于表现力与角色特质的内容(支持情感表达)

非常适合游戏、动画和有声书等需要丰富情感表达及角色互动的领域。

能力 生成自然逼真的对话,涵盖丰富的情感表达(如笑声、耳语等)。
语言 支持 70 多种语言,包括: 南非荷兰语、阿拉伯语、亚美尼亚语、阿萨姆语、阿塞拜疆语、白俄罗斯语、孟加拉语、波斯尼亚语、保加利亚语、加泰罗尼亚语、宿务语、齐切瓦语、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、菲律宾语、芬兰语、法语、加利西亚语、格鲁吉亚语、德语、希腊语、古吉拉特语、豪萨语、希伯来语、印地语、匈牙利语、冰岛语、印尼语、爱尔兰语、意大利语、日语、爪哇语、卡纳达语、哈萨克语、吉尔吉斯语、韩语、拉脱维亚语、林加拉语、立陶宛语、卢森堡语、马其顿语、马来语、马拉雅拉姆语、普通话、马拉地语、尼泊尔语、挪威语、普什图语、波斯语、波兰语、葡萄牙语、旁遮普语、罗马尼亚语、俄语、塞尔维亚语、信德语、斯洛伐克语、斯洛文尼亚语、索马里语、西班牙语、斯瓦希里语、瑞典语、泰米尔语、泰卢固语、泰语、土耳其语、乌克兰语、乌尔都语、越南语、威尔士语
最大字符数 每次请求 3,000
预计时长 约 3 分钟

场景 B:专业且稳定的内容(已禁用情感表达)

非常适合企业视频、在线学习资料以及需要保持语音质量一致性的场景。

能力 在保持说话者独特特征的同时,呈现一致的音质与个性。
语言 支持 29 种语言: 英语(美国、英国、澳大利亚、加拿大)、日语、中文、德语、印地语、法语(法国、加拿大)、韩语、葡萄牙语(巴西、葡萄牙)、意大利语、西班牙语(西班牙、墨西哥)、印尼语、荷兰语、土耳其语、菲律宾语、波兰语、瑞典语、保加利亚语、罗马尼亚语、阿拉伯语(沙特阿拉伯、阿联酋)、捷克语、希腊语、芬兰语、克罗地亚语、马来语、斯洛伐克语、丹麦语、泰米尔语、乌克兰语、俄语
最大字符数 每次请求 10,000
预计时长 约 10 分钟

掌控声音与表演

提示与情绪控制

当勾选“启用情绪”复选框时:

若要生成富有表现力的内容,您可以通过上下文和特定标签来控制呈现方式:

1. 上下文提示

该模型直接从文本中解读语境。添加诸如“她兴奋地说”之类的描述性文字,或使用感叹号,都会影响语音的情感表达。

2. 音频标签(与语音相关)

在文本中插入这些标签,以控制语音效果。注意:实际效果取决于所选的语音。

类别 标签
笑声 [laughs], [laughs harder], [starts laughing], [wheezing]
耳语 [whispers]
呼吸 [sighs], [exhales]
情绪 [sarcastic], [curious], [excited], [crying], [snorts], [mischievously]

3. 音效

[gunshot], [applause], [clapping], [explosion], [swallows], [gulps]

4. 实验性标签

  • 将 X 替换为所需的口音,例如: [strong French accent]
  • [sings], [woo], [fart]

5. 标点符号与文本结构

  • 省略号 (...): 增加停顿与分量感
  • 大写: 增强了强调
  • 标准标点符号: 提供自然的语流节奏
重要

该情感模型目前处于 Alpha 测试阶段。过短的提示词(prompt)更容易导致输出结果不一致。建议您尝试使用长度超过 250 个字符的提示词。

当取消勾选“启用情绪”时

该系统优先考虑稳定性和一致性。

  • 语境至关重要: 请顺应句子的自然语流。AI 会完全按照文本内容进行朗读。
  • 停顿: 使用诸如……之类的标签 <power/>, <exciting/>
    • 注意: 请勿使用过多标签,否则可能会导致不稳定。
    • 使用时,试着增强表现力和“温度”。
  • 标点符号: 使用破折号 (-) 表示短暂停顿,或使用省略号 (…) 表示迟疑的语气。
  • 无情感标签: 请勿在此处使用花括号 {} 或音频标签;AI 可能会将其读出或直接忽略。

语音设置(高级控制)

调整这些滑块以微调输出:

1. 温度(稳定性)

范围 刚性更高(较低) ↔ 柔韧性更高(较高)
效果 较高的温度赋予 AI 更大的自由度和表现力,但也伴随着不稳定性(产生幻觉)的风险;较低的温度则使语音显得更为生硬、稳定。
推荐 将默认值设在 25 到 50 左右是一个很好的起点。

2. 相似性

范围 不太像旁白(较低) ↔ 类似于旁白(较高)
效果 提高该数值会增强与原始克隆样本的相似度。然而,如果参考音频中存在噪声,高相似度可能会导致产生伪影或爆音。

3. 速度

范围 0.7(较慢)↔ 1.2(较快)。默认值为 1.0。
效果 控制节奏。极端数值可能会影响质量。

4. 表现力

范围 中性语调(较低) ↔ 情感充沛的表达(较高)
效果 提高该数值会使输出更接近自然的表现;但若提高过度,则可能导致异常行为。

文本归一化(发音)

归一化有助于改善数字、日期和复杂文本的发音。

归一化模式

模式 制作人员名单 最适合 功能
基本归一化 x1 所有语言 进行标准文本归一化处理,以确保语音流转自然。建议在采用情感提示或旨在呈现方言对话时使用此功能。
AI 增强型归一化 x2 阿拉伯语内容 全面的文本优化。它能理解上下文并进行断句,同时自动添加变音符号(Tashkeel),确保 AI 能准确读出阿拉伯语单词。
关于 AI 增强的说明

如果您旨在生成方言,AI 增强型归一化可能无法带来理想的效果。对于方言内容,请使用基础归一化。

输入最佳实践

数字

文本转语音模型在处理电话号码或货币等格式时可能会遇到困难。

类型 代替;而不是 写
电话号码 123-456-7890 “一、二、三,四、五、六……”
货币 $45.67 四十五美元六十七美分
缩略语 Dr., St. “医生”、“街道”
网址 moknah.io/docs moknah.io/docs
符号 100% 百分之百

分步指南

入门指南

使用“文本转音频”(Text to Audio)或“文本转音频工作室”(Text to Audio Studio)生成您的首个音频非常简单。不过,若想充分利用这些功能,您需要注意以下几点。

第 1 步:输入文本

在“文本转音频”页面的输入框中键入或粘贴文本。您可以在文本中加入表现力标签,以获得更出色的语音生成效果。

  • 如果启用了“情绪”功能: 使用括号内的标签,例如 [shouting] 或 [breathing]. 这些非常有效。
  • 如果禁用了“情绪”: 您仍然可以描述期望的演绎方式(例如写上“兴奋”),或者使用包含在……中的标签 </xxxx>, 尽管这些是实验性的。
重要提示

• 所有标签必须使用英语,因为在其他语言中使用这些标签尚处于实验阶段。
• 标准语音生成框仅支持 1500 个字符(为获得最佳音质,建议每次生成约 200 个字符)。
• 若需处理大量内容(如有声书、长篇文章),请改用“文本转音频工作室”(Text to Audio Studio)。

步骤 2:选择语音

从列表中选择您想要使用的语音。

选择语音至关重要;例如,如果您需要标准阿拉伯语发音,最好从一开始就选择相应的语音,而不是选择特定方言的语音。不过,如果您选择了针对特定方言的语音,它依然能够朗读标准阿拉伯语文本——甚至可能赋予其独特的活力。

专家提示

如果你希望以特定方言进行演绎,但不想启用情感参数,那么提高表现力(expressiveness)和温度(temperature)将使演绎效果更接近你想要的方言风格。随着练习的深入,你将能更好地掌握如何通过调整这些设置来实现理想的平衡效果。

步骤 3:调整设置(可选)

根据所需的输出效果修改语音设置。推荐的默认设置如下:

默认语音设置
推荐的默认设置

温度

  • 更高 = 更大的灵活性: 这赋予了 AI 模型更大的语音控制自由度,但如果数值设置过高,可能会导致异常的输出效果。
  • 数值越低 = 刚性越强: 将其降至零会使旁白变得更加生硬、缺乏生气。

相似性

  • 数值越高 = 类似于旁白: 这能提高与原始克隆声音的相似度。若参考样本不够纯净,将其设置为最大值可能会引入爆裂声等音频伪影。
  • 数值越低 = 越不像旁白: 如果源素材包含噪点,请降低该数值以获得更干净的效果。

速度

  • 越高 = 越快 / 越低 = 越慢: 调至最大或最小可能会降低质量。请仅在必要时使用。

表现力

  • 数值越高 = 情感表达越丰富: 能使输出更接近自然的表现,但设置过高可能会导致异常行为。
  • 较低 = 中性语气: 对于大规模语音生成(特别是在 Voice Studio 中),我们建议将其保持为零,并针对特定台词进行试验性调高。

情感设置

如果您选择启用情感功能,建议调高温度设置:

默认情感设置
默认情感设置
推荐的情感与 Temperature 设置
启用情感功能时的推荐设置——提高温度(Temperature)

步骤 4:选择归一化

  • 基础: 无需额外修改即可适用于阿拉伯语,同时也适用于其他非阿拉伯语语言。
  • AI 增强: 专为阿拉伯语设计——能够理解语境、进行句子切分,并添加正确的发音符号。

步骤 5:生成

点击“Text to Audio”中的“Run”按钮或“Text to Audio Studio”中的“Generate”按钮,即可创建音频文件。在 Studio 中,您可以通过点击合并按钮,一次性生成数千行内容。


文本转音频

使用 Moknah 将文本转换为语音的指南

文本转音频接口
文本转音频接口

根据上图所示的界面,生成音频的步骤如下:

  1. 输入文本: 在大的输入框中输入或粘贴您想要转换为语音的文本。
    注意:此工具每次请求的字符数限制为 1500 个字符。
  2. 选择语音: 点击标有“选择语音”的下拉菜单。您可以按名称、语言、性别、年龄、使用场景或方言搜索特定语音。
  3. 配置模式(可选):
    • 标准生成: 若需稳定且专业的旁白效果,请勿勾选“启用情感与方言模式”选项。
    • 情感与方言模式: 如果您希望控制特定情绪或使用方言,请勾选此框。
      提示:如果勾选此项,请使用花括号标注情绪(例如 {Shouting}),并确保文本方言与所选语音的方言一致。
  4. 选择归一化:
    • 基础归一化(1倍学分): 针对自然语音流的标准处理。
    • AI 增强型归一化(2 倍点数): 包含拼写错误纠正与优化的进阶处理(推荐用于复杂文本或阿拉伯语)。
  5. 生成: 点击底部的蓝色“Run”按钮以生成音频。
附加选项

在生成之前,您可以点击左上角附近的“语音设置”按钮,调整语速或稳定性等高级参数。


文本转音频工作室

文本转音频工作室
文本转音频工作室界面

专为有声书、播客和长篇配音等大型项目而设计。与仅处理短文本的标准“文本转语音”工具不同,该 Studio 允许您在同一个工作区内管理、编辑并生成完整的文档。

主要特点

批量导入

直接以 Word 文档(.doc、.docx)格式上传完整的书籍或剧本。

批量导入功能
直接上传 Word 文档

智能细分

系统会自动将您上传的文档拆分为易于处理的行或章节。这使您可以将每个句子或段落视为独立单元,并根据需要应用不同的设置或进行编辑。

智能细分
自动文本分割

综合翻译

在项目设置期间,您可以启用“翻译”开关,以便在生成音频之前将上传的完整文档自动翻译成 100 多种语言。

翻译功能
在项目设置期间启用翻译

自动化生产

项目设置完成后,您只需点击“转换”按钮,即可一次性生成整个项目的音频。

转换按钮
一键音频生成
生成的音频输出
生成的音频输出

如何创建 Studio 项目

  1. 项目信息: 为你的项目起个标题(例如“我的第一本有声书”)。
  2. 内容来源: 拖放您的 Word 文件。
  3. 文本处理: 在以下选项中选择:
    • 基础: 快速处理标准文本。
    • AI 增强: 高级处理(最适用于阿拉伯语),确保整个文档中的发音和变音符号准确无误。
  4. 译文(可选): 如果您希望将源文本转换为另一种语言,请切换“启用翻译”选项。
  5. 创建: 点击“创建项目”。随后您将进入工作区,在那里可以查看片段并启动批量生成流程。
了解更多

通过简短的步骤,了解更多关于制作有声书的信息: 15分钟内将书籍转换为有声书


专业指南:精通阿拉伯语 AI 语音生成

技巧、诀窍与最佳实践

AI 语音创作者的终极目标,是在尽可能节省点数消耗的同时,生成音质极佳且演绎自然的音频。Moknah 为您提供打造专业级配音的先进工具,而本指南将涵盖您所需掌握的核心技巧。

1. 分割的艺术(文本准备)

AI 模型会严格遵循你文本的结构。文本的拆分方式决定了性能质量、节奏以及成本。

问题所在:“文本块”

如果你在不进行拆分的情况下粘贴一个长段落,模型会将其视为单行文本。

  • 后果: AI 往往急于读完长句,导致语速不自然。
  • 费用: 如果有一个词出错,你就必须重新生成整个段落,从而浪费点数。

错误:随机拆分

如果你在句子中间随意按下“回车键”,AI 会遵循你的指令,在每一行末尾强制停顿(即 Sukoon/Tskeen)。

  • 后果: 这会导致音频断断续续、不连贯,并增加语法错误。

专业解决方案:有意识的细分

  • 第一条规则: 根据标点符号(逗号、句号、分号)拆分文本。
  • 规则二: 如果原文缺少标点符号,请自行添加,尤其是在连词(如“and”、“but”)之前。
  • 黄金法则: 朗读这段文字。每当自然停顿换气时,就在那里换行。
  • 针对长篇内容: 使用 Text to Audio Studio——它会自动为您处理分段。

2. 变音符号与规范化(Tashkeel)

问题: 我应该手动为全文完整添加变音符号(Tashkeel)吗?

回答: 不是。过多的手动标注变音符号会对模型施加过多限制,从而削弱其利用自身“自动标注变音符号”功能的能力。

方案 A:AI 增强标准化(“魔法”按钮)

这项功能是您的秘密武器。一旦选中,系统便会自动:

  1. 根据语境为阿拉伯语文本添加变音符号。
  2. 添加必要的标点符号。
  3. 修正了拼写错误。

结果: 无需人工干预即可解决 99% 的发音问题。

方案 B:人工“策略性”附加符号

如果使用基本归一化,请遵循“极简主义方法”:

  • 需要添加变音符号的内容: 只有那些你觉得难以阅读的词,或者具有双重含义的词。
  • 如何: 无需给整个单词都加上变音符号,只需在那个容易产生歧义的特定字母上添加即可。
    例如:若要区分“Kutiba”(被写)与“Kataba”(他写),只需在第一个字母上加上 Damma(合口符)即可:كُتب

3. 文本格式规则

该模型偏好简洁明了的文本。请遵循以下格式规则:

✅ 这样做 ❌ 不要
将数字转换为文字(例如“Year two thousand and twenty”而非“2020”) 使用项目符号
使用破折号 (-) 标示插入语 使用字符拉伸(Hello)
在自然停顿处使用逗号。 使用斜杠/下划线(/ 或 _)
撰写简洁明了的文字 使用省略号(...)来分隔句子(除非你想要表达“犹豫”的语气)。

“外来字符”技巧(P、G、V、CH)

阿拉伯语中缺少 P、G 或 V 等音素。若要让 AI 在阿拉伯语文本中准确读出外国姓名,请使用乌尔都语或波斯语字符:

目标音 信函 通用阿拉伯语书写 正确的发音
P پ 百事可乐 百事可乐 (Pepsi)
G گ Joojle 谷歌 (Google)
CH چ 三明治 三明治 (Sandwich)

乌尔都语/波斯语字母参考

信函 声音 描述 示例
پ (Pe) /p/ 代表 /p/ 音,该音在标准阿拉伯语中不存在。 我和朋友一起去了巴基斯坦。
چ (Che) /ch/ 代表“chair”一词中的 /ch/ 音 我在印度见到了美味的茶。
ٹ (Ṭe) /ṭ/ 卷舌音 T,比阿拉伯语的“ت”更强、更厚重。 我在一家锡制品厂工作过。
ڈ (Ḍāl) /ḍ/ 卷舌音 D,比阿拉伯语的“د”发音更重。 我在医院见到了医生。
ڑ (Re) /ṛ/ 卷舌 R,强颤音“r” 我住在山脚下的一个村庄里。
گ (Gāf) /g/ 代表单词“go”中的 /g/ 音 我们去古吉拉特邦进行了一次短途旅行。
ں (Nūn Ghunnā) 鼻音 /n/ 鼻音化的“n”,由鼻腔发出 这是来自麦地那的艾哈迈德。
ے (Baṛī Ye) 长元音 /e/ 长元音“e”或词尾的“ya”音 我在清真寺遇见了阿里。

4. 控制表现与情绪

你可以让 AI 像演员一样表演,而不是像新闻播报员那样。这可以通过“模式与设置”来实现。

第一阶段:选择模式

在生成界面中,您会看到一个复选框:“启用情感与方言模式”。

A. 标准模式(未勾选复选框)

最适合: 专业旁白、有声书、在线学习。

  • 停顿: 若要强制静音,请在新行中添加此标签: <break time="1.5s"/>
  • 微妙的情绪: 在行尾使用上下文或描述性标签(实验性功能): 她看着那些花…… <With Amazement/>
B. 情感与方言模式(已勾选)

最适合: 剧情、游戏、角色对话。

  • 情感标签: 在句首使用花括号 {},并在其中用英文标明情绪。
  • 语法: {Emotion} 在此输入您的阿拉伯语文本。
  • 示例: {Shouting}, {Whispering}, {Laughing}, {Sighs}

二级:语音设置

使用滑块微调输出:

设置 降低 更高 警告
温度 稳定、连贯,略带机械感。适合播报新闻。 更具创造力与情感色彩。 设置过高可能会导致不稳定或音频幻觉。
相似性 与原作不太像 更像是原版克隆体 保持高水平以确保准确性。
表现力 中立 丰富情感层次 对于长文本,请保持较低的数值以维持稳定性。

5. 掌握方言

黄金法则

对于阿拉伯语方言(如沙特、埃及、约旦方言等),语音必须与文本相匹配。如果你使用埃及俚语进行写作,就必须选择基于埃及方言训练的语音。切勿强行让标准阿拉伯语(Fusha)的语音去说俚语,否则听起来会很不自然。

“启动”技巧

为了帮助 AI 立即识别出方言,请以一个具有鲜明方言特色的词汇作为文本的开头。

示例: 与其用中性的短语开头,不如使用“Izayak, amel eh?”(你好吗?)。这种做法能起到“预热”作用,引导模型在后续段落中保持埃及风格的语调。