文本转语音 (TTS)
利用 AI 语音合成技术,将文本转换为自然逼真的音频。
如何生成音频
生成过程很简单:
-
输入文本: 在输入框中键入或粘贴您的文本。
注意
文本输入至关重要。优质的输入能带来优质的输出。
-
选择语音: 从您的语音列表中选择您想要使用的语音。
提示
如果您想要欢快的声音,请选择基于欢快样本克隆的声音;如果您想要特定的方言,请选择基于该方言训练的声音。
- 调整设置: 配置速度或温度等设置(详情如下)。
- 生成: 点击“运行”按钮以创建音频文件。
生成模式与场景
最重要的一步是决定是否勾选“启用情感与方言模式”选项。这将改变 AI 解读您文本的方式。
场景 A:富于表现力与角色特质的内容(支持情感表达)
非常适合游戏、动画和有声书等需要丰富情感表达及角色互动的领域。
| 能力 | 生成自然逼真的对话,涵盖丰富的情感表达(如笑声、耳语等)。 |
| 语言 | 支持 70 多种语言,包括: 南非荷兰语、阿拉伯语、亚美尼亚语、阿萨姆语、阿塞拜疆语、白俄罗斯语、孟加拉语、波斯尼亚语、保加利亚语、加泰罗尼亚语、宿务语、齐切瓦语、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、菲律宾语、芬兰语、法语、加利西亚语、格鲁吉亚语、德语、希腊语、古吉拉特语、豪萨语、希伯来语、印地语、匈牙利语、冰岛语、印尼语、爱尔兰语、意大利语、日语、爪哇语、卡纳达语、哈萨克语、吉尔吉斯语、韩语、拉脱维亚语、林加拉语、立陶宛语、卢森堡语、马其顿语、马来语、马拉雅拉姆语、普通话、马拉地语、尼泊尔语、挪威语、普什图语、波斯语、波兰语、葡萄牙语、旁遮普语、罗马尼亚语、俄语、塞尔维亚语、信德语、斯洛伐克语、斯洛文尼亚语、索马里语、西班牙语、斯瓦希里语、瑞典语、泰米尔语、泰卢固语、泰语、土耳其语、乌克兰语、乌尔都语、越南语、威尔士语 |
| 最大字符数 | 每次请求 3,000 |
| 预计时长 | 约 3 分钟 |
场景 B:专业且稳定的内容(已禁用情感表达)
非常适合企业视频、在线学习资料以及需要保持语音质量一致性的场景。
| 能力 | 在保持说话者独特特征的同时,呈现一致的音质与个性。 |
| 语言 | 支持 29 种语言: 英语(美国、英国、澳大利亚、加拿大)、日语、中文、德语、印地语、法语(法国、加拿大)、韩语、葡萄牙语(巴西、葡萄牙)、意大利语、西班牙语(西班牙、墨西哥)、印尼语、荷兰语、土耳其语、菲律宾语、波兰语、瑞典语、保加利亚语、罗马尼亚语、阿拉伯语(沙特阿拉伯、阿联酋)、捷克语、希腊语、芬兰语、克罗地亚语、马来语、斯洛伐克语、丹麦语、泰米尔语、乌克兰语、俄语 |
| 最大字符数 | 每次请求 10,000 |
| 预计时长 | 约 10 分钟 |
掌控声音与表演
提示与情绪控制
当勾选“启用情绪”复选框时:
若要生成富有表现力的内容,您可以通过上下文和特定标签来控制呈现方式:
1. 上下文提示
该模型直接从文本中解读语境。添加诸如“她兴奋地说”之类的描述性文字,或使用感叹号,都会影响语音的情感表达。
2. 音频标签(与语音相关)
在文本中插入这些标签,以控制语音效果。注意:实际效果取决于所选的语音。
| 类别 | 标签 |
|---|---|
| 笑声 | [laughs], [laughs harder], [starts laughing], [wheezing] |
| 耳语 | [whispers] |
| 呼吸 | [sighs], [exhales] |
| 情绪 | [sarcastic], [curious], [excited], [crying], [snorts], [mischievously] |
3. 音效
[gunshot], [applause], [clapping], [explosion], [swallows], [gulps]
4. 实验性标签
- 将 X 替换为所需的口音,例如:
[strong French accent] [sings],[woo],[fart]
5. 标点符号与文本结构
- 省略号 (...): 增加停顿与分量感
- 大写: 增强了强调
- 标准标点符号: 提供自然的语流节奏
该情感模型目前处于 Alpha 测试阶段。过短的提示词(prompt)更容易导致输出结果不一致。建议您尝试使用长度超过 250 个字符的提示词。
当取消勾选“启用情绪”时
该系统优先考虑稳定性和一致性。
- 语境至关重要: 请顺应句子的自然语流。AI 会完全按照文本内容进行朗读。
- 停顿: 使用诸如……之类的标签
<power/>,<exciting/>- 注意: 请勿使用过多标签,否则可能会导致不稳定。
- 使用时,试着增强表现力和“温度”。
- 标点符号: 使用破折号 (-) 表示短暂停顿,或使用省略号 (…) 表示迟疑的语气。
- 无情感标签: 请勿在此处使用花括号 {} 或音频标签;AI 可能会将其读出或直接忽略。
语音设置(高级控制)
调整这些滑块以微调输出:
1. 温度(稳定性)
| 范围 | 刚性更高(较低) ↔ 柔韧性更高(较高) |
| 效果 | 较高的温度赋予 AI 更大的自由度和表现力,但也伴随着不稳定性(产生幻觉)的风险;较低的温度则使语音显得更为生硬、稳定。 |
| 推荐 | 将默认值设在 25 到 50 左右是一个很好的起点。 |
2. 相似性
| 范围 | 不太像旁白(较低) ↔ 类似于旁白(较高) |
| 效果 | 提高该数值会增强与原始克隆样本的相似度。然而,如果参考音频中存在噪声,高相似度可能会导致产生伪影或爆音。 |
3. 速度
| 范围 | 0.7(较慢)↔ 1.2(较快)。默认值为 1.0。 |
| 效果 | 控制节奏。极端数值可能会影响质量。 |
4. 表现力
| 范围 | 中性语调(较低) ↔ 情感充沛的表达(较高) |
| 效果 | 提高该数值会使输出更接近自然的表现;但若提高过度,则可能导致异常行为。 |
文本归一化(发音)
归一化有助于改善数字、日期和复杂文本的发音。
归一化模式
| 模式 | 制作人员名单 | 最适合 | 功能 |
|---|---|---|---|
| 基本归一化 | x1 | 所有语言 | 进行标准文本归一化处理,以确保语音流转自然。建议在采用情感提示或旨在呈现方言对话时使用此功能。 |
| AI 增强型归一化 | x2 | 阿拉伯语内容 | 全面的文本优化。它能理解上下文并进行断句,同时自动添加变音符号(Tashkeel),确保 AI 能准确读出阿拉伯语单词。 |
如果您旨在生成方言,AI 增强型归一化可能无法带来理想的效果。对于方言内容,请使用基础归一化。
输入最佳实践
数字
文本转语音模型在处理电话号码或货币等格式时可能会遇到困难。
| 类型 | 代替;而不是 | 写 |
|---|---|---|
| 电话号码 | 123-456-7890 |
“一、二、三,四、五、六……” |
| 货币 | $45.67 |
四十五美元六十七美分 |
| 缩略语 | Dr., St. |
“医生”、“街道” |
| 网址 | moknah.io/docs |
moknah.io/docs |
| 符号 | 100% |
百分之百 |
分步指南
使用“文本转音频”(Text to Audio)或“文本转音频工作室”(Text to Audio Studio)生成您的首个音频非常简单。不过,若想充分利用这些功能,您需要注意以下几点。
第 1 步:输入文本
在“文本转音频”页面的输入框中键入或粘贴文本。您可以在文本中加入表现力标签,以获得更出色的语音生成效果。
- 如果启用了“情绪”功能: 使用括号内的标签,例如
[shouting]或[breathing]. 这些非常有效。 - 如果禁用了“情绪”: 您仍然可以描述期望的演绎方式(例如写上“兴奋”),或者使用包含在……中的标签
</xxxx>, 尽管这些是实验性的。
• 所有标签必须使用英语,因为在其他语言中使用这些标签尚处于实验阶段。
• 标准语音生成框仅支持 1500 个字符(为获得最佳音质,建议每次生成约 200 个字符)。
• 若需处理大量内容(如有声书、长篇文章),请改用“文本转音频工作室”(Text to Audio Studio)。
步骤 2:选择语音
从列表中选择您想要使用的语音。
选择语音至关重要;例如,如果您需要标准阿拉伯语发音,最好从一开始就选择相应的语音,而不是选择特定方言的语音。不过,如果您选择了针对特定方言的语音,它依然能够朗读标准阿拉伯语文本——甚至可能赋予其独特的活力。
如果你希望以特定方言进行演绎,但不想启用情感参数,那么提高表现力(expressiveness)和温度(temperature)将使演绎效果更接近你想要的方言风格。随着练习的深入,你将能更好地掌握如何通过调整这些设置来实现理想的平衡效果。
步骤 3:调整设置(可选)
根据所需的输出效果修改语音设置。推荐的默认设置如下:
温度
- 更高 = 更大的灵活性: 这赋予了 AI 模型更大的语音控制自由度,但如果数值设置过高,可能会导致异常的输出效果。
- 数值越低 = 刚性越强: 将其降至零会使旁白变得更加生硬、缺乏生气。
相似性
- 数值越高 = 类似于旁白: 这能提高与原始克隆声音的相似度。若参考样本不够纯净,将其设置为最大值可能会引入爆裂声等音频伪影。
- 数值越低 = 越不像旁白: 如果源素材包含噪点,请降低该数值以获得更干净的效果。
速度
- 越高 = 越快 / 越低 = 越慢: 调至最大或最小可能会降低质量。请仅在必要时使用。
表现力
- 数值越高 = 情感表达越丰富: 能使输出更接近自然的表现,但设置过高可能会导致异常行为。
- 较低 = 中性语气: 对于大规模语音生成(特别是在 Voice Studio 中),我们建议将其保持为零,并针对特定台词进行试验性调高。
情感设置
如果您选择启用情感功能,建议调高温度设置:
步骤 4:选择归一化
- 基础: 无需额外修改即可适用于阿拉伯语,同时也适用于其他非阿拉伯语语言。
- AI 增强: 专为阿拉伯语设计——能够理解语境、进行句子切分,并添加正确的发音符号。
步骤 5:生成
点击“Text to Audio”中的“Run”按钮或“Text to Audio Studio”中的“Generate”按钮,即可创建音频文件。在 Studio 中,您可以通过点击合并按钮,一次性生成数千行内容。
文本转音频
使用 Moknah 将文本转换为语音的指南
根据上图所示的界面,生成音频的步骤如下:
-
输入文本: 在大的输入框中输入或粘贴您想要转换为语音的文本。
注意:此工具每次请求的字符数限制为 1500 个字符。 - 选择语音: 点击标有“选择语音”的下拉菜单。您可以按名称、语言、性别、年龄、使用场景或方言搜索特定语音。
-
配置模式(可选):
- 标准生成: 若需稳定且专业的旁白效果,请勿勾选“启用情感与方言模式”选项。
- 情感与方言模式: 如果您希望控制特定情绪或使用方言,请勾选此框。
提示:如果勾选此项,请使用花括号标注情绪(例如 {Shouting}),并确保文本方言与所选语音的方言一致。
-
选择归一化:
- 基础归一化(1倍学分): 针对自然语音流的标准处理。
- AI 增强型归一化(2 倍点数): 包含拼写错误纠正与优化的进阶处理(推荐用于复杂文本或阿拉伯语)。
- 生成: 点击底部的蓝色“Run”按钮以生成音频。
在生成之前,您可以点击左上角附近的“语音设置”按钮,调整语速或稳定性等高级参数。
文本转音频工作室
专为有声书、播客和长篇配音等大型项目而设计。与仅处理短文本的标准“文本转语音”工具不同,该 Studio 允许您在同一个工作区内管理、编辑并生成完整的文档。
主要特点
批量导入
直接以 Word 文档(.doc、.docx)格式上传完整的书籍或剧本。
智能细分
系统会自动将您上传的文档拆分为易于处理的行或章节。这使您可以将每个句子或段落视为独立单元,并根据需要应用不同的设置或进行编辑。
综合翻译
在项目设置期间,您可以启用“翻译”开关,以便在生成音频之前将上传的完整文档自动翻译成 100 多种语言。
自动化生产
项目设置完成后,您只需点击“转换”按钮,即可一次性生成整个项目的音频。
如何创建 Studio 项目
- 项目信息: 为你的项目起个标题(例如“我的第一本有声书”)。
- 内容来源: 拖放您的 Word 文件。
- 文本处理: 在以下选项中选择:
- 基础: 快速处理标准文本。
- AI 增强: 高级处理(最适用于阿拉伯语),确保整个文档中的发音和变音符号准确无误。
- 译文(可选): 如果您希望将源文本转换为另一种语言,请切换“启用翻译”选项。
- 创建: 点击“创建项目”。随后您将进入工作区,在那里可以查看片段并启动批量生成流程。
通过简短的步骤,了解更多关于制作有声书的信息: 15分钟内将书籍转换为有声书
专业指南:精通阿拉伯语 AI 语音生成
技巧、诀窍与最佳实践
AI 语音创作者的终极目标,是在尽可能节省点数消耗的同时,生成音质极佳且演绎自然的音频。Moknah 为您提供打造专业级配音的先进工具,而本指南将涵盖您所需掌握的核心技巧。
1. 分割的艺术(文本准备)
AI 模型会严格遵循你文本的结构。文本的拆分方式决定了性能质量、节奏以及成本。
问题所在:“文本块”
如果你在不进行拆分的情况下粘贴一个长段落,模型会将其视为单行文本。
- 后果: AI 往往急于读完长句,导致语速不自然。
- 费用: 如果有一个词出错,你就必须重新生成整个段落,从而浪费点数。
错误:随机拆分
如果你在句子中间随意按下“回车键”,AI 会遵循你的指令,在每一行末尾强制停顿(即 Sukoon/Tskeen)。
- 后果: 这会导致音频断断续续、不连贯,并增加语法错误。
专业解决方案:有意识的细分
- 第一条规则: 根据标点符号(逗号、句号、分号)拆分文本。
- 规则二: 如果原文缺少标点符号,请自行添加,尤其是在连词(如“and”、“but”)之前。
- 黄金法则: 朗读这段文字。每当自然停顿换气时,就在那里换行。
- 针对长篇内容: 使用 Text to Audio Studio——它会自动为您处理分段。
2. 变音符号与规范化(Tashkeel)
问题: 我应该手动为全文完整添加变音符号(Tashkeel)吗?
回答: 不是。过多的手动标注变音符号会对模型施加过多限制,从而削弱其利用自身“自动标注变音符号”功能的能力。
方案 A:AI 增强标准化(“魔法”按钮)
这项功能是您的秘密武器。一旦选中,系统便会自动:
- 根据语境为阿拉伯语文本添加变音符号。
- 添加必要的标点符号。
- 修正了拼写错误。
结果: 无需人工干预即可解决 99% 的发音问题。
方案 B:人工“策略性”附加符号
如果使用基本归一化,请遵循“极简主义方法”:
- 需要添加变音符号的内容: 只有那些你觉得难以阅读的词,或者具有双重含义的词。
- 如何: 无需给整个单词都加上变音符号,只需在那个容易产生歧义的特定字母上添加即可。
例如:若要区分“Kutiba”(被写)与“Kataba”(他写),只需在第一个字母上加上 Damma(合口符)即可:كُتب
3. 文本格式规则
该模型偏好简洁明了的文本。请遵循以下格式规则:
| ✅ 这样做 | ❌ 不要 |
|---|---|
| 将数字转换为文字(例如“Year two thousand and twenty”而非“2020”) | 使用项目符号 |
| 使用破折号 (-) 标示插入语 | 使用字符拉伸(Hello) |
| 在自然停顿处使用逗号。 | 使用斜杠/下划线(/ 或 _) |
| 撰写简洁明了的文字 | 使用省略号(...)来分隔句子(除非你想要表达“犹豫”的语气)。 |
“外来字符”技巧(P、G、V、CH)
阿拉伯语中缺少 P、G 或 V 等音素。若要让 AI 在阿拉伯语文本中准确读出外国姓名,请使用乌尔都语或波斯语字符:
| 目标音 | 信函 | 通用阿拉伯语书写 | 正确的发音 |
|---|---|---|---|
| P | پ | 百事可乐 | 百事可乐 (Pepsi) |
| G | گ | Joojle | 谷歌 (Google) |
| CH | چ | 三明治 | 三明治 (Sandwich) |
乌尔都语/波斯语字母参考
| 信函 | 声音 | 描述 | 示例 |
|---|---|---|---|
| پ (Pe) | /p/ | 代表 /p/ 音,该音在标准阿拉伯语中不存在。 | 我和朋友一起去了巴基斯坦。 |
| چ (Che) | /ch/ | 代表“chair”一词中的 /ch/ 音 | 我在印度见到了美味的茶。 |
| ٹ (Ṭe) | /ṭ/ | 卷舌音 T,比阿拉伯语的“ت”更强、更厚重。 | 我在一家锡制品厂工作过。 |
| ڈ (Ḍāl) | /ḍ/ | 卷舌音 D,比阿拉伯语的“د”发音更重。 | 我在医院见到了医生。 |
| ڑ (Re) | /ṛ/ | 卷舌 R,强颤音“r” | 我住在山脚下的一个村庄里。 |
| گ (Gāf) | /g/ | 代表单词“go”中的 /g/ 音 | 我们去古吉拉特邦进行了一次短途旅行。 |
| ں (Nūn Ghunnā) | 鼻音 /n/ | 鼻音化的“n”,由鼻腔发出 | 这是来自麦地那的艾哈迈德。 |
| ے (Baṛī Ye) | 长元音 /e/ | 长元音“e”或词尾的“ya”音 | 我在清真寺遇见了阿里。 |
4. 控制表现与情绪
你可以让 AI 像演员一样表演,而不是像新闻播报员那样。这可以通过“模式与设置”来实现。
第一阶段:选择模式
在生成界面中,您会看到一个复选框:“启用情感与方言模式”。
A. 标准模式(未勾选复选框)
最适合: 专业旁白、有声书、在线学习。
- 停顿: 若要强制静音,请在新行中添加此标签:
<break time="1.5s"/> - 微妙的情绪: 在行尾使用上下文或描述性标签(实验性功能): 她看着那些花……
<With Amazement/>
B. 情感与方言模式(已勾选)
最适合: 剧情、游戏、角色对话。
- 情感标签: 在句首使用花括号 {},并在其中用英文标明情绪。
- 语法:
{Emotion} 在此输入您的阿拉伯语文本。 - 示例:
{Shouting},{Whispering},{Laughing},{Sighs}
二级:语音设置
使用滑块微调输出:
| 设置 | 降低 | 更高 | 警告 |
|---|---|---|---|
| 温度 | 稳定、连贯,略带机械感。适合播报新闻。 | 更具创造力与情感色彩。 | 设置过高可能会导致不稳定或音频幻觉。 |
| 相似性 | 与原作不太像 | 更像是原版克隆体 | 保持高水平以确保准确性。 |
| 表现力 | 中立 | 丰富情感层次 | 对于长文本,请保持较低的数值以维持稳定性。 |
5. 掌握方言
对于阿拉伯语方言(如沙特、埃及、约旦方言等),语音必须与文本相匹配。如果你使用埃及俚语进行写作,就必须选择基于埃及方言训练的语音。切勿强行让标准阿拉伯语(Fusha)的语音去说俚语,否则听起来会很不自然。
“启动”技巧
为了帮助 AI 立即识别出方言,请以一个具有鲜明方言特色的词汇作为文本的开头。
示例: 与其用中性的短语开头,不如使用“Izayak, amel eh?”(你好吗?)。这种做法能起到“预热”作用,引导模型在后续段落中保持埃及风格的语调。