常见问题与故障排查
常见问题与解决方案
常见问题
为什么每次的输出结果都不一样?
该 AI 具有非确定性。就像人类演员一样,它每次的表现都会略有不同。您可以使用“温度”(Temperature)滑块来控制这种变化程度:
- 降低温度: 更一致、可预测的输出
- 较高温度: 更丰富的变化与表现力
为什么声音的选择如此重要?
音色选择对输出结果有巨大影响。AI 会继承所选音色的特征:
- 如果你想要一种带有内省感的嗓音,就选择听起来具有内省特质的嗓音。
- 如果您想要充满活力的声音,请选择基于充满活力的样本克隆而成的声音。
- 如果您需要特定的方言,请选择使用该方言训练出的语音。
记住:优质输入 = 优质输出
如果提供的音频包含噪音、混响或多位说话人,AI 的表现可能会不稳定。为获得最佳效果,请务必使用纯净、高质量的源素材。
学分是如何计算的?
积分根据文本字符数及所选的标准化模式进行计算:
- 基本归一化: 1 个积分
- AI 增强型归一化: 双倍积分
生成的是什么音频格式?
所有生成的音频均以 MP3 格式(128 或 192 kbps,44.1 kHz)提供,以确保最佳的音质与兼容性。
有字符限制吗?
| 模式 | 字符限制 | 预计时长 |
|---|---|---|
| 已启用情感与方言 | 3,000个字符 | 约 3 分钟 |
| 标准模式 | 10,000个字符 | 约 10 分钟 |
| 文本转音频(快速) | 1,500个字符 | 约 1.5 分钟 |
对于较长的内容,请使用 文本转音频工作室.
我可以将生成的音频用于商业用途吗?
是的,根据您的订阅条款,使用您的账户生成的所有音频均可用于商业用途。
故障排查
音频听起来有机械感
- 尝试提高 Temperature(温度)设置,以获得更自然的变化。
- 稍微调高“表现力”滑块
- 启用“情感与方言”模式,打造富有表现力的内容。
- 尝试一种与您内容风格相符的不同语调
输出不一致或不稳定
- 降低温度设定
- 调低“表现力”滑块
- 使用更长的提示词(“情感”模式建议使用 250 个字符以上)
- 请确保用于语音克隆的源音频清晰且无噪音。
生成速度很慢
- 较长的文本需要更多时间来处理。
- AI 增强型归一化需要额外处理
- 检查您的互联网连接
意想不到的发音
- 对阿拉伯语文本使用 AI 增强的标准化处理(自动添加变音符号)
- 为歧义词手动添加变音符号(تشكيل)
- 用单词而非数字来书写数字
- 展开缩写(例如:’Dr.’ → ’Doctor’)
- 试试换个语音——有些语音对特定词汇的处理效果更好。
方言无法正常工作
- 请确保所选语音与文本中的方言相匹配。
- 对方言内容使用基础标准化(而非 AI 增强)
- 以一个极具方言特色的词汇作为文本开头,以此“预热”模型。
- 启用情感与方言模式
克隆出的声音听起来不像原声。
- 调高“相似度”滑块
- 确保您的训练音频质量高(无噪音、回声或混响)。
- 检查训练音频在全程中是否保持了连贯的语调与能量。
- 如果源素材包含噪点,请降低“相似度”以减少伪影。
联系支持
请联系我们的支持团队: support@moknah.io 我们将协助您解决任何问题。