用户指南 API 参考

常见问题与故障排查

常见问题与解决方案

常见问题

为什么每次的输出结果都不一样?

该 AI 具有非确定性。就像人类演员一样,它每次的表现都会略有不同。您可以使用“温度”(Temperature)滑块来控制这种变化程度:

  • 降低温度: 更一致、可预测的输出
  • 较高温度: 更丰富的变化与表现力

为什么声音的选择如此重要?

音色选择对输出结果有巨大影响。AI 会继承所选音色的特征:

  • 如果你想要一种带有内省感的嗓音,就选择听起来具有内省特质的嗓音。
  • 如果您想要充满活力的声音,请选择基于充满活力的样本克隆而成的声音。
  • 如果您需要特定的方言,请选择使用该方言训练出的语音。
记住:优质输入 = 优质输出

如果提供的音频包含噪音、混响或多位说话人,AI 的表现可能会不稳定。为获得最佳效果,请务必使用纯净、高质量的源素材。

学分是如何计算的?

积分根据文本字符数及所选的标准化模式进行计算:

  • 基本归一化: 1 个积分
  • AI 增强型归一化: 双倍积分

生成的是什么音频格式?

所有生成的音频均以 MP3 格式(128 或 192 kbps,44.1 kHz)提供,以确保最佳的音质与兼容性。

有字符限制吗?

模式 字符限制 预计时长
已启用情感与方言 3,000个字符 约 3 分钟
标准模式 10,000个字符 约 10 分钟
文本转音频(快速) 1,500个字符 约 1.5 分钟

对于较长的内容,请使用 文本转音频工作室.

我可以将生成的音频用于商业用途吗?

是的,根据您的订阅条款,使用您的账户生成的所有音频均可用于商业用途。


故障排查

音频听起来有机械感

  • 尝试提高 Temperature(温度)设置,以获得更自然的变化。
  • 稍微调高“表现力”滑块
  • 启用“情感与方言”模式,打造富有表现力的内容。
  • 尝试一种与您内容风格相符的不同语调

输出不一致或不稳定

  • 降低温度设定
  • 调低“表现力”滑块
  • 使用更长的提示词(“情感”模式建议使用 250 个字符以上)
  • 请确保用于语音克隆的源音频清晰且无噪音。

生成速度很慢

  • 较长的文本需要更多时间来处理。
  • AI 增强型归一化需要额外处理
  • 检查您的互联网连接

意想不到的发音

  • 对阿拉伯语文本使用 AI 增强的标准化处理(自动添加变音符号)
  • 为歧义词手动添加变音符号(تشكيل)
  • 用单词而非数字来书写数字
  • 展开缩写(例如:’Dr.’ → ’Doctor’)
  • 试试换个语音——有些语音对特定词汇的处理效果更好。

方言无法正常工作

  • 请确保所选语音与文本中的方言相匹配。
  • 对方言内容使用基础标准化(而非 AI 增强)
  • 以一个极具方言特色的词汇作为文本开头,以此“预热”模型。
  • 启用情感与方言模式

克隆出的声音听起来不像原声。

  • 调高“相似度”滑块
  • 确保您的训练音频质量高(无噪音、回声或混响)。
  • 检查训练音频在全程中是否保持了连贯的语调与能量。
  • 如果源素材包含噪点,请降低“相似度”以减少伪影。

联系支持

请联系我们的支持团队: support@moknah.io 我们将协助您解决任何问题。