用户指南 API 参考

语音克隆(录音指南)

利用优质训练数据打造高品质的定制语音

语音克隆界面
语音克隆界面
质量至上

要创建高质量的定制语音,输入的音频(训练数据)必须纯净无瑕。AI 会复刻它听到的所有内容——包括其中的瑕疵。

1. 录制地点

尽量减少房间内的回声与混响。可采用以下任一方法来“抑制”房间内的声音反射:

  • 人声录音间: 专业隔音室(最佳选择)
  • 衣橱: 装满衣物的衣柜能自然地吸收声音。
  • 毯子堡垒: 用厚毯子将自己围起来,以减弱反射。
快速测试

在房间里拍手。如果听到明显的回声或余音,说明该房间需要进行更多的声学处理。

2. 设备

设备 推荐 备注
麦克风 专业级 XLR 麦克风(150-300美元) 推荐 Audio-Technica AT2020 或 Rode NT1
接口 USB 音频接口 推荐 Focusrite Scarlett 系列
防喷罩 必不可少的 防止爆破音(即发 P、B、T 音时气流冲击麦克风产生的噪音)

3. 软件 (DAW)

使用 REAPER 或 Audacity 等专业录音软件。

推荐设置

设置 价值
文件格式 WAV(未压缩)
采样率 44.1 kHz 或 48 kHz
位深 24位
峰值水平 -6 dB 至 -3 dB
平均响度 -18 dB
避免削波

切勿让音频电平达到 0 dB。发生削波(失真)的音频无法修复,且会毁掉你的语音克隆效果。

4. 定位

  • 距离: 保持距离麦克风约 20 厘米(约两个拳头的宽度)。
  • 角度: 说话时稍微偏离麦克风轴线(保持一定角度),以避免气息直接吹向麦克风。
  • 一致性: 在整个录制过程中保持同一姿势。

5. 性能

保持一致至关重要

在整个录音过程中,请保持一致的精气神和语调。请勿在训练文件中混用不同的风格:

✅ 这样做 ❌ 不要
保持音量一致 交替使用耳语与大喊
保持同样的能量水平 在兴奋与疲惫的表达状态之间切换
保持自然的节奏 匆匆带过某些部分
说话清晰利落 包含“嗯”、“呃”等语气词、结巴或错误
严重警告

AI 会复刻所有细节,包括呼吸声、结巴、咂嘴声以及“嗯”之类的语气词。请确保录音表现正是您想要克隆的效果,因为训练数据中的任何瑕疵都会在生成的语音中体现出来。

汇总核对表

  • 该房间经过声学处理(无回声)。
  • 使用配备防喷罩的优质 XLR 麦克风
  • 以 44.1/48 kHz、24-bit 的 WAV 格式录音
  • 峰值电平在 -6 至 -3 dB 之间
  • 放置在距离麦克风 20 厘米处,并保持微小角度
  • 始终保持一致的基调与活力
  • 没有结巴、“呃”之类的停顿或多余杂音