语音克隆 (Voice Cloning)
若要创建高质量的定制语音,输入音频(训练数据)必须非常纯净。
- 录制地点 (Recording Location):
- 减少房间的回声或混响。利用隔音舱、衣柜或用毯子搭建的“堡垒”来为房间进行隔音处理。
- 设备 (Equipment):
- 麦克风:建议使用专业 XLR 麦克风(价格在 150-300 美元之间,例如 Audio-Technica AT2020 或 Rode NT1)。
- 音频接口 (Interface):使用 USB 接口(例如 Focusrite)。
- 防喷罩 (Pop-Filter):用于避免爆破音(气流冲击麦克风)的必要设备。
- 软件 (Software/DAW):
- 使用 REAPER 或 Audacity 等软件。
- 设置:以 44.1kHz 或 48kHz 的采样率及 24-bit 的位深录制 WAV 文件。
- 电平:目标是将音频峰值(Peaks)控制在 -6 dB 至 -3 dB 之间,并将平均响度设定为 -18 dB。
- 定位 (Positioning):
- 请保持与麦克风约 20 厘米(相当于两个拳头的宽度)的距离。
- 说话时请保持一定角度,以避免呼吸直接对着麦克风。
- 性能 (Performance):
- 一致性:全程保持相同的能量或语调。不要在训练文件中混用耳语和大喊。
人工智能会复制一切,包括呼吸声、结巴以及犹豫时的声音(如“嗯……”)。请确保该表现正是你想要复制的效果。
خ