音频与性能控制
情绪引导与控制
勾选“启用情感”选项后,您可以使用上下文和指定的标签来控制表达方式。
- 语境引导:模型直接从文本中解读语境。添加诸如“她兴奋地说”之类的描述性文字,或使用感叹号,都会影响语音所表达的情感。
- 语音标记(与声音相关):将这些标记置于文本中,以引导语音表达。
注意:效果取决于所选的声音。
- [笑],[笑得更厉害],[开始笑],[笑得喘不过气]
- [低语]
- [叹气], [呼气]
- [讽刺的]、[好奇的]、[兴奋的]、[哭泣的]、[嗤之以鼻]、[调皮地]
- 音效:
- [枪声], [掌声], [拍手声], [爆炸声]
- [吞咽], [大口吞咽]
- 试验性标志:
- [浓重的 X 口音](将 X 替换为所需口音,例如 [浓重的黎巴嫩口音])
- [唱歌], [欢呼], [放屁]
- 标点符号与文本构建:
- 省略号(…):用于增加停顿与分量感。
- 大写字母:用于加强语气。
- 标准标点符号:旨在营造自然的语流节奏。
重要提示:情感模型目前处于 Alpha 阶段。过短的指令很可能导致输出结果不一致。建议您尝试长度超过 250 个字符的指令。若未勾选“启用情感”选项,系统将优先保证稳定性和一致性。
- 如何传达指示:
- 语境至关重要:请顺应句子的自然语流。人工智能会完全按照文本的写法进行读取。
- 标点符号:使用此类符号。
- 句法结构:
- 注意:请勿使用过多标记,否则可能会导致不稳定。
- 注意:这可能会成功,也可能不会,具体取决于上下文。使用时,尝试提高表现力和“温度”(temperature)参数。
- 标点符号:使用连字符(-)表示短暂停顿,或使用省略号(...)表示犹豫的语气。
- 无情感标记:请勿在此处使用花括号 {} 或语音标记;人工智能可能会将其朗读出来或直接忽略。
音频设置(高级控制)
调整这些参数,以精确控制输出。
- 创新系数(稳定性系数)
- 范围:更硬(较低)↔ 更具弹性(较高)。
- 影响:较高的“温度”赋予人工智能更大的自由度和表现力,但也伴随着不稳定性(产生幻觉)的风险;较低的“温度”则使声音显得更为僵硬和稳定。
- 建议:默认值(约 25-50)是一个很好的起点。
- 相似性
- 范围:较少类似旁白(低) ↔ 类似旁白(高)。
- 效果:提高该设置会增加与原始版本的相似度。然而,如果参考音频包含噪声,高相似度可能会导致失真或杂音的重现。
- 速度
- 范围:0.7(较慢)↔ 1.2(较快)。默认值为 1.0。
- 影响:控制节奏。极值可能会影响质量。
- 表现主义
- 范围:中性语调(低)↔ 情感化演绎(高)。
- 影响:提高该数值会使输出更接近正常表现;若提高过度,则可能导致异常行为。
خ