作者:@刘悦的技术博客
BreezeTTS-2:4G显存实时TTS,超长文本/声音克隆/低语指令与API用法
一句话导读:刘悦实测开源 BreezeTTS-2——4060 笔记本约 4G 显存即可实时推理,支持参考音频声音克隆、指令文本(低语等)、副文本特殊场景,以及接口服务与超长文本朗读。
核心内容:
1. 定位与启动:BreezeTTS 属具备指令文本 / 副文本指令能力的 TTS 模型,适合内容创作与填词类场景;双击启动后会自动拉起接口服务,默认走参考音频做声音克隆。
2. 硬件门槛:作者在 4060 笔记本上演示,显存占用约 4G,对低显存本机友好。
3. 指令文本与低语:可在指令文本中指定「耳语」等风格;通过调高 CFG 系数强化指令遵循程度。视频中用同一句中英文指令文本对比了正常与耳语效果。
4. 风格与自定义音色:除指令外还可切换缓慢/客制风格;支持自行设计音色参考,并演示了古风吟诵、轻松对白等不同参考声的生成差异。
5. 副文本特殊场景:可用副文本指令生成特殊情绪/场景语音(视频中演示了音量调低、情绪化语气等)。
6. API 直出:除本地界面外,可直接调用接口服务做推理;末段用超长叙事文本实测连续朗读,验证长文本与实时推理稳定性。
7. 注意:后半段超长文本为音色/连贯性演示素材,本身不是教程正文;落地请以模型能力与合规用途为准。
适合人群:需要本机低显存实时 TTS、声音克隆、指令可控风格,或要接 API 做长文本播报的开发者与创作者。
补充说明:本文根据授权视频转写整理,建议观看原视频获取完整演示细节。
相关夸克网盘链接:
【BreezeTTS-2:https://pan.quark.cn/s/b1ad839653da】 |