音色 A参考 F0≈82Hz
ASR:有少量词级漂移
RTX 4090 已实际跑通。用于A2V数据增强时,应默认只换音色、关闭风格转换。
时长:7.708s → 7.697s(−0.14%)。ASR正文基本一致,仅有虚词和标点差异。
全部关闭风格转换,输出均为7.697秒。F0仅用于帮助排列音区,不代表性别判断。
ASR:有少量词级漂移
ASR:正文基本一致
ASR:一处虚词遗漏
ASR:正文基本一致
ASR:正文基本一致
ASR:正文基本一致
ASR:末句有一处词级漂移
ASR:首尾均有轻微词级漂移
只换音色的ASR与原文一致;开启风格转换后,开头从
Today we're going to… 变成了 After that, we're gonna…。
AR风格分支可能改变内容,不适合严格字幕或嘴型对齐。
| 项目 | 实测 |
|---|---|
| 模型加载 | 18.44s |
| 常驻后首条只换音色 | 2.90s / 7.70s音频 |
| 常驻后第二条只换音色 | 0.80s,RTF 0.104 |
| 音色+风格 | 5.85s / 8.05s音频,RTF 0.727 |
| 模型常驻显存 | 2.17GiB |
| 推理峰值显存 | 3.44GiB |
原始输出存在响度偏大问题;本页播放的是经过 loudnorm 处理的安全版本。