PODCAST MULTI-SPEAKER / SEED-VC V2

双人对话音色转换试听

四段样本来自现有 podcast 数据的高置信度 Person A/B 标注。三个播放器均统一到 -19 LUFS;第三组按原时间轴回填并补齐,因此与原音严格同样本数。

试听重点:第二组是否把两个原说话人变成同一个人;第三组的换人边界、短句、语气和背景连续性是否自然。

Seed-VC V2convert_style=falselength_adjust=1.010 diffusion stepsCFG 0.7 / 0.722.05 kHz

目标音色参考

均为 podcast 数据中纯度 100% 的单人语音种子。整段单目标实验统一使用目标 A;分说话人实验使用 A→目标 A、B→目标 B。

目标 A · 给 Person A

experiments/podcast_a2v_clean_v3_1248x704_v1/article_voice_seeds_speaker_v1/audio/91fmhAnECVc/person_b_01.wav

目标 B · 给 Person B

experiments/podcast_a2v_clean_v3_1248x704_v1/article_voice_seeds_speaker_v1/audio/BV1oXj96WEKQ/person_a_01.wav

-sowOoOeQz4_data_000001

双人对话 · 9.71 秒

A/B 标注覆盖率 100%
Person A

常重大的一个变化。

Person B

ChatGPT会成为一个新的超级入口吗?

Person A

会啊,它为什么要聚焦在日活上?就是想成为一个超级APP的入口,而且群聊以后它后面的想象空间更大。

① 原始音频

节目级归一化音频,再统一到试听响度。

② 整段 → 单目标音色

不看说话人边界,整段转换到目标 A;检查两人是否被合并。

整段推理1.57s分段推理合计2.54s
模型原生长度差-2.4ms最终长度差0 samples

HvMANU1yc0U_data_000003

双人对话 · 10.38 秒

A/B 标注覆盖率 100%
Person A

然后要去解决的挑战和价值所在。

Person B

距离上次的AITalk过去了一百三十天啊,你最大的进步是什么?你有成为一个更智能的理想吗?

Person A

这一百三十天,我觉得更

① 原始音频

节目级归一化音频,再统一到试听响度。

② 整段 → 单目标音色

不看说话人边界,整段转换到目标 A;检查两人是否被合并。

整段推理0.93s分段推理合计2.11s
模型原生长度差-7.3ms最终长度差0 samples

KcujArdWR8w_data_000005

双人对话 · 12.04 秒

A/B 标注覆盖率 100%
Person B

做了多长时间这个公司啊?

Person A

这个公司大概做了三年的时间,三年到博士毕业啊,到博士毕业。

Person B

哦,你前面工作经历非常的杂,是不是因为你一直在pass很多事情?你发现很多事情其实不适合自己

① 原始音频

节目级归一化音频,再统一到试听响度。

② 整段 → 单目标音色

不看说话人边界,整段转换到目标 A;检查两人是否被合并。

整段推理1.04s分段推理合计1.97s
模型原生长度差-2.2ms最终长度差0 samples

UqMtkgQe-kI_data_000008

双人对话 · 5.38 秒

A/B 标注覆盖率 100%
Person A

钱的这个模式,已经不太work了。

Person B

那个时候已经感觉到不work了,对吧?

Person A

很明显,因为当时的话已经又过了两年了。

① 原始音频

节目级归一化音频,再统一到试听响度。

② 整段 → 单目标音色

不看说话人边界,整段转换到目标 A;检查两人是否被合并。

整段推理0.85s分段推理合计1.75s
模型原生长度差-11.2ms最终长度差0 samples

实验说明

说话人边界来自 podcast_speaker_attribution_v1,没有重新做人工 diarization。分说话人版本在每个边界使用 25ms 淡入淡出,非说话间隙保留原音。结果只用于本地试听判断,不覆盖数据集源文件。

本次模型加载 7.77s;峰值显存 3.27 GiB。详细参数和每个 turn 的长度修正记录见 results.json