目标 A · 给 Person A
experiments/podcast_a2v_clean_v3_1248x704_v1/article_voice_seeds_speaker_v1/audio/91fmhAnECVc/person_b_01.wav
PODCAST MULTI-SPEAKER / SEED-VC V2
四段样本来自现有 podcast 数据的高置信度 Person A/B 标注。三个播放器均统一到 -19 LUFS;第三组按原时间轴回填并补齐,因此与原音严格同样本数。
试听重点:第二组是否把两个原说话人变成同一个人;第三组的换人边界、短句、语气和背景连续性是否自然。
均为 podcast 数据中纯度 100% 的单人语音种子。整段单目标实验统一使用目标 A;分说话人实验使用 A→目标 A、B→目标 B。
experiments/podcast_a2v_clean_v3_1248x704_v1/article_voice_seeds_speaker_v1/audio/91fmhAnECVc/person_b_01.wav
experiments/podcast_a2v_clean_v3_1248x704_v1/article_voice_seeds_speaker_v1/audio/BV1oXj96WEKQ/person_a_01.wav
-sowOoOeQz4_data_000001
常重大的一个变化。
ChatGPT会成为一个新的超级入口吗?
会啊,它为什么要聚焦在日活上?就是想成为一个超级APP的入口,而且群聊以后它后面的想象空间更大。
节目级归一化音频,再统一到试听响度。
不看说话人边界,整段转换到目标 A;检查两人是否被合并。
Person A/B 分别转换后放回原时间轴;间隙保留原音。
| 整段推理 | 1.57s | 分段推理合计 | 2.54s |
|---|---|---|---|
| 模型原生长度差 | -2.4ms | 最终长度差 | 0 samples |
HvMANU1yc0U_data_000003
然后要去解决的挑战和价值所在。
距离上次的AITalk过去了一百三十天啊,你最大的进步是什么?你有成为一个更智能的理想吗?
这一百三十天,我觉得更
节目级归一化音频,再统一到试听响度。
不看说话人边界,整段转换到目标 A;检查两人是否被合并。
Person A/B 分别转换后放回原时间轴;间隙保留原音。
| 整段推理 | 0.93s | 分段推理合计 | 2.11s |
|---|---|---|---|
| 模型原生长度差 | -7.3ms | 最终长度差 | 0 samples |
KcujArdWR8w_data_000005
做了多长时间这个公司啊?
这个公司大概做了三年的时间,三年到博士毕业啊,到博士毕业。
哦,你前面工作经历非常的杂,是不是因为你一直在pass很多事情?你发现很多事情其实不适合自己
节目级归一化音频,再统一到试听响度。
不看说话人边界,整段转换到目标 A;检查两人是否被合并。
Person A/B 分别转换后放回原时间轴;间隙保留原音。
| 整段推理 | 1.04s | 分段推理合计 | 1.97s |
|---|---|---|---|
| 模型原生长度差 | -2.2ms | 最终长度差 | 0 samples |
UqMtkgQe-kI_data_000008
钱的这个模式,已经不太work了。
那个时候已经感觉到不work了,对吧?
很明显,因为当时的话已经又过了两年了。
节目级归一化音频,再统一到试听响度。
不看说话人边界,整段转换到目标 A;检查两人是否被合并。
Person A/B 分别转换后放回原时间轴;间隙保留原音。
| 整段推理 | 0.85s | 分段推理合计 | 1.75s |
|---|---|---|---|
| 模型原生长度差 | -11.2ms | 最终长度差 | 0 samples |
说话人边界来自 podcast_speaker_attribution_v1,没有重新做人工 diarization。分说话人版本在每个边界使用 25ms 淡入淡出,非说话间隙保留原音。结果只用于本地试听判断,不覆盖数据集源文件。
本次模型加载 7.77s;峰值显存 3.27 GiB。详细参数和每个 turn 的长度修正记录见 results.json。