西北工业大学研究生 · 语音分离与目标说话人提取 —— 把混在一起的声音拆开。
一个核心问题,两种答法:
混合语音 ┬─▶ 把所有说话人都分开 → sepkit
└─▶ 只挑出目标那一个 → voxsieve
-
sepkit —— 多说话人语音分离 置换不变训练(PIT)+ 时频掩蔽 / 时域分离,含 SI-SDR / SDR / SIR / SAR 评估。
-
voxsieve —— 目标说话人提取 基于参考音注册的说话人条件化提取,从混合语音中挑出目标说话人,鲁棒于噪声与重叠。
NumPy 内核、可选 PyTorch 后端;无 GPU / 无网络也能跑核心与单测。离线优先,CI 全绿。