BandIt v2 多语言影视音轨分离
BandIt v2 保留「语音」「音乐」「音效」三种影视声音角色,并把 BandIt 模型家族与多语言 Divide and Remaster v3 数据集联系起来。2024 年的研究扩大了语言覆盖,并调整混合素材的构建方式。MVSEP 将这个模式链接到作者的 v2 实现,供应方默认选项为多语言模型。在 Tunenoodle 中选择模式即可,界面没有按语言选择专用模型的设置。 因此,多语言采访、带字幕场景或同一片段中切换语言的素材,都可以把它作为值得比较的选项。多语言训练是相关背景,并不保证所有口音、语言和录音环境表现相同。输出是分离后的音频,不会转写、翻译或给每个词添加标签。 检查语言转换时,应把它当作实际声音事件:听较弱音节、词尾,以及音乐进入时的讲话,再去另外两轨寻找残留词语。响亮完整的一句可能保留良好,紧接的简短回应却可能变弱。与 BandIt Plus 或 DnR v3 比较时保留同一原始片段,最终根据剪辑真正需要的讲话和场景细节选择,而不是仅依据版本号或数据集语言数量。
如何分离你的音频
- 01
选择 BandIt v2,分离原始多语言片段。
- 02
在三路音轨中检查每次说话人或语言转换。
- 03
保留可用语音;关键字不完整时,用同一原素材比较其他影视模式。
了解输出与使用方式
| 参数 / 选项 | 作用与选择依据 |
|---|---|
| 先选对音频素材 | 保留短回应、语言或说话人切换,不要只测试响亮旁白。提交原始混音即可,不需要输入语言提示词。 |
| 适合用途 | 比较同一场景切换语言前后的对白分离。 更清楚地听音乐提示下的简短回应,用于人工核对。 分离多语言采访语音,同时保留配乐和实景音效。 |
| 试听重点 | 较弱音节是否与响亮句子一样完整。 语言或说话人改变时语音是否保持连贯。 音乐进入后,音乐或音效轨里是否出现词语碎片。 |
常见问题
不需要。此模式没有按语言选择模型的界面,应用请求供应方模式时不会额外指定语言模型选项。
接下来可以做什么
全部模式群众声与对白分离
从现场录音中拆出偏向观众声音的层次,保留其他演出内容用于比较与剪辑。
对白、音乐与音效分离
使用 Demucs4HT DnR 模式,把混合配音拆成语音、音乐和音效三条音轨。
BandIt Plus 影视音轨分离
使用 BandIt Plus 拆出语音、音乐和音效,并围绕关键台词与场景事件比较结果。
DnR v3 影视音轨分离
使用 MVSEP 的 DnR v3 模式拆出语音、音乐和音效,细致比较混合影视声音。
Braam 电影重击音效分离
提取 Braam 式电影重击,单独研究低频冲击、持续音色与衰减。
上升过渡音效分离
提取 Risers 上升音效,研究蓄势形状、乐句长度,以及 Drop 或副歌的到达时机。
FX 音效分离
从混合录音中拆出偏向效果的声音层,单独检查过渡、重音与纹理,并与剩余音频比较。
