TUNENOODLE / 音轨分离 / 音效与对白

DnR v3 影视音轨分离

使用 MVSEP 的 DnR v3 模式拆出语音、音乐和音效,细致比较混合影视声音。

DnR v3 影视音轨分离

DnR v3 既是一个多语言电影音频数据集的名称,也是此处 MVSEP 分离选项的名称。相关研究重新审视语言覆盖、非对白轨中的人声内容,以及影视混音的电平构建。MVSEP 说明其 DnR v3 模型在这一数据集上训练,提供 SCNet 与 MelBand Roformer 等架构变体。它与 BandIt v2 是不同模型选项,虽然都关联 DnR v3 研究背景,也都返回「语音」「音乐」「音效」。 当剪辑目的不只是让人声干净时,可以尝试这个模式:例如让对话下方的配乐保持连续,或者保留一句响亮台词下面的重要场景音效。先确定最关键的事件,再比较三路输出如何保留它。数据集名称和公开测试结果,都不能预先决定每一段真实影视素材的表现。 特别留意介于几类角色之间的声音,例如歌唱、有明确音高的警报或带节奏的机械声。应听它实际落在哪一轨,而不是只按名称推断。此模式不会逐一拆分歌手、说话人或每个音效。保留原片段作为参照,最终选择能维持场景含义、时间关系和氛围的音轨。若某个关键层不完整,再以同一片段比较另一模式,会比抽象判断谁的版本更新更有用。

如何分离你的音频

  1. 01

    选择 DnR v3,提交原始影视片段。

  2. 02

    确定关键事件,并在三条输出中检查其完整时长。

  3. 03

    若某层保留仍不满足剪辑需要,用同一片段比较其他模式。

了解输出与使用方式
了解输出与使用方式
参数 / 选项作用与选择依据
先选对音频素材选择需要的音效与讲话、音乐重叠的场景,同时保留前后安静部分,以检查环境声,而不只听最响的瞬间。
适合用途在分析片段中降低对白,同时保持配乐动机连续。 检查讲话下方的警报、冲击或环境声是否仍在。 用同一场景比较另一种 DnR 训练模型与 BandIt v2。
试听重点有音高的音效是否仍可辨认,不论落在哪条轨。 对白下方的配乐是否连续,是否夹有词语碎片。 关键事件前后,语音与空间氛围是否自然。

常见问题

不是,两者是不同选项。它们都与 DnR v3 研究数据有关,但 MVSEP 为自己的 DnR v3 产品记录了不同模型架构。

接下来可以做什么

全部模式

按用量消耗积分

发送反馈

告诉我们哪里出了问题,或你希望有什么功能。每条消息我们都会看。

类型

来自页面 /zh/features/stem-splitter/dnr-v3