
依旧久等了👻
伴奏人声提取12.0研发中
8月份,我们全部精力用来在伴奏人声提取 12.0系列的研发过程中。
混响回声移除功能中的“人声-去回声”使用了我们全新研发的DangoNet6-Lite架构,它是新架构中的“轻量化”版本,而我们即将制作的伴奏人声提取新系列将使用重型且完整版本的架构。
新架构糅合了团子近一年时间各类实验的落地成果,也可以称为“集大成者”,迁移到新架构、以及更多的训练素材,使得我们的性能马上得到了巨幅提升,SDR从11代的18.41dB来到了18.83dB,从量化指标上来看,这甚至比10代到11代的相对提升还要高,而且这只是到实验的前中期,后期我们还有各类“刀枪剑戟”还没上阵,还能进一步提升很大的空间🧐
但!(但字一出来就不对味了.jpg)
SDR的提升未必就代表歌曲“实打实”提取质量提高,实际上全新架构的输出相比上一代,的确解决了部分歌曲中存在的遗留问题,但也增加了一些新的问题,且目前解决起来仍然存在很大阻力🤒这个过程中还是需要巨量的实验来达到某种我们满意的平衡性,在一切都没有完备之前,我们只能继续实验,期待下个月中我们会报告更多好消息。
全新“轻微杂音移除”模型按情况可能发布
在12.0的分支中,我们有可能会发布一款全新的“轻微杂音移除”模型。
该模型属于“伴奏人声提取”功能中的“更好人声提取”里的选项,当开启后将使用本模型从人声中移除轻微杂音。
默认的“更好人声提取”模型适合于在歌曲或嘈杂环境中提取人声,而全新的“轻微杂音移除”模型更适合在本就比较安静的录音环境下进一步移除超小的杂音。比如磕碰声音、衣服摩擦声、录音时轻微的其他杂音、甚至是耳返泄露出的超轻微的、时有时无的伴奏声音。
目前市面暂时没有类似功能,大多数的“提取人声”功能无法移除这些非常精细的声音,只能在一些大的嘈杂声音中提取人声,这因为大多数的模型和架构不够“敏感”,而全新的模型使用团子自研架构,将启动“超级敏感肌”模式👻任何不是人声的声音都不会被放过,在我们的测试中非常非常非常惊艳,该功能更适合音频后期工作者使用,用来一键将人声的各类小问题清理干净。
不过,该功能目前仍在初步研发阶段,目前和12.0系列类似,遇到了一些阻力,如果问题解决我们将伴随12.0系列一起发布该模型,如仍然无法解决该功能可能延后搁浅。
全新音频工具【频谱查看】和【自动静音】
我们在音频工具新增了这两款工具,您可以阅读这篇文章查看更多介绍。
接下来?
很遗憾,尽管我们想报告更多的好消息,但目前我们只能按10%-15%的完成度来计算进度,即便当前问题解决、后续我们还有其他实验部分仍需完成,12代是我们史无前例非常“厚重”的巨型模型,也是我们从未挑战过的工程道路,我们乐观估计也仍然需要4-6个月时间才能完成发布,还请小伙伴们耐心等候。
















