Towards Robust Version Identification in the Wild: A Dataset, Benchmark, and Fine-Tuning Study

TL;DR

提出DiVers数据集,涵盖超110万音乐版本,增强在真实环境中的鲁棒性,显著提升音乐版本识别系统性能。

cs.SD 🔴 高级 2026-08-05 111 次浏览
Simon Hachmeier R. Oguz Araz Dmitry Bogdanov Robert Jäschke Xavier Serra
音乐信息检索 版本识别 深度学习 数据集构建 噪声鲁棒性

核心发现

方法论

本文基于深度学习的音乐版本识别(VI)系统,结合大规模多样化数据集DiVers,采用常用的CQT(常数Q变换)作为输入特征,利用Triplet Loss和Fine-tuning策略提升模型鲁棒性。数据集整合了官方版本(DVI)和在野版本(YVI),引入自动标签和段级音乐检测。模型训练包括从零训练和微调两种方式,使用Adam优化器和SpecAugment数据增强。通过多层次的评估指标(MAP、NAR)验证模型在不同数据域的性能,特别关注噪声和非专业内容的影响。

关键结果

  • 在DiVers数据集上训练的模型在噪声环境中表现出显著提升,MAP提升约5-8个百分点,NAR降低约1-3个单位,相较于仅在官方数据集上训练的模型,鲁棒性增强明显。
  • 微调后的CLEWS模型在YVI和SHS100K等多样化数据集上均取得优异成绩,MAP最高达0.708,NAR最低至9.61,显示出在野版本和非专业内容中的识别能力显著改善。
  • 扩展训练数据(DiVers-L)相较于DVI训练,整体性能提升明显,尤其在版本多样性和噪声环境中表现优越,验证了大规模多样化数据的重要性。

研究意义

本研究突破了传统音乐版本识别在真实环境中的局限,提出了规模最大、内容多样、标签丰富的DiVers数据集,有效缓解模型在非专业、噪声环境下的性能下降问题。这对于音乐推荐、版权监测、现场演出识别等应用具有深远意义,推动音乐信息检索技术向实际场景的落地。通过引入自动标签和段级检测,增强了模型对复杂环境的适应能力,为未来多模态、多任务的音乐分析提供了基础。

技术贡献

本文的核心技术创新在于:1)构建超大规模、多样化的音乐版本数据集DiVers,结合官方和非官方内容,丰富了训练样本的生态;2)引入自动标签体系和段级音乐检测,提升模型对内容属性的理解;3)采用Triplet Loss和Fine-tuning策略,显著增强模型在噪声和非专业内容中的鲁棒性;4)系统性评估不同训练策略和数据规模对模型性能的影响,为未来模型设计提供指导。

新颖性

这是首个结合官方与非官方、在野内容的超大规模音乐版本数据集,突破了以往依赖官方、干净数据集的局限。通过自动标签和段级检测,赋予模型更丰富的内容理解能力。相较于传统的基于手工特征或小规模数据的研究,本文在数据规模和多样性上实现质的飞跃,显著提升模型在真实环境中的适应性和鲁棒性。

局限性

  • 尽管DiVers规模庞大且多样,但自动标签存在一定误差,可能影响模型训练的精度和泛化能力,尤其在标签模糊或多义的情况下。
  • 模型训练和微调过程计算资源消耗较大,尤其是在大规模数据集上,限制了部分研究机构的复现和应用。
  • 在极端噪声或非音乐内容极度丰富的场景下,模型仍存在识别失误的风险,未来需进一步优化模型结构和特征表达。

未来方向

未来可结合多模态信息(如视频内容、歌词文本)进一步提升识别鲁棒性,探索无监督或半监督学习策略以减少标注依赖。此外,优化模型结构以降低计算成本,增强在边缘设备上的部署能力,也是重要方向。同时,扩展到跨文化、多语言环境的版本识别,将推动全球音乐内容的智能管理。

AI 总览摘要

音乐版本识别(VI)作为音乐信息检索中的关键任务,旨在自动识别不同演绎版本的音乐作品。传统方法多依赖手工特征或小规模、干净的官方数据集,难以应对现实中丰富多样的内容环境。随着网络平台如YouTube的普及,用户生成内容(UGC)占据主导,版本多样性、噪声干扰和非专业内容成为主要挑战。为此,本文提出了DiVers数据集,结合官方版本(DVI)和在野版本(YVI),涵盖超110万条音乐版本,显著扩大了训练样本规模和内容多样性。数据集引入自动标签和段级音乐检测,增强模型对内容属性的理解能力。模型采用深度卷积网络,结合Triplet Loss进行训练,并通过Fine-tuning策略提升在噪声环境中的鲁棒性。实验结果显示,基于DiVers训练的模型在多个数据集上表现优异,MAP提升5-8个百分点,NAR降低1-3个单位,验证了大规模多样化数据在提升鲁棒性方面的有效性。特别是在非专业、噪声丰富的场景中,模型表现出更强的适应能力,为音乐推荐、版权监测等实际应用提供了坚实基础。本文的贡献不仅在于数据集的规模和内容丰富性,更在于系统性地验证了多样化训练数据对模型性能的提升,为未来音乐内容分析提供了新的研究方向。未来工作将结合多模态信息,优化模型结构,降低计算成本,推动音乐识别技术在实际场景中的广泛应用。

深度分析

研究背景

音乐内容的数字化和网络传播极大丰富了音乐资源,但也带来了版本多样性和内容复杂性的问题。早期研究多依赖手工特征(如MFCC、Chroma)进行音乐相似性匹配,效果有限。近年来,深度学习方法,尤其基于卷积神经网络(CNN)和变换器(Transformer),在音乐版本识别中展现出优越性能。代表性工作如DVI(Discogs-VI)和SHS100K,虽在一定程度上解决了规模和自动化问题,但仍受限于数据的专业性和干净性,难以应对实际环境中的噪声和非专业内容。随着UGC的崛起,版本识别面临更复杂的场景,包括非官方版本、现场演出、反应视频等,要求模型具备更强的鲁棒性和泛化能力。传统数据集无法满足这些需求,亟需构建更大规模、多样化的训练数据集,推动模型在真实环境中的应用。

核心问题

核心问题在于如何在真实场景中实现鲁棒的音乐版本识别。现有系统多在干净、官方的环境下训练,面对噪声、非专业演绎、环境干扰时性能大幅下降。尤其是在UGC平台,版本多样、内容复杂、标签不一致,导致模型难以泛化。此外,缺乏规模庞大、内容丰富、标签多样的公开数据集,限制了模型的训练和评估。如何结合官方和非官方内容,自动生成标签,提升模型对多样环境的适应性,成为亟待解决的问题。

核心创新

本文的主要创新点包括:1)构建超大规模、多样化的音乐版本数据集DiVers,融合官方(DVI)和在野(YVI)内容,覆盖多种内容属性和噪声环境;2)引入自动标签体系,结合多源音乐标签(如风格、乐器、现场等)和段级音乐检测,丰富内容描述;3)采用Triplet Loss训练深度模型,增强版本间的区分能力,同时通过Fine-tuning提升在噪声环境中的鲁棒性;4)系统性评估不同数据规模和训练策略对模型性能的影响,验证大规模多样化数据的有效性。这些创新共同推动音乐版本识别技术向实际应用迈进。

方法详解

  • �� 数据集构建:结合DVI和YVI,筛选符合条件的版本,采用模糊匹配和声纹去重,确保数据质量和多样性。
  • �� 特征提取:使用常数Q变换(CQT)作为输入特征,采样窗口为20毫秒,覆盖7个八度,归一化后输入深度模型。
  • �� 标签和段检测:自动生成标签(如cover、live、karaoke)并利用PANN模型进行段级音乐/非音乐预测,增强内容理解。
  • �� 模型训练:采用深度卷积网络(如改进的DVINetX),使用Triplet Loss进行端到端训练,结合SpecAugment等数据增强技术。
  • �� 微调策略:在预训练模型基础上,利用在野版本数据进行Fine-tuning,提升噪声环境下的识别能力。
  • �� 评估指标:采用平均精度(MAP)和归一化平均排名(NAR),在多个数据集和不同环境中进行性能验证。

实验设计

采用多源数据集(DVI、SHS100K、YVI)进行模型训练和微调,设置不同的训练策略(从零训练、微调)以比较效果。模型输入为2.5分钟随机片段,利用CQT特征,结合数据增强技术。评估指标包括MAP和NAR,覆盖官方、在野、混合场景。通过不同标签类别和非音乐比例的分层实验,验证模型在噪声和非专业内容中的鲁棒性。还进行了embedding空间的可视化和变化分析,理解微调对模型特征的影响。所有实验均在NVIDIA H100 GPU上完成,确保结果的可复现性。

结果分析

实验结果显示,基于DiVers训练的模型在噪声环境中的表现优于传统模型,MAP提升5-8%,NAR降低1-3单位。在YVI和SHS100K等多样化数据集上,微调模型表现出更强的鲁棒性,MAP最高达0.708,NAR最低至9.61。扩展训练数据(DiVers-L)带来明显性能提升,验证了大规模多样化数据的重要性。在不同的内容属性和噪声水平下,模型表现出一致的改进,特别是在非专业、现场演出和反应视频场景中,识别准确率显著提高。这些结果证明了数据多样性和自动标签的有效性,为实际应用提供了坚实基础。

应用场景

该技术可广泛应用于音乐版权监测、内容推荐、现场演出识别、音乐库管理等场景。系统可以在噪声环境中准确识别不同版本,帮助平台自动检测侵权内容,提升用户体验。同时,结合自动标签和段级检测,可实现内容属性的智能分析,为音乐产业的数字化转型提供技术支撑。未来,模型还可结合多模态信息(如视频、歌词)实现更全面的内容理解,推动音乐内容的智能管理和个性化推荐。

局限与展望

尽管数据集规模庞大,但自动标签存在误差,影响模型训练效果。模型训练过程计算成本高,限制了部分研究者的复现能力。在极端噪声或内容复杂的场景下,识别仍存在一定误差。未来需优化标签质量和模型结构,降低计算成本,增强模型在极端环境下的鲁棒性。此外,跨文化、多语言环境的适应性仍需验证,未来工作应关注多模态融合和无监督学习策略。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂里工作,工厂里有许多不同的机器在生产不同的产品。有时候,工厂会收到来自不同供应商的零件,这些零件虽然都是为同一种产品设计,但每个供应商的版本都略有不同。有些零件是由专业工厂生产,质量稳定;有些则是由业余工匠手工制作,可能有瑕疵或不同的细节。工厂的任务是要识别出这些零件是否属于同一款产品,无论它们来自哪个供应商,或者是否有些瑕疵。传统的方法就像用肉眼观察零件,逐个比对,但效率低、容易出错。现在,工厂引入了智能检测系统,利用先进的算法分析零件的特征,比如形状、颜色、材质等,自动判断它们是否属于同一款产品。这个系统还可以学习不同版本的特征,逐渐变得更聪明,能在嘈杂的环境中也能准确识别。通过这个例子,我们可以理解音乐版本识别的挑战:在海量、多样的内容中,如何用机器快速、准确地判断两个音乐片段是否是同一作品的不同演绎?这项技术的核心在于:用大量多样的“零件”数据训练模型,让它学会区分不同版本的“特征”,即使在噪声和非专业内容中也能保持高准确率。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆里,有很多不同版本的同一本书。有的版本是正式出版的,有的可能是学生自己复印的,有的还可能是用不同的语言写的。你的任务是要找到所有属于同一本书的不同版本。以前,人们可能会用肉眼逐页比对,但这样既慢又容易出错。现在,科学家们开发了一种聪明的“识别系统”,它可以通过分析每个版本的内容特征,比如文字排版、封面图片、书的大小,自动判断这些版本是否是同一本书。这就像你用手机拍照,然后让手机识别出这是不是你要找的那本书一样。这个系统还可以学习不同版本的共同点和差异,变得越来越聪明。它还能在嘈杂的环境中,比如有人在旁边说话或者背景噪音很大时,依然能准确识别出书的版本。这个技术的意义在于:如果你想整理一个庞大的音乐库,找到所有不同版本的同一首歌,就可以用它来帮忙。它就像一个超级聪明的图书管理员,能在海量内容中快速找到你想要的那一份。未来,这个系统还可以结合视频、歌词等信息,让音乐识别变得更全面、更智能。

原文摘要

Existing datasets for musical version identification (VI) are primarily derived from curated metadata sources such as SecondHandSongs and Discogs, and are therefore dominated by professionally recorded tracks. This leads to a domain mismatch with real-world scenarios, where amateur and user-generated content is prevalent. To address this limitation, we introduce DiVers, a large-scale VI dataset comprising over 1.1 million musical versions, with train-validation-test splits compatible with established datasets such as Discogs-VI-YT, SHS100K, and Da-TACOS. In addition to standard version-level annotations, DiVers provides automatically assigned tags (e.g., instrumental, live) and segment-level predictions indicating the presence or absence of music. We evaluate the proposed dataset by training state-of-the-art VI systems. Our results show that models trained on DiVers achieve substantially improved robustness to acoustically diverse and noisy inputs, while maintaining a stable performance on cleaner, studio-quality benchmarks. We release the dataset metadata, code for its construction, and all experimental pipelines to support reproducibility.

cs.SD cs.IR

参考文献 (20)

Learning a Representation for Cover Song Identification Using Convolutional Neural Network

Zhesong Yu, Xiaoshuo Xu, Xiaoou Chen 等

2019 37 引用 ⭐ 高影响力 查看解读 →

Discogs-VI: A Musical Version Identification Dataset Based on Public Editorial Metadata

R. O. Araz, Xavier Serra, D. Bogdanov

2024 8 引用 ⭐ 高影响力 查看解读 →

On the Robustness of Cover Version Identification Models: A Study Using Cover Versions from YouTube

Simon Hachmeier, Robert Jäschke

2025 2 引用 ⭐ 高影响力 查看解读 →

Supervised contrastive learning from weakly-labeled audio segments for musical version matching

Joan Serrà, R. O. Araz, Dmitry Bogdanov 等

2025 13 引用 ⭐ 高影响力 查看解读 →

A Benchmark and Robustness Study of In-Context-Learning with Large Language Models in Music Entity Detection

Simon Hachmeier, Robert Jäschke

2024 5 引用 查看解读 →

Evaluation of Deep Audio Representations for Semantic Sound Similarity

R. O. Araz, Dmitry Bogdanov, Pablo Alonso-Jiménez 等

2024 6 引用

Leveraging User-Generated Metadata of Online Videos for Cover Song Identification

Simon Hachmeier, Robert Jäschke

2024 1 引用 查看解读 →

Bytecover3: Accurate Cover Song Identification On Short Queries

Xingjian Du, Zijie Wang, Xia Liang 等

2023 18 引用 查看解读 →

Popular music reaction videos: Reactivity, creator labor, and the performance of listening online

Byrd Mcdaniel

2020 21 引用

How Robust are Audio Embeddings for Polyphonic Sound Event Tagging?

J. Abeßer, S. Grollmisch, Meinard Müller

2023 9 引用

SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition

Daniel S. Park, William Chan, Yu Zhang 等

2019 4158 引用 查看解读 →

Accurate and Scalable Version Identification Using Musically-Motivated Embeddings

Furkan Yesiler, J. Serrà, Emilia G'omez

2019 35 引用 查看解读 →

Leveraging Whisper Embeddings for Audio-based Lyrics Matching

Eleonora Mancini, Joan Serrà, Paolo Torroni 等

2025 2 引用 查看解读 →

Evaluation of Algorithms Using Games: The Case of Music Tagging

Edith Law, Kris West, Michael I. Mandel 等

2009 329 引用

A Prototypical Triplet Loss for Cover Detection

G. Doras, Geoffroy Peeters

2019 19 引用 查看解读 →

Identifying `Cover Songs' with Chroma Features and Dynamic Programming Beat Tracking

D. Ellis, Graham E. Poliner

2007 417 引用

Da-TACOS: A Dataset for Cover Song Identification and Understanding

Furkan Yesiler, C. Tralie, A. Correya 等

2019 34 引用

OpenAI GPT-5 System Card

Aaditya K. Singh, A. Fry, Adam Perelman 等

2025 725 引用 查看解读 →

PANNs: Large-Scale Pretrained Audio Neural Networks for Audio Pattern Recognition

Qiuqiang Kong, Yin Cao, Turab Iqbal 等

2019 1596 引用 查看解读 →

And what if two musical versions don't share melody, harmony, rhythm, or lyrics ?

M. Abrassart, G. Doras

2022 7 引用 查看解读 →