Distributions In, Distributions Out: The Case for Soft-Label Training

TL;DR

提出软标签训练方法,在ChaosNLI等数据集上降低32% KL散度,提升模型不确定性表达。

cs.LG 🟡 进阶级 2025-11-18 1 次浏览
Agamdeep Singh Ashish Tiwari Hosein Hasanbeig Priyanshu Gupta
软标签 监督学习 不确定性 自然语言处理 计算机视觉

核心发现

方法论

本研究提出了一种软标签训练方法,利用完整的注释分布作为目标,而非传统的硬标签。这种方法在ChaosNLI、POPQUORN和CIFAR-10H数据集上进行测试,采用KL散度和熵相关性作为评估指标。通过与硬标签训练进行对比,软标签训练在多个数据集上表现出更好的分布对齐和模型鲁棒性。

关键结果

  • 在ChaosNLI数据集上,软标签训练提高了准确率至55.30%,相比硬标签的51.75%,并显著降低了KL散度至0.319。
  • 在CIFAR-10H数据集上,软标签训练的模型在熵相关性上提高了40%,更好地反映了人类注释的不确定性。
  • POPQUORN数据集上,软标签训练的KL散度降低至0.361,显示出更好的分布对齐。

研究意义

该研究通过软标签训练方法有效解决了注释者分歧问题,提升了模型在不确定性表达上的能力。这对于需要处理主观性较强的任务,如自然语言推理和礼貌性分类,具有重要意义。通过更好地对齐人类不确定性,模型在实际应用中将更具可信度和鲁棒性。

技术贡献

技术贡献包括提出了一种新的训练目标,即使用完整的注释分布而非单一标签。这种方法不仅提高了模型的分布对齐能力,还在多个数据集上显示出更好的鲁棒性和准确性。此外,该方法在理论上提供了更好的不确定性表达能力。

新颖性

本研究首次系统性地将软标签训练应用于多数据集,证明了其在处理注释者分歧上的优势。与传统的硬标签方法相比,该方法在不确定性表达和分布对齐上具有显著创新。

局限性

  • 软标签训练需要多注释者数据,这在实际应用中可能较难获得。
  • 在注释者数量较少的情况下,软标签的优势可能不明显。
  • 该方法在计算资源上要求较高。

未来方向

未来研究可以探索如何在低注释者数量的情况下有效应用软标签训练。此外,研究如何将该方法应用于生成模型和其他学习任务也是一个值得探索的方向。

AI 总览摘要

在许多预测任务中,人类判断存在差异,这种差异反映了真实的模糊性。然而,传统的监督学习方法通常将多注释者的意见压缩为单一标签,忽略了这些信息。本文提出了一种软标签训练方法,利用完整的注释分布作为目标,提升了模型在不确定性表达上的能力。

该方法在ChaosNLI、POPQUORN和CIFAR-10H数据集上进行了验证,结果显示,软标签训练在多个数据集上均表现出更好的分布对齐和模型鲁棒性。具体而言,在ChaosNLI数据集上,软标签训练提高了准确率,并显著降低了KL散度。

通过更好地对齐人类不确定性,软标签训练方法在实际应用中将更具可信度和鲁棒性。这对于需要处理主观性较强的任务,如自然语言推理和礼貌性分类,具有重要意义。未来研究可以探索如何在低注释者数量的情况下有效应用软标签训练。

深度分析

研究背景

在监督学习中,模型通常通过单一标签进行训练,这些标签通常是通过多数投票从多个注释者的意见中获得。然而,在自然语言推理、礼貌性分类等任务中,注释者之间的分歧往往反映了真实的模糊性,而不是噪声。传统方法忽略了这些信息,导致模型在面对人类分歧时表现出过度自信。

核心问题

核心问题在于如何有效利用注释者之间的分歧信息,而不是将其视为噪声。传统的硬标签方法通过多数投票将注释者的意见压缩为单一标签,忽略了分歧信息,导致模型在面对模糊样本时表现出不真实的自信。

核心创新

本文的核心创新在于提出了一种软标签训练方法,利用完整的注释分布作为目标,而非单一标签。这种方法不仅提高了模型的分布对齐能力,还在多个数据集上显示出更好的鲁棒性和准确性。

方法详解

  • �� 使用完整的注释分布作为训练目标,而非单一标签。
  • �� 在ChaosNLI、POPQUORN和CIFAR-10H数据集上进行实验验证。
  • �� 采用KL散度和熵相关性作为评估指标,比较软标签和硬标签训练的效果。

实验设计

实验设计包括在ChaosNLI、POPQUORN和CIFAR-10H数据集上进行测试,使用KL散度和熵相关性作为评估指标。实验中,软标签训练与硬标签训练在相同的模型架构和超参数设置下进行对比,以确保结果的公平性。

结果分析

结果显示,软标签训练在多个数据集上均表现出更好的分布对齐和模型鲁棒性。在ChaosNLI数据集上,软标签训练提高了准确率,并显著降低了KL散度。在CIFAR-10H数据集上,软标签训练的模型在熵相关性上提高了40%。

应用场景

软标签训练方法适用于需要处理主观性较强的任务,如自然语言推理和礼貌性分类。这些任务中,注释者之间的分歧反映了真实的模糊性,软标签训练可以更好地对齐人类不确定性。

局限与展望

软标签训练需要多注释者数据,这在实际应用中可能较难获得。此外,在注释者数量较少的情况下,软标签的优势可能不明显。该方法在计算资源上要求较高,可能限制其在资源有限的环境中的应用。

通俗解读 非专业人士也能看懂

想象你在一个图书馆,许多人对一本书的分类意见不一。有人认为它是小说,有人认为是历史书。传统的方法会选择大多数人的意见,比如说是小说,然后忽略其他意见。软标签训练就像是记录下每个人的意见,告诉模型这本书可能是小说,也可能是历史书。这样,当模型遇到类似的书时,它会知道这些书可能有多种分类,而不是只相信一种。这种方法让模型在面对不确定性时更加灵活,就像图书馆员知道一本书可能属于多个类别,而不是只听从一个人的意见。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,每个人对一个谜题的答案都有不同的看法。有人说是A,有人说是B。传统的方法会选择大多数人的答案,比如A,然后忽略其他答案。软标签训练就像是记录下每个人的答案,告诉游戏这些答案都有可能。这让游戏在面对类似谜题时,更加聪明,因为它知道可能有多个正确答案。这就像你在考试中,不仅知道一个答案,还知道其他可能的答案,这样你就更有信心啦!

术语表

软标签 (Soft Label)

软标签是指使用完整的注释分布作为训练目标,而不是单一标签。

在本文中,软标签用于更好地对齐人类不确定性。

硬标签 (Hard Label)

硬标签是通过多数投票将多个注释者的意见压缩为单一标签。

传统的监督学习方法通常使用硬标签进行训练。

KL散度 (KL Divergence)

KL散度用于衡量两个概率分布之间的差异。

本文使用KL散度来评估模型预测与注释分布的对齐程度。

熵 (Entropy)

熵表示分布的不确定性程度,值越高表示不确定性越大。

本文通过熵来衡量模型预测与注释者分歧的相关性。

注释者分歧 (Annotator Disagreement)

注释者分歧指不同注释者对同一数据样本的不同标注。

本文认为注释者分歧反映了数据的真实模糊性。

开放问题 这项研究留下的未解疑问

  • 1 如何在低注释者数量的情况下有效应用软标签训练仍需探索。
  • 2 软标签训练在生成模型中的应用尚未充分研究。

应用场景

近期应用

自然语言推理

在自然语言推理任务中,软标签训练可以更好地对齐人类不确定性,提高模型的鲁棒性和可信度。

远期愿景

主观性任务的标准化

通过推广软标签训练,未来可以在更多主观性任务中实现更高的标准化和一致性。

原文摘要

Supervised classifiers output a distribution over classes but are typically trained against a single label obtained by collapsing multiple annotators into a majority vote. On tasks where annotator disagreement reflects genuine ambiguity -- natural language inference, politeness, visually ambiguous categorization -- this collapse discards information and forces models to express uniform confidence on inputs where humans systematically disagree. We compare soft-label training, which uses the full annotation distribution as the target, against hard-label training across three datasets spanning vision and NLP (ChaosNLI, POPQUORN, CIFAR-10H). Soft-label training matches or exceeds hard-label accuracy on every dataset, reduces KL divergence to the annotator distribution by 32% on average (p < 10^-4), and produces predictions whose per-sample entropy correlates 61% more strongly with annotator entropy -- models trained on distributions are uncertain precisely where humans are. We argue these benefits follow from a basic observation: when annotators legitimately disagree, the annotation distribution is the correct learning target, not a noisy estimate of it.

cs.LG cs.AI