

近年来,大规模数据集对深度学习模型的发展起到了关键作用。然而,在这样的大型数据集上进行训练往往需要大量的存储和计算开销。同时,实际世界中的数据往往包含冗余和噪声数据,这会对训练效率和模型性能产生负面影响。 数据选择在确定整个数据集中最具代表性的样本方面显示出前景,这旨在通过减少训练成本来最小化性能差距。 现有研究通常依赖单一模态信息为单个样本分配重要性分数,这可能导致不准确的评估,尤其是在处理噪声或损坏的样本时。为了克服这一局限性,作者提出了一种新颖的CLIP驱动的数据选择框架,该框架利用多模态信息进行更强大和泛化的样本选择。 具体来说,作者的框架包括三个关键模块:数据集调整、样本评分和选择优化,共同利用大量预训练的多模态知识全面评估样本影响并通过多目标优化优化选择结果。 大量实验表明,作者的方法在各种基准数据集上始终优于现有最先进的 Baseline 。 值得注意的是,作者的方法有效地去除了数据集中的噪声或损坏样本,使其在更少的数据下实现更高的性能。 这不仅是一种加速训练的方法,还可以提高整体数据质量。该实现将在不久的将来公开发布。
深度学习技术的最新进展通常依赖于越来越大、越来越复杂的模型,这些模型利用庞大的数据集实现最先进的表现。刘等人; Touvron等人。然而,这种成功通常伴随着数据存储和计算资源的巨大成本,这可能甚至限制模型在专业基础设施上的部署,并阻碍它们在不同应用场景中的可扩展性。此外,实际数据集通常包含冗余和噪声,这可能降低训练效率和性能。
为缓解数据冗余问题并提高训练效率,通常有两种方法,即动态剪枝和数据选择。动态剪枝方法Raju等人; Qin等人旨在通过在训练过程中动态地从数据集中选择最具影响力的样本来降低训练成本。尽管它们在加速训练方面有效,但它们仍然面临大规模数据存储的成本,并且所选样本通常在不同的训练过程和架构下表现出较差的泛化能力。相比之下,数据选择方法Paul等人(2021年); Yang等人(2023年); Tan等人; Xia等人在训练开始之前预选固定的一组必要数据点,使模型达到与全数据集获得的性能相当。通过关注最重要的数据点,这些方法确保在各种训练场景下具有更好的泛化能力。
现有的数据选择方法通常通过三个视角采用精心设计的标准:重要性评分 Paul等人(2021);Tan等人(2024);Zheng等人(2023);Xia等人(2023);以及优化函数 Killamsetty等人(2021b);Yang等人(2023b)。虽然这些方法取得了有前景的结果,但它们也存在一些局限性。
一方面,仅依赖单一模态图像信息可能导致歧义,特别是在存在噪声样本的情况下,这可能导致对样本效果的错误评估。例如,一些方法使用基于难度的标准来选择数据;但是,仅根据图像模态来区分真正困难的样本和噪声样本是一项巨大的挑战。另一方面,现有的方法通常选择得分最高或最低的样本,而同一组内高得分和低得分样本之间的交互作用可以显著影响整体性能,这被称为“组效应” Koh等人(2019);Yang等人(2023b)。因此,更有利的做法是利用多模态信息的力量,并评估样本组的整体效应。
在本文中,作者提出了一种基于CLIP的选数据框架,该框架使用多模态信息进行更强大和通用的数据选择,其中类别文本作为图像模态的强大补充,提高了整体性能。该框架包括三个模块,即数据集适应模块、采样评分模块和选择优化模块。首先,数据集适应模块将图像和文本 Adapter 集成在一起,以促进预训练知识的迁移到目标数据。然后,采样评分模块根据适应的多模态特征计算语义对齐分数(SAS)和样本多样性分数(SDS),这些分数衡量了图像-文本对齐和局部模式的变异性。使用这两个分数结合可以选择语义代表性的样本,同时保持它们的固有多样性。进一步,为了处理群体效应,作者引入了一个选择优化模块,通过多目标优化策略识别与预期选择比例相匹配的理想子集。通过利用多模态信息并精心设计的监督信号,作者的框架可以以灵活和高效的方式选择高质量样本。
全面评估各种基准数据集表明,作者的方法有效地提高了所选数据集的性能,尤其是在大规模数据集如ImageNet-1k(Deng et al., 2009)上。此外,所选数据集在ResNet-18/50(He et al., 2016)、ViT(Dosovitskiy et al., 2020)、VGG-16(Simonyan & Zisserman, 2014)等跨架构泛化方面表现出优越性。值得注意的是,由于大多数现有方法对更复杂和现实场景的鲁棒性不强,作者在这些更具挑战性的场景下进一步展示了作者方法的强大鲁棒性。例如,与最先进的 Baseline 相比,作者的方法在CIFAR-100上的准确率提高了8.13%,在Tiny-ImageNet上的准确率提高了4.41%。
同时,与其他 Baseline 相比,实现了非常高的效率。
本工作的贡献可以总结如下:
在静态数据选择之后,作者提出一种能够在各种选择比例下识别出代表性和多样性的样本的方法。数据选择,或者静态数据集剪枝,旨在从训练数据集中识别并选择最具有代表性的样本。在这些选择的样本上进行训练,可以实现与全数据集相当的性能,同时降低训练和存储成本。当前的数据选择方法可以大致分为三类:重要性标准 Paul等人(2021年);Tan等人(2024年);基于数据集分布的方法 Xia等人(2023年);Zheng等人(2023年);以及基于优化方法 Nohyun等人(2023年);Yang等人(2023年)。
基于重要性标准的选择是最受欢迎的方法。这些方法通常涉及为每个样本计算重要性分数,并根据这些分数选择样本。例如,EL2N和GraNd得分分别通过计算范数误差向量的期望和梯度范数的期望来衡量重要性。MoSo Tan等人(2024)通过从训练集中移除特定样本来计算最优经验风险的变化。遗忘Toneva等人(2018)跟踪在训练期间正确分类后样本的分类错误频率。类似地,Memorization Feldman & Zhang(2020)评估样本的存在或不存在对模型正确预测其能力的影响。虽然基于重要性标准的算法通常具有较高的计算效率,但它们的表现可能会受到Yang等人(2023)中的群体效应的影响,并且可能不能很好地泛化到复杂的实际场景中,如Xia等人(2023)。
基于数据集分布的方法选择样本,通过分析数据集的几何分布来实现。例如,Hewelling和Welling(2009)根据样本到对应类中心点的距离来确定样本的重要性。Ramalingam等人(2023)应用贪心k中心选择具有良好数据覆盖的核心集。Maharana等人(2023)通过将相邻示例的难度纳入,计算并更新每个样本的难度分数。Moderate-DS Xia等人(2023)选择距离中位数更近的样本,而CCS Zheng等人(2023)在选择时平衡数据分布和样本重要性。
基于优化的方法已经被提出,通过各种优化技术选择样本,例如梯度匹配(Tan等人,2024年),可扩展的自监督剪枝度量(Sorscher等人,2022年),影响函数(Yang等人,2023年);Pooladzandi等人的双级优化(2022年),设施位置函数(Mirzasoleiman等人,2020年);Yang等人(2023年);Kothawade等人的子模块性(2022年);Wei等人的(2015年)。与这些仅依赖图像信息的方法相比,作者利用多模态信息进行数据选择,这整合了图像数据与相应类别信息的语义对齐。这有助于在复杂场景中进行全面评估的样本有效性,尤其是在样本可能被损坏或错误 Token 的情况下。
作者的提出的方法可以概括在图2中。该方法涉及利用预训练的视觉语言基础模型CLIP构建多模态特征空间。然而,在预训练训练数据集和目标数据集之间可能存在域漂移或差异。为了促进数据集适应和增强特定数据集的知识学习,作者在两种模态中都引入了维度保持 Adapter 。
然后,作者推导出两个分数来全面评估样本重要性,即语义对齐分数(SAS),记作,和样本多样性分数(SDS),记作。此外,而不是仅基于样本分数进行选择,作者设计了一个多目标优化来确定针对预期选择比例的最优子集,这有效地减轻了组效应。作者将在随后的部分中提供详细的方法。

为了减轻预训练模型和目标数据集之间的域转移和差异,作者引入了保持维度不变的 Adapter ,在目标数据集上进行适应。图像 Adapter 记作,文本 Adapter 记作。这两个 Adapter 都是为了知识迁移而进行微调,而预训练的CLIP权重则被冻结。为了保持高效性,这两个 Adapter 都使用了简单的MLP。
具体来说,微调过程采用了InfoNCE损失Parulekar等人(2023);Oord等人(2018),它最大化了图像和文本表示之间的互信息。文本表示通过 Prompt :"一张[CLS]的照片",其中[CLS]表示相应的类别。损失确保 Adapter 有效地对齐并捕获两种模态的相关特征。此外,它增强了模型区分正负对的能力,从而提高了特定数据集的深度表示的鲁棒性和准确性。
对于分类数据集,训练样本的学习过程与获取相应类别知识是内在相关的。一个更准确地代表其类别的训练样本通常在训练深度网络时更有效。
因此,语义对齐分数(SAS)被设计为评估训练样本与其对应类别之间的语义相似性。具体来说,由于图像和文本特征都位于相同的嵌入空间(Radford等人,2021年),SAS通过计算嵌入图像与相应文本深度描述之间的余弦相似性来推导。因此,第i个样本的SAS定义为:

表示第i个样本,表示对应于的类别描述,和分别表示预训练的图像编码器和文本编码器。
对于选定的数据集,数据量减少可能会限制所选数据的多样性,这对于杨等人在2024年训练数据集来说非常重要。为了应对这个问题,作者引入了另一个多样性视角来全面评估训练数据的效用。
样本多样性分数(SDS)定义为每个样本与同一类别中其k个最近邻居样本之间的平均距离:

作者使用KNN算法为每个样本获取邻居样本,距离度量基于范数,通常将设置为每个类别样本数量的一定百分比(例如10%)。这样,SDS可以理解为特征空间中训练样本的局部密度。如果一个样本有较多邻居样本且距离较近(即SDS较低),其训练效果可能更容易被其他邻居样本替代。因此,选择SDS较高的样本通常更有利。
图3展示了SAS和SDS的效果。SDS有助于样本的多样性,但选定的数据点可能包含噪声(图3(b))。另一方面,SAS可以选择语义合适的样本,因为这些点基本上围绕样本中心(图3(c))。
然而,这些样本可能过于集中,因此缺乏多样性。当使用SDS和SAS together(图3(d))时,作者可以用较少的样本覆盖整个类别空间,并选择既具有代表性又具有多样性的样本,从而提高数据选择的有效性。

取而代之,Killamsetty等人(2021b)在依赖组合优化函数进行样本选择的基础上,作者的方法通过SGD多目标优化来确定选择,从而提高了计算效率并加速了收敛。具体而言,作者引入了一个样本级的参数来表示选择决策,其中1表示选择,0表示不选择。尽管由于在神经网络中缺乏梯度,二进制参数难以优化,但作者使用函数将的连续值推向近似二进制。优化后,被严格二进制化,以明确表示最终的样本选择。初始时,被初始化为全1。
为了指导优化过程,作者引入了三个损失项。第一个损失项,,旨在优先考虑具有高SAS(样本与类别相关性)的样本,因为这些样本更能代表其对应的类别,定义如下:

其中 是总样本数。 惩罚低 SAS 的样本,并鼓励选择语义对齐更好的样本。
此外,作者引入了另一个损失项,以鼓励选择具有更高SDS(样本多样性熵)的更多样化的样本。SDS的定义如下:

为了减轻群体效应,作者针对特定的选择比例优化选定的数据集,以识别最优子集。作者引入了一个选择损失项,,以确保选择过程符合目标比例。然而,从连续实值参数优化中精确推导选择率是困难的。
虽然严格二进制值便于显式样本选择,但它们通过梯度反向传播进行优化具有挑战性。为了解决这个问题,作者利用Bengio等人(2013年)的直线估计器(STE)来估计实际选择率并推导梯度。
STE允许梯度在反向传播过程中通过离散决策,有效地结合了连续参数和二进制参数的优势,从而实现高效优化和准确样本选择。这样,被定义为:

其中是指示函数,表示预期选择比例。损失项指导参数接近二进制值,确保1的数量与预期样本量一致。由于选择是由自适应优化引导的,最终选择比例可能会略微偏离目标值。为了最小化这种偏差,作者用一个阈值约束,在作者的工作中,该阈值设置为,确保实际选择比例与预期值之间的差异小于。最后,整体损失函数被形式化为:
其中, 和 是调整损失项之间数值差异的系数,可以方便地设置。
复杂性分析 所提出的算法包含三个主要部分。
1) 数据集适应性涉及微调图像和文本 Adapter 。由于 Adapter 由简单的线性层组成,参数数量较小,前向和反向传播在计算上都是高效的。
2) 在样本评分过程中,计算SAS和SDS的复杂性分别为和,其中为类别数,为特征维度,通常为512。KNN算法的复杂性为,其中为每个类别的样本数。由于和为常数,通常远小于,因此整个过程的复杂性约为。
3) 的选择优化不涉及深度模型,而是一个数值优化过程。其复杂性与参数数量成正比,即。
数据集和网络架构 与Tan等人、Xia等人和Zheng等人(2023年)的工作一致,作者在各种常用的基准数据集上评估了作者提出的方法的 effectiveness,这些数据集包括CIFAR-10/100、Tiny-ImageNet(Chrabaszcz等人,2017年)和ImageNet-1k(Deng等人,2009年)。为了评估作者选定数据集的泛化性能,作者在各种网络架构上研究了作者提出的方法的 effectiveness,包括ResNet-18/50(He等人,2016年)、Vision Transformer(ViT)Dosovitskiy等人(2020年)、Swin-Transformer、VGG-16和DenseNet-121(Huang等人,2017年)。
Baseline . 作者将所提出的方法与十种最具有代表性的状态of the art (SOTA) Baseline 进行比较,即(1)随机,(2) Moso Tan等人(2024年),(3) Glister Killamsetty等人(2021年),(4) Herding Welling(2009年),(5) Forgetting Toneva等人(2018年),(6) GraNd以及(7)EL2N Paul等人(2021年),(8) 自适应-选择(SSP) Sorscher等人(2022年),(9) CG-Score Nohyun等人(2023年),以及(10)适中-DS Xia等人(2023年)。
参数设置。作者提出的方法的参数可以轻松设置。系数α与预期选择率成正比,平衡数据集的多样性重要性。
例如,α可以设置为。系数β在其他所有数据集中设置为2,以调整损失项目的数值差异。
一致性与先前的研究一致,作者报告了在CIFAR-100和Tiny-ImageNet上的Top-1准确性,以及在ImageNet-1k上的Top-5准确性。请注意,由于计算成本高昂,方法Glister和CG-Score在ImageNet-1k上的比较被排除在外。具体来说,Glister解决了Killamsetty等人(2021年)提出的双级优化问题的迭代求解,而CG-Score则需要计算大Gram矩阵的逆,这在大规模数据集中是不切实际的。
如图4所示,作者的方法在所有数据集上都能始终实现最佳准确性。尤其是在更具挑战性的Tiny-ImageNet和ImageNet-1k数据集上,作者的方法相比其他方法取得了显著的优势。
尽管现有方法在小型CIFAR-100数据集上的准确性提高相对有限,但作者的方法带来的收益更为显著。此外,这些数据集的选取比例相对较高,如90%,作者的选定数据集表现出几乎无损失或甚至高于原始完整数据集和其他 Baseline 的性能。结果表明,作者的方法不仅可以降低训练成本,还可能成为数据清洗的一种方式。

在本节中,作者评估了在选择过程中使用的不同架构上的作者的数据集的泛化有效性。具体来说,作者在Tiny-ImageNet的选定数据集上使用VGG-16和DenseNet-121模型进行训练。
如表1所示,结果表明作者的方法在两种架构上都超过了所有 Baseline 方法,证明了其理想的架构泛化能力。这表明选定的数据集具有广泛的适用性,无论具体网络架构如何。

为了评估各种方法的筛选效率,作者提出了关于有效性和效率之间平衡的分析。如图6所示,作者的方法在最佳性能和理想效率上表现出最优秀的表现。聚类、EL2N和GraNd因为依赖于预定义的指标或在训练的早期阶段选择样本,所以获得了最低的筛选成本。
尽管作者的方法稍微慢一些,但准确率更高。与基于优化的方法,如MoSo和Glister相比,作者的方法在降低成本和提高性能方面都具有优势。这些结果证实了作者的方法在平衡筛选效率和准确性的有效性。

鲁棒性在噪声标签下
现实世界的数据集通常包含标签噪声,其中一些样本标签被错误地翻转,导致数据被误标。不幸的是,创建干净和多样化的数据集需要时间和金钱。因此,有必要在这样复杂的场景下评估选择方法的性能。在本研究中,作者引入了李等人在2022年提出的对称噪声,在C-100和T-ImageNet数据集上生成被误标的样本,噪声率为20%。
如图2所示,作者的方法在噪声标签下表现出卓越的鲁棒性,明显优于其他 Baseline ,优势显著。具体而言,作者的方法在CIFAR-100上的改进超过10.12%,在Tiny-ImageNet上的改进超过4.41%,相较于之前领先的方法有显著提升。此外,表3显示了所选数据集内的噪声数据分布,其中作者的方法只选择了0.24%的噪声样本,远少于其他 Baseline 。这种噪声减少充分说明了作者的方法在提高整体数据质量方面的潜力。

作者认为,作者方法的可鲁棒性可归因于公式1中的,该变量评估了图像内容和其标签之间的语义对齐。在存在标签噪声的情况下,这种对齐被破坏,导致SAS降低,从而降低了这些样本在优化过程中被选择的概率。
相比之下,大多数基准方法仅依赖于图像特征进行选择,这可能导致在面对噪声标签时性能下降。在某些情况下,这些方法的表现甚至比随机选择还要糟糕。尽管Moderate也选择了一定比例的噪声数据,但它的表现仍然不如作者。这种差异突显了在噪声环境中,作者方法更具战略性地选择的优势,从而不仅最小化了噪声,还优化了选择的数据集以提高泛化能力。
抗干扰图像的鲁棒性 作者进一步评估了所提出方法在实际生活中经常遇到的噪声干扰上的性能。为了模拟这种干扰,作者采用了以下五种真实的噪声Xia等。 (2023),包括高斯噪声,随机遮挡,分辨率,雾和运动模糊。干扰率分别设置为5%,10%和20%。
如图5所示,与先前的 Baseline 相比,作者的方法在各种腐蚀率下对损坏图像的鲁棒性更强,展示了在这些具有挑战性的场景中的强大泛化能力。
值得注意的是,即使在高腐蚀率(20%)下,作者的方法仍然保持了良好的泛化性能。这种鲁棒性主要归因于将文本模式集成到选择过程中,同时与图像模式相结合。方程1中的SAS定义了图像特征与其对应类别特征之间的对齐。当图像被腐蚀时,这种对齐被破坏,从而减少了SAS,并相应地降低了选择这些图像的可能性。相反,遗忘方法通常会优先考虑困难的训练样本,这可能导致腐蚀图像更有可能被选择,因为这些图像通常更难正确分类。因此,这些方法对腐蚀图像的鲁棒性较差,导致泛化性能恶化。

可视化分析 为了展示所选数据集的泛化能力,作者分别使用原始数据集和所选数据集(选择比为90%)训练两个模型,并在CIFAR-10测试集上获取它们的嵌入结果。为了可视化数据集的分布,作者分别对两个模型生成的嵌入结果应用t-SNE。图7中的可视化结果表明,在所选数据集上训练的模型产生了更好的嵌入结果:更好的簇间分离和簇内紧凑性。为了定量分析,作者使用Dunn指数(DI)Nvir等人(2021)来评估聚类结果(数值越高,聚类效果越好)。在移除数据集的10%后,DI增加了43%,呈现更好的聚类效果。

更高级的架构泛化 作者进一步利用所选数据集训练更先进的基于ViT的架构,包括Swin Transformer、ViT-Base和ViT-Large。从表4以及前述各部分的结果来看,作者选定的数据集在CNN基础架构和Transformer基础架构上始终保持无损性能,且训练成本降低。这表明作者的方法获得了适用于各种网络架构的高通用性数据集。

更复杂的基准数据集泛化能力评估
为了进一步评估在我国所选数据集上训练的模型的一般化和鲁棒性,作者使用ResNet-18和ResNet-50模型,在完整数据集和所选数据集上进行训练。然后,这些模型在更具有挑战性的ImageNet基准测试集上进行测试,包括ImageNet-Hard(Taesiri等人,2024年)、ImageNet-R(Hendrycks等人,2021年)和ImageNet-A(Hendrycks等人,2021年)。表5中的结果表明,在我国所选数据集上训练的模型在这些更困难的ImageNet基准测试集上表现出比原始数据集训练的模型更好的泛化和鲁棒性。值得注意的是,这种改进的性能在降低训练成本的同时实现,进一步突显了作者的方法的有效性。

为了评估数据集调整的效果,作者并没有使用微调的图像和文本 Adapter ,而是直接利用预训练的CLIP模型来计算得分和。实验结果显示,在90%的选择比下,准确率显著下降,Tiny-ImageNet上的下降幅度超过2%。因此,数据集调整对于有效将模型的泛化能力转移到目标数据集至关重要。这对于与预训练数据集有显著差异的数据集,如CIFAR,尤为重要,因为图像大小和领域的变化是显著的。此外, Adapter 实现为MLP并仅用25个周期进行微调,确保了高效率。
在表6中,作者评估了每个损失项及其组合在等式6中的效果。整体损失函数实现了最高的准确度。当被省略时,选择过程倾向于选择更多样化的样本,但一些类别代表性的样本可能没有被选择,这严重降低了模型性能。如果没有,选择过程强调最类别代表性的样本。尽管得出的性能降低略小,但选择的子集的数据集的多样性受损。因此,将纳入其中,确保了所选子集的数据集具有平衡的表示。如果没有,由于作者无法获得关于预期选择比例的归一化选择决策,作者直接对中的得分进行排序,并选择得分较高的样本。然而,这使作者 method 完全基于得分进行选择,无法解决组效应,导致性能明显下降。

本文提出了一种新颖的CLIP驱动的数据选择框架,该框架利用多模态信息进行更稳健和泛化的样本选择。
为了实现这一点,作者提出的框架整合了三个模块:数据集适应、样本评分和选择优化模块。
这些模块评估数据在模型训练中的有效性,并针对预期结果优化选择结果。因此,该框架能够选择最具代表性且多样性高的样本。
广泛的实验证明了作者方法的有效性和效率,特别是在大规模数据集上的泛化性能以及在更具挑战性的场景中的鲁棒性,例如噪声和损坏的图像。
未来的工作将探索该方法在多模态数据集中的应用,并将其适配到其他计算机视觉任务中,如目标检测。
[0]. A CLIP-Powered Framework for Robust and Generalizable Data Selection.