1.Efficient Discovery and Effective Evaluation of Visual Perceptual Similarity: A Benchmark and Beyond(ICCV 2023)

标题:视觉感知相似性的有效发现和有效评估:基准及超越
作者:Oren Barkan, Tal Reiss, Jonathan Weill, Ori Katz, Roy Hirsch, Itzik Malkiel, Noam Koenigstein
文章链接:https://arxiv.org/abs/2308.14753v1
项目代码:https://vsd-benchmark.github.io/vsd/




摘要:
视觉相似性发现(VSD)是广泛电子商务应用中的一项重要任务。给定某个对象的图像,VSD 的目标是检索具有高度感知视觉相似性的不同对象的图像。尽管这是一个高度解决的问题,但对所提出的 VSD 方法的评估通常基于识别检索任务的代理,评估模型检索同一对象的不同图像的能力。我们认为基于识别任务评估 VSD 方法是有限的,忠实的评估必须依赖于专家注释。在本文中,我们介绍了第一个大规模时尚视觉相似性基准数据集,由超过 11 万个专家注释的图像对组成。除了这一重大贡献之外,我们还分享了我们在整理该数据集时所面临的挑战的见解。基于这些见解,我们提出了一种新颖且有效的标记程序,可以应用于任何数据集。我们的分析检查了其局限性和归纳偏差,并根据这些发现,我们提出了减轻这些局限性的指标。尽管我们的主要关注点在于视觉相似性,但我们提出的方法在发现和评估各个领域的感知相似性方面具有更广泛的应用。
2.UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory

标题:UniPT:具有高效参数和内存的迁移学习通用并行调优
作者:Chung-Ching Lin, Jiang Wang, Kun Luo, Kevin Lin, Linjie Li, Lijuan Wang, Zicheng Liu
文章链接:https://arxiv.org/abs/2308.14316v1
项目代码:https://github.com/Paranioar/UniPT







摘要:
微调预训练模型已成为许多领域中的一项强大技术,因为它能够利用大量预先存在的知识并在下游任务中实现卓越的性能。然而,更新整个网络的参数是计算密集型的。尽管最先进的参数高效迁移学习(PETL)方法显着减少了可训练参数和存储需求,但几乎所有方法仍然需要通过大型预训练网络反向传播梯度。这种占用大量内存的特性极大地限制了 PETL 方法在现实场景中的适用性。为此,我们提出了一种新的内存高效 PETL 策略,称为通用并行调优(UniPT)。具体来说,我们通过轻量级可学习并行网络促进传输过程,该网络由两个模块组成:1)并行交互模块,它解耦固有的顺序连接并独立于预训练网络处理中间激活。2)置信度聚合模块,自适应学习集成跨层特征的最佳策略。我们在五种具有挑战性的视觉和语言任务(即图像文本检索、视频文本检索、视觉问题回答、组合问题回答和视觉基础)。对十个数据集的广泛消融验证了我们的 UniPT 不仅可以显着降低内存消耗并超越内存效率最好的竞争对手,而且在不同架构的低内存场景中比现有 PETL 方法实现更高的性能。我们的代码可在以下位置公开获取:此 https URL。
3.Hierarchical Contrastive Learning for Pattern-Generalizable Image Corruption Detection(ICCV 2023)

标题:用于模式泛化图像损坏检测的分层对比学习
作者:Xin Feng, Yifeng Xu, Guangming Lu, Wenjie Pei
文章链接:https://arxiv.org/abs/2308.14061v1
项目代码:https://github.com/xyfJASON/HCL






摘要:
具有大尺寸损坏的有效图像恢复(例如盲图像修复)需要精确检测损坏区域掩模,由于损坏的形状和模式多种多样,这仍然极具挑战性。在这项工作中,我们提出了一种自动损坏检测的新颖方法,该方法允许在没有已知损坏掩码的情况下进行盲目损坏恢复。具体来说,我们开发了一个分层对比学习框架,通过捕获损坏区域和未损坏区域之间的内在语义区别来检测损坏区域。特别是,我们的模型首先通过低分辨率特征空间中的对比学习预测粗略掩模,然后通过高分辨率对比学习细化掩模的不确定区域,以从粗到细的方式检测损坏的掩模。设计了专门的分层交互机制,以促进不同尺度对比学习的知识传播,从而大幅提升建模性能。然后利用检测到的多尺度腐败掩码来指导腐败恢复。通过学习腐败的对比区别而不是语义模式来检测腐败区域,我们的模型在不同的腐败模式中具有良好的泛化能力。大量的实验证明了我们的模型的以下优点:1)在损坏检测和各种图像恢复任务(包括盲修复和水印去除)方面比其他方法具有优越的性能,2)对不同损坏模式(例如涂鸦、随机噪声或其他)的强泛化性图像内容。