点击下方卡片,关注「AiCharm」公众号
Subjects: cs.CV
1.MultiZoo & MultiBench: A Standardized Toolkit for Multimodal Deep Learning

标题:MultiZoo 和 MultiBench:多模态深度学习的标准化工具包
作者:Paul Pu Liang, Yiwei Lyu, Xiang Fan, Arav Agarwal, Yun Cheng, Louis-Philippe Morency, Ruslan Salakhutdinov
文章链接:https://arxiv.org/abs/2306.16413
项目代码:https://github.com/pliang279/MultiBench


摘要:
学习多模态表示涉及集成来自多个异构数据源的信息。为了加速未充分研究的模式和任务的进展,同时确保现实世界的稳健性,我们发布了 MultiZoo,这是一个公共工具包,由超过 20 个核心多模式算法的标准化实现和 MultiBench 组成,这是一个涵盖 15 个数据集、10 种模式、20 个数据集的大规模基准测试。预测任务和6个研究领域。它们共同提供了一个自动化的端到端机器学习管道,可简化和标准化数据加载、实验设置和模型评估。为了实现整体评估,我们提供了一种全面的方法来评估(1)泛化性,(2)时间和空间复杂性,以及(3)模态鲁棒性。MultiBench 为更好地理解多模式模型的功能和局限性铺平了道路,同时确保易用性、可访问性和可重复性。我们的工具包是公开可用的,将定期更新,并欢迎社区提供意见。
2.OBELISC: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents

标题:OBELISC:开放的网络规模的交错图像文本文档过滤数据集
作者:Hugo Laurençon, Lucile Saulnier, Léo Tronchon, Stas Bekman, Amanpreet Singh, Anton Lozhkov, Thomas Wang, Siddharth Karamcheti, Alexander M. Rush, Douwe Kiela, Matthieu Cord, Victor Sanh
文章链接:https://arxiv.org/abs//2306.16527






摘要:
在自然文档上训练的大型多模态模型(交错图像和文本)的性能优于在各种多模态基准上对图像文本对进行训练的模型,这些基准需要对一个或多个图像进行推理来生成文本。然而,用于训练这些模型的数据集尚未发布,收集过程也尚未完全指定。我们介绍了 OBELISC 数据集,这是一个开放的网络规模的交错图像文本文档过滤数据集,包含从 Common Crawl 中提取的 1.41 亿个网页、3.53 亿个关联图像和 1150 亿个文本标记。我们描述数据集创建过程,提出全面的过滤规则,并提供数据集内容的分析。为了展示 OBELISC 的可行性,我们在数据集上训练了 800 亿个参数的视觉和语言模型,并在各种多模态基准上获得了有竞争力的性能。我们发布了重现数据集的代码以及数据集本身。
3.Automatic Calibration and Error Correction for Large Language Models via Pareto Optimal Self-Supervision

标题:通过pareto最优自我监督对大型语言模型进行自动校准和纠错
作者:Theodore Zhao, Mu Wei, J. Samuel Preston, Hoifung Poon
文章链接:https://arxiv.org/abs//2306.16564





摘要:
大型语言模型 (LLM) 已在广泛的应用中展示了卓越的开箱即用功能,但准确性仍然是一个主要的增长领域,特别是在生物医学等关键任务领域。校准 LLM 响应置信度的有效方法对于自动检测错误和促进人机交互验证至关重要。校准信号的一个重要来源来自专家规定的程序化监督,这种监督通常成本低廉,但有其自身的局限性,例如噪声和覆盖范围。在本文中,我们引入了帕累托最优自我监督框架,该框架可以利用可用的程序化监督,通过为每个响应生成风险评分来系统地校准法学硕士响应,而无需任何额外的手动操作。这是通过学习协调器模型来将 LLM 输出与其他可用的监督源保持一致来实现的,这将为更不确定的 LLM 响应分配更高的风险分数并促进错误纠正。生物医学和一般领域的标准关系提取任务的实验证明了这种方法的前景,我们提出的风险评分与法学硕士的实际错误率高度相关。对于最不确定的测试实例,基于我们提出的风险评分的动态提示可以显着提高现成的 LLM 的准确性,使 GPT-3 的结果超越最先进的 (SOTA) 弱监督和 GPT-4在具有挑战性的评估数据集上的结果超过了 SOTA 监督结果。

赋予LLM视觉理解能力,360人工智能研究院开源中文多模态对话模型SEEChat


CVPR 2023 | 自动驾驶3D occupancy prediction挑战赛—冠军方案

CVPR 2023 | 神经网络超体?新国立LV lab提出全新网络克隆技术


点击卡片,关注「AiCharm」公众号
喜欢的话,请给我个在看吧!
