2020 年提出的 Vision Transformer(ViT)证明,Transformer 可以直接应用于图像:将图像切分为固定大小的图块(如 16×16 像素),把每个图块当作一个 token 展平成序列,再送入标准 Transformer 编码器处理。这打破了此前计算机视觉由卷积神经网络主导的格局。
2021 年提出的 CLIP 通过对比学习,将图像编码器(ViT)与文本编码器映射到同一嵌入空间,使匹配的图文对彼此靠近、不匹配的彼此远离。这种对齐能力支撑了零样本分类、图文检索等任务,并成为众多多模态模型的视觉前端。
由于图像和文本都可以被表示为 token 序列并由同一套 Transformer 机制处理,将视觉与语言模态融合变得自然。当前主流视觉语言模型通常由视觉编码器、投影层和语言模型三部分组成,Transformer 在其中承担跨模态信息整合与推理的核心角色。