Transformer 是当代大语言模型(LLM)的通用底座。几乎所有主流大模型都采用以解码器为主的 Transformer 架构,通过自回归方式逐 token 生成文本,其自注意力机制是模型捕捉长距离语义依赖的核心。
基于 Transformer 的编码器(如 BERT)与解码器(如 GPT 系列)分别发展出双向理解与自回归生成两条技术路线,前者擅长文本理解类任务,后者成为生成式大模型的主流形态。大规模预训练加下游适配的范式,使 Transformer 成为通用人工智能能力的主要载体。
在产业实践中,基于 Transformer 的大模型被广泛用于对话、代码生成、检索增强生成等场景。腾讯混元大模型即是基于 Transformer 构建的代表性产品之一,依托这一架构实现了对长距离语义依赖的有效建模与大规模训练。