首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >Transformer >Transformer 的混合专家(MoE)扩展是如何工作的?

Transformer 的混合专家(MoE)扩展是如何工作的?

词条归属:Transformer

1. 稀疏激活思想

混合专家(Mixture of Experts, MoE)是一种条件计算机制:模型将前馈层替换为多个并行的"专家"子网络,并为每个输入 token 由门控网络动态选择其中一小部分专家参与计算。这样可以在不成比例增加计算成本的前提下,大幅扩充模型的总参数量。

2. 容量与计算的解耦

传统稠密模型中,每个 token 都要经过全部参数;而 MoE 让总参数与单次激活参数解耦——模型可以拥有数百亿乃至数千亿总参数,但每个 token 只激活其中一小部分。这使模型在保持较高推理效率的同时获得更强的表达能力。

3. 代表性实践

MoE 已成为当前大规模模型扩展的主流方向之一,被广泛应用于 Mixtral、DeepSeek 等系列模型。以 Qwen3-235B-A22B 为例,其将每个 token 路由到 128 个专家中的 8 个,在 2350 亿总参数中激活约 220 亿参数,体现了"大总参、小激活"的典型设计。

相关文章
混合专家模型MOE的概述
MoE(Mixture of Experts,混合专家模型)的核心思想,可以概括为“ 术业有专攻,分而治之 ”。
索旭东
2026-05-22
6600
DeepSeek MoE:混合专家架构的创新与突破
在人工智能领域,尤其是大语言模型(LLM)的发展中,模型的性能和效率一直是研究的核心问题。随着模型规模的不断扩大,如何在有限的计算资源下实现更高的性能,成为了一个亟待解决的挑战。近年来,混合专家(Mixture of Experts,简称MoE)架构逐渐成为研究的热点。DeepSeek作为一家在人工智能领域崭露头角的公司,其推出的DeepSeek MoE架构引发了广泛关注。本文将深入探讨DeepSeek MoE架构的创新之处及其在性能和效率上的突破。
用户7353950
2025-02-05
1.5K0
MoE 混合专家:让模型各展所长的 “智慧联盟”
在机器学习的世界里,传统的单一模型就像一个 “全能选手”,试图应对各种复杂任务,但往往难以在所有场景都做到极致。而 **MoE(Mixture of Experts,混合专家)** 模型则另辟蹊径,它如同一个 “智慧联盟”,将多个 “专家模型” 组合在一起,每个专家专注擅长领域,通过协作来处理复杂任务,让模型性能实现质的飞跃。接下来,就让我们深入了解这个独特的算法。
紫风
2025-10-14
8850
Time-MoE:混合专家的十亿级时间序列基础模型
论文标题:Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts
时空探索之旅
2024-11-19
1.3K0
YOLO-Master | 混合专家MOE架构的对象检测新王者
YOLO-Master是由腾讯优图实验室的研究者与新加坡管理大学合作,于2025年12月提出的一种新型人工智能系统。其核心创新是一个名为“高效稀疏专家混合模块”的技术,该系统内置不同专长的AI专家,能根据输入图像智能调度专家组合。在MS COCO数据集的目标检测任务中,YOLO-Master-N取得了42.4%的平均精度,处理单张图像仅需1.62毫秒。该系统架构还可扩展至图像分类与实例分割任务,在ImageNet数据集上达到了76.6%的Top-1准确率。其技术特点使其适合部署在自动驾驶汽车、监控摄像头等资源受限的边缘设备上
OpenCV学堂
2026-04-02
5180
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券