Type: concept
Confidence: 0.70
Created: 2026-04-20
Updated: 2026-04-20
Tags: deep-learningarchitectureefficiencyAI工程

MoE(混合专家)

概述

通过激活部分专家网络而非全部参数实现高效推理的模型架构。

关键内容

  1. 稀疏激活:每次推理只激活部分专家网络,大幅降低计算成本同时保持大参数规模。
  2. DeepSeek 应用DeepSeek-V2/V3 使用 MoE 架构,在保持高性能的同时显著降低推理成本。
  3. 与稠密模型对比:相比 Transformer 的稠密计算,MoE 在推理效率上有显著优势。

来源

相关