MoE(混合专家)
概述
通过激活部分专家网络而非全部参数实现高效推理的模型架构。
关键内容
- 稀疏激活:每次推理只激活部分专家网络,大幅降低计算成本同时保持大参数规模。
- DeepSeek 应用:DeepSeek-V2/V3 使用 MoE 架构,在保持高性能的同时显著降低推理成本。
- 与稠密模型对比:相比 Transformer 的稠密计算,MoE 在推理效率上有显著优势。
来源
- ai_papers_timeline.md — 2024 年时间线条目
相关
- DeepSeek — applied_by
- Transformer — extends