最終更新:2025-08-19 (火) 00:31:55 (333d)
MoE
Top / MoE
Mixture of Experts
元論文
- Adaptive Mixture of Local Experts (1991)
2017
- Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer
- Shazeer
https://arxiv.org/abs/1701.06538
- Sparse Mixture-of-Experts (MoE) 構造の有効性を初めて大規模な深層ニューラルネットワーク上で実証
構造
ゲート
- 入力データに対して、どのエキスパート・ネットワークが正しい推論をしそうか、エキスパート・ネットワークを取捨選択するための推論
エキスパート
- 推論
- FFN
モデル
構造
完全MoEモデル
- 全レイヤがMoE構造を持つモデル
- Grok

