最終更新:2025-08-19 (火) 00:31:55 (333d)  

MoE
Top / MoE

Mixture of Experts

元論文

  • Adaptive Mixture of Local Experts (1991)

2017

  • Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer
  • Shazeer
  • https://arxiv.org/abs/1701.06538
  • Sparse Mixture-of-Experts (MoE) 構造の有効性を初めて大規模な深層ニューラルネットワーク上で実証

構造

ゲート

  • 入力データに対して、どのエキスパート・ネットワークが正しい推論をしそうか、エキスパート・ネットワークを取捨選択するための推論

エキスパート

モデル

構造

完全MoEモデル

  • 全レイヤがMoE構造を持つモデル
  • Grok

ハイブリッドMoEモデル

  • 最初の数層は通常のFFN、残りの層がMoE構造を持つモデル
  • DeepSeek
  • GLM4_MOE?

サーベイ

参考