TIP
← 記事

AI

MoE(Mixture-of-Experts)とは? — DeepSeek-V3の実際の数字で見る「疎な計算」の仕組み

2026/09/05

1. 「全部のパラメータを毎回使わない」という発想

近年の大規模言語モデルの多くが採用している設計に、MoE(Mixture-of-Experts、専門家の混合)と呼ばれるアーキテクチャがある。名前の通り、モデルの内部に複数の「専門家(エキスパート)」と呼ばれるサブネットワークを持たせ、入力ごとに「どの専門家に処理させるか」を動的に切り替える仕組みだ。

従来型の「密(dense)」なモデルでは、1つの入力トークンを処理するたびに、モデルが持つすべてのパラメータが計算に関与する。これに対してMoEモデルでは、多数の専門家を用意しておきながら、実際に1つのトークンの処理に使うのはそのうちのごく一部に限定する。これを「疎な活性化(sparse activation)」と呼ぶ。

2. 実数値で見る:DeepSeek-V3の場合

抽象的な説明だけでは実感しにくいので、実在するMoEモデル「DeepSeek-V3」の公開されているアーキテクチャ数値を見てみたい。

項目数値
総パラメータ数6,710億(671B)
1トークンあたりの実際の活性化パラメータ数約370億(37B)
レイヤーごとのルーティング対象(ルーテッド)専門家数256個
1トークンあたりに実際に選ばれる専門家数8個
常に全トークンで使われる共有専門家数1〜2個(レイヤーによる)

つまりDeepSeek-V3は、モデル全体としては6,710億パラメータという超大規模な「知識の器」を持ちながら、実際に1つのトークンを処理する際に動くのは、256個中たった8個の専門家(共有専門家を含めても実質的にごく一部)だけであり、計算コストとしては約370億パラメータの密モデルとほぼ同等に抑えられている。総パラメータ数と実際の計算コストの比率が約18対1にもなる、という点が、このアーキテクチャの効率性を端的に表している。

3. なぜこれが効率化につながるのか

モデル全体が保持しているパラメータ数(総パラメータ数)と、実際に1回の推論で計算に使われるパラメータ数(アクティブパラメータ数)を分けて考えると、MoEの利点が理解しやすい。DeepSeek-V3の例で言えば、「知識量・表現力の面では6,710億パラメータ級の大規模モデルに匹敵しうる一方、実際の推論にかかる計算コストは、370億パラメータ程度のより小さな密モデルとほぼ同等」ということになる。つまり、「モデルの容量(知識の広さ)」と「計算コスト(応答の速さ)」という、本来はトレードオフの関係にある2つの要素を、ある程度切り離して設計できるようになる。

4. 専門家は「専門分野」を持っているのか

「専門家」という名前から、「この専門家は数学が得意」「この専門家は日本語が得意」というように、人間にとって分かりやすい役割分担がされているとイメージしがちだが、実際にはそう単純ではない。どの専門家がどのトークンを処理するかを決める「ゲート(振り分け)機構」は学習の過程で自動的に最適化されるため、専門家ごとの役割分担は、人間が直感的に理解できる形にはなっていないことが多いというのが、これまでの研究で広く報告されている知見である。

DeepSeek-V3では、この振り分けの偏りを防ぐための工夫として、従来のような補助損失(auxiliary loss)に頼らない負荷分散戦略を採用していることが技術報告書で説明されている。特定の専門家にトークンが集中しすぎないよう、追加の学習用の損失関数を課すのではなく、バイアス項の調整によって動的に負荷を均等化する、という設計だ。

5. MoEならではの課題

MoEは良いことずくめの技術ではない。主な課題として以下が挙げられる。

  • メモリ消費: 実際の計算に使うパラメータは一部(DeepSeek-V3なら約370億相当)でも、すべての専門家(671B分)をメモリ上に展開しておく必要があるため、総パラメータ数に応じたメモリ容量は依然として必要になる
  • 振り分けの偏り: 特定の専門家にトークンが集中し、他の専門家がほとんど使われない「負荷の偏り」が起きることがあり、これを防ぐための追加の学習上の工夫が必要になる
  • 分散学習・推論の複雑さ: 専門家ごとに異なるハードウェアやプロセスへ処理を振り分ける必要があるため、システムの実装が密モデルより複雑になりやすい

6. TIPの視点

MoEは、「モデルを大きくすればするほど計算コストも比例して増える」という単純な関係を崩す設計として、2020年代半ば以降の大規模モデル開発において主流の選択肢の一つになっている。DeepSeek-V3のように総パラメータ数と活性化パラメータ数に18倍近い開きを持たせる設計は、ローカルLLMの文脈でも「総パラメータ数の割に軽く動く」という特徴として現れることがあり、ハードウェアの制約が厳しい環境でモデルを選ぶ際の重要な判断材料になる。