AI
JetBrains、コーディングエージェント向けMoEモデル「Mellum2.1」をApache 2.0で公開
2026/10/10
JetBrains、エージェント向けオープンモデル「Mellum2.1」を公開
JetBrainsは2026年10月、コーディングエージェントおよび高速サブエージェント向けに設計したオープンモデル「Mellum2.1」を公開した。Apache 2.0ライセンスのもとHugging Faceで配布されており、自社GPU環境へのセルフホスト運用を想定した設計となっている。
アーキテクチャの概要
Mellum2.1はMixture-of-Experts(MoE)構成を採用した12Bパラメータモデルで、1トークンあたり2.5Bパラメータを活性化すると報告されている。アーキテクチャ自体は前世代のMellum2から変更されておらず、64個のエキスパートのうち1トークンごとに8個をルーターが選択する仕組みだ。
主なアーキテクチャ仕様は以下のとおり。
- レイヤー数: 28
- アテンション: グループクエリアテンション(GQA)、クエリヘッド32 / KVヘッド4
- スライディングウィンドウ: 1,024トークン(4層ごとに3層で適用)
- コンテキスト長: 131,072トークン
- 語彙サイズ: 98,304トークン
- 精度: bfloat16
モデルのチェックポイントは「Mellum2.1-12B-A2.5B-Thinking」として公開されており、回答前にチェーンオブソートを出力する推論モデルに位置づけられる。GGUFビルドは最小7.0 GBから提供されており、llama.cpp・Ollama・LM Studioからも利用可能とされている。
強化学習が主役のポストトレーニング
今回の改良の核心は、アーキテクチャではなくポストトレーニングにある。JetBrainsによれば、強化学習(RL)をこれまでの短い最終ステージからメイントレーニングの中心へと移行したという。
RLのタスクは数学・競技プログラミング・科学・ツール使用・ソフトウェアエンジニアリングにまたがっており、オープンデータセットに含まれるテスト破損・検証不能な回答・難易度が極端すぎるタスクなどはフィルタリングが施されたと説明されている。
ソフトウェアエンジニアリングのタスクでは、モデルは実際のリポジトリ上でシェルとファイル編集ツールを使って動作し、テストが通過した場合に報酬が与えられる仕組みだ。JetBrainsはこのトレーニングにあたり、数千の環境で数百万のサンドボックスを起動したと報告している。
ベンチマーク結果
JetBrainsはMellum2.1・Mellum2・Qwen3.5-9B・Gemma 4 E4Bを同一パイプラインのシンキングモードで評価した。以下のスコアはいずれもJetBrains自己申告の値である点に留意が必要だ。
エージェント型コーディング
RLによる改善がとくに顕著に現れたのがエージェント系タスクだ。
| ベンチマーク | Mellum2 | Mellum2.1 |
|---|---|---|
| SWE-bench Verified | 2.0 | 47.0 |
| SWE-bench Pro | 0.0 | 28.0 |
| Terminal-Bench 2.1 | 0.6 | 17.4 |
SWE-bench Verifiedは2.0から47.0へと大幅に向上している。エージェント評価にはオープンソースのPi v0.73.1ハーネスと114Kトークンのコンテキストが使用されたという。
コーディング・関数呼び出し
Mellum2.1が比較モデルをリードした項目として、LiveCodeBench v6(82.0)・HumanEval+(91.5)・MBPP+(79.4)・BFCL v4(62.3)が挙げられている。LiveCodeBench v6ではQwen3.5-9B(75.4)やGemma 4 E4B(69.4)を上回ったとされる。
一方、SWE-bench Verified(50.0)・SWE-bench Pro(38.0)・AIME 25/26(86.7)・GPQA Diamond(77.8)ではQwen3.5-9Bが依然リードしているとJetBrainsは説明している。Terminal-Bench 2.1ではMellum2.1が17.4に対してQwen3.5-9Bが21.7と、難度の高いエージェント系タスクでは差が残る形だ。
安全性
HarmBenchスコアは21.5から8.5へ低下しており(低いほど良い)、安全性面での改善も報告されている。
なお、評価パイプラインの違いが数値に影響するため、JetBrainsの測定値と各モデルの公式カードの数値が異なる場合がある点もJetBrains自身が言及している。
スループットと実行環境
ポストトレーニングでアーキテクチャが変わっていないため、推論速度はMellum2と同等だという。JetBrainsの計測によれば、1台のNVIDIA H200に高負荷をかけた環境でQwen3.5-9Bの約2倍のトークンスループットを実現し、シングルリクエストではマルチトークン予測(MTP)によって約1.6倍の高速化が得られるとされている。vLLMでの投機的デコーディングに対応するMTPヘッドは近日公開予定と案内されている。
サーバー側ではvLLMおよびSGLangを通じたデプロイが可能で、llama.cpp系のローカル実行環境にも対応している。
まとめ
Mellum2.1はアーキテクチャを据え置いたまま、強化学習を中心に据えたポストトレーニングでSWE-benchmark系スコアを大幅に引き上げた事例として注目される。2.5Bという少ない活性化パラメータ数でのスループット優位性と、セルフホスト可能なオープンライセンスは実運用を検討する開発者にとって魅力的な選択肢となりうる。一方、難度の高いエージェントタスクや知識系ベンチマークではQwen3.5-9Bに及ばない領域もあることが同社自身の評価で示されており、用途に応じた選定が求められる。
出典: JetBrains Releases Mellum2.1: A 12B MoE Open Model for Coding Agents