開発
8GB GPU・Mac M2 16GBで動くローカルLLM徹底比較(2026年9月版)
2026/09/20
1. この記事の対象環境
本稿は、8GB VRAMのコンシューマー向けGPU(RTX 4060など)と、**Mac(Apple SiliconのM2、統合メモリ16GB)**という、ローカルLLMの入門〜中級ラインとしてよく挙がる2つの環境を対象に、実際に動かせるモデルを比較する。前提として、4ビット量子化(Q4_K_Mなど)を基準に、必要メモリの目安を示す(量子化そのものの仕組みは本誌「AIの量子化とは?」を参照)。
Macの場合はGPU用VRAMとは異なり、CPU・GPU・ニューラルエンジンが同じメモリ空間を共有する「統合メモリ(Unified Memory)」方式のため、16GBあれば8〜9Bクラスのモデルにかなりの余裕を持って対応できる。Apple自身が開発する推論フレームワーク「MLX」は、この統合メモリ構成に最適化されており、Ollamaやllama.cppと並ぶ選択肢としてMac利用者の間で定着している。
2. 比較表(事実確認済み)
以下は、独立した複数の情報源で存在・仕様を確認できたモデルの比較である。
| モデル | アーキテクチャ | 目安メモリ(Q4) | 一般用途 | コーディング |
|---|---|---|---|---|
| Ornith-1.5-9B | Dense (9B) | 約5.6〜8GB | 思考過程を<think>タグで出力し、複雑な要約・論理パズルに強い | 9Bクラスでは頭一つ抜けた実力。自らタスクと検証手順の両方を生成し続ける「自己改善(self-improvement)」ループが特徴 |
| Bonsai 2(27B・三値量子化) | Dense 27B → 三値量子化 | 約5.9〜6.7GB | 27B相当の文脈理解力・ニュアンス把握。9Bクラスより一枚上 | 長いアルゴリズムを破綻させず書き切る一貫性に優れる |
| Qwen3.5 / Qwen3.6(Q4_K_M) | Dense(4B〜32B等、サイズ選択可) | 選んだサイズに依存 | 日本語の自然さ・知識の網羅性で安定した定番 | 指示通りの構文エラーの少ないコードを堅実に生成 |
| OLMoE-1B-7B | MoE(総7B/活性約1.3B) | 約2〜4GB | 完全オープン(学習データ・コード・重みすべて公開)。軽量な割に知識問題のスコアが高い | 短い関数・正規表現レベルの生成は高速。複数ファイルにまたがる設計は力不足 |
| Llama 3.1 8B Instruct | Dense (8B) | 約4.5〜5GB | Meta製、対応言語・ツールの豊富さで「困ったときの定番」的な信頼感 | 標準的なコーディング支援は安定。突出した強みはないが弱点も少ない |
3. 各モデルの詳細
3-1. Ornith-1.5-9B — 「自分でデバッグ手順を作る」9Bモデル
DeepReinforce AIが2026年6月に公開した「Ornith-1.0」の後継として、2026年8月に公開したコーディング・エージェント特化モデル。Qwen3.5とGemma 4をベースに継続事前学習・中間学習・ポスト学習を重ねている。初代の1.0は、AIが解くべき課題を検証する手順(スキャフォールド/足場)を自己学習で構築する「自己足場化(self-scaffolding)」が売りだったが、1.5ではこれを一歩進め、課題そのものの生成・検証手順の構築・強化学習によるポリシー改善を同時並行で最適化する「自己改善(self-improvement)」ループへと進化している。
9Bという比較的小さいサイズでありながら、SWE-bench Verifiedで70.6、Terminal-Bench 2.1で46.2、GPQA Diamondで86.4というスコアを記録し、同クラスのQwen3.5-9Bはもちろん、はるかに大きいGemma 4-31BやQwen3.6-35Bをもコーディング系ベンチマークで上回ったと報告されている。単にコードを書くだけでなく、自分でテストを実行し、失敗を見て修正する自律的な反復作業を得意とする点が、他の9Bクラスのモデルとの大きな違いだ。
3-2. Bonsai 2(27B・三値量子化)— 大きなモデルを小さく動かす
本誌で以前取り上げた通り、独立系プロジェクトPrismML-Engが、Qwen3.8-27Bをベースに三値量子化(重みを-1・0・+1の3値に限定する手法)を適用し、1重みあたり約1.75ビットまで圧縮したモデル(詳しくは本誌「Bonsai2の約1.76bit量子化」を参照)。ベースが27Bと大きいため、文脈理解やニュアンスの汲み取りといった「地力」は9Bクラスより優位とされる。ただし、この性能維持率はプロジェクト自身の自己申告であり、専用の実行環境(対応版のllama.cpp)が必要になる点は変わらず注意が必要だ。
3-3. Qwen3.5 / Qwen3.6 — 手堅い定番
サイズ展開が幅広く、日本語処理の自然さや知識の網羅性で安定した評価を得ている、いわば「困ったらこれ」の定番モデル群。Ornith-1.5のような自律的なデバッグ能力はないが、指示された通りの構文エラーの少ないコードを堅実に出力する信頼感がある。
3-4. OLMoE-1B-7B — 完全オープンな軽量MoE
Allen Institute for AI(AI2)が2024年9月に公開した、64個の専門家(エキスパート)から毎回8個だけを選んで動かすMoE構成のモデル。総パラメータは7B相当だが、実際の計算に使われるのは約1.3B相当分だけで、2〜4GB程度のメモリでも動作する(MoEの仕組み自体は本誌「MoEとは?」を参照)。AI2は学習データ・学習コード・モデルの重みのすべてを公開しており、透明性の高さでも知られる。速度と引き換えに複雑な複数ファイル間の設計作業は苦手とされる。
3-5. Llama 3.1 8B Instruct — 客観性のために加えた「もう一つの定番」
冒頭で挙げた5モデルには含まれていなかったが、比較の客観性のために加えたのがMeta製のLlama 3.1 8B Instructだ。突出して強い分野があるわけではないが、対応ツール・ドキュメント・コミュニティサポートの豊富さで「まず動かしてみる」際の失敗が少ない、実務上のデフォルト的な選択肢である。
4. Mac M2 16GBならではの注意点
Mac環境では、GGUF形式でOllama/llama.cppを使う方法と、Apple製のMLXフレームワーク向けに変換されたモデルを使う方法の2通りがある。MLX版は統合メモリとApple SiliconのGPU・ニューラルエンジンを直接活用するよう設計されているため、同じモデルでも快適に動く傾向がある。16GBの統合メモリがあれば、8〜9Bクラスのモデルは量子化レベルを問わず余裕を持って動作し、13〜14Bクラスが実用上の上限ラインとされている。Bonsai 2のような27B級の三値量子化モデルも、GGUF・MLXいずれかの対応版があれば、16GB環境で動作させられる余地がある。
5. まとめ:どれを選ぶべきか
- コーディング・エージェント作業を重視するなら: Ornith-1.5-9Bが、このサイズクラスでは最有力の選択肢
- 一般対話・日本語の自然さを重視するなら: Qwen3.5/3.6が引き続き手堅い
- 省メモリ・完全な透明性を重視するなら: OLMoE-1B-7B
- 大きなモデルの「地力」を低メモリで体験したいなら: Bonsai 2(ただし専用実行環境が必要な点に注意)
- 迷ったときの安全な既定値: Llama 3.1 8B Instruct
いずれのモデルも、実際の体感は自分のタスク(対話・要約・特定のプログラミング言語でのコーディングなど)によって変わる。本稿の比較表を出発点に、複数のモデルを実際に試して選ぶことをおすすめしたい。