ローカル AI 互換性

AI Rig Match

GPU または Apple シリコン Mac で動かせる言語、コーディング、画像、動画モデルを照合します。

容量と速度はモデル推定であり保証ではありません。購入前にランタイム、ドライバー、モデル版の要件を確認してください。

あなたのマシン

ハードウェア構成を作成

今回の実行に必要なメモリ予算とワークロードを設定します。

ハードウェア 89 件 · モデル 92 件 · 2026-08-23 確認

マッチレポート

互換モデル

VRAM 内で動く構成と、低速なシステムメモリへのオフロードを分けて表示します。

48ネイティブ
3オフロード
8要更新

Qwen3 0.6B

0.6Bllama.cpp

Qwen · 信頼度: 中

ネイティブ適合
モデルメモリ0.9 / 29.4 GB
推定速度
452.9–685.2 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · 信頼度: 中

ネイティブ適合
モデルメモリ1.3 / 29.4 GB
推定速度
423–640 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · 信頼度: 中

ネイティブ適合
モデルメモリ1.3 / 29.4 GB
推定速度
423–640 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · 信頼度: 中

ネイティブ適合
モデルメモリ1.5 / 29.4 GB
推定速度
355.1–537.2 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · 信頼度: 中

ネイティブ適合
モデルメモリ2.4 / 29.4 GB
推定速度
248.2–375.5 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · 信頼度: 中

ネイティブ適合
モデルメモリ2.4 / 29.4 GB
推定速度
256.4–387.8 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · 信頼度: 中

ネイティブ適合
モデルメモリ2.6 / 29.4 GB
推定速度
241–364.5 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · 信頼度: 中

ネイティブ適合
モデルメモリ2.9 / 29.4 GB
推定速度
221.9–335.8 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · 信頼度: 中

ネイティブ適合
モデルメモリ3 / 29.4 GB
推定速度
215.6–326.2 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · 信頼度: 中

ネイティブ適合
モデルメモリ3.3 / 29.4 GB
推定速度
200.2–302.9 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · 信頼度: 中

ネイティブ適合
モデルメモリ3.5 / 29.4 GB
推定速度
192–290.5 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · 信頼度: 中

ネイティブ適合
モデルメモリ4 / 29.4 GB
推定速度
173–261.7 トークン/秒
量子化
Q4
コンテキスト
8K
最小 RAM
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

範囲にはランタイム負荷と OS 予約分を含みます。実性能はモデル、バックエンド、ドライバー、冷却、プロンプトで変わります。

計算方法

前提を明示した適合判定

重み、コンテキスト、ランタイム負荷、メモリ構成を別々の制約として推定します。

名称より先に重みを計算

パラメーター数を VRAM と同一視せず、量子化重みの容量にランタイム余裕を加えます。

コンテキストにもコストがある

長いコンテキストは KV キャッシュを増やし、同じモデルでもネイティブ適合からオフロードへ変わる場合があります。

オフロードはネイティブではない

システムメモリへのオフロードは動作しても速度と遅延が大きく異なるため、別結果として示します。

よくある質問

ローカル AI のハードウェア質問

8B 言語モデルにはどれくらいの VRAM が必要ですか?

Q4 版は基本的なランタイム負荷を含めて通常約 5~7 GB 必要です。長いコンテキスト、大きいバッチ、高精度では 8 GB を超える場合があります。

Apple のユニファイドメモリは GPU VRAM と同じですか?

同じではありません。CPU と GPU が一つのメモリ領域を共有するため大型モデルを載せやすい一方、macOS と他の処理用の予約が必要です。

オフロードとは何ですか?

モデルの一部をシステム RAM に置き、CPU または PCIe 経由で転送します。起動できても、すべてを GPU メモリに置く場合より通常かなり低速です。

速度範囲はベンチマーク結果ですか?

ベンチマークの主張ではなく、保守的なモデル推定です。正確な速度はランタイム、カーネル、モデル、ドライバー、冷却、処理内容で変わります。