Qwen3 0.6B
0.6Bllama.cppQwen · 信頼度: 中
- 推定速度
- 452.9–685.2 トークン/秒
- 量子化
- Q4
- コンテキスト
- 8K
- 最小 RAM
- 16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufローカル AI 互換性
GPU または Apple シリコン Mac で動かせる言語、コーディング、画像、動画モデルを照合します。
容量と速度はモデル推定であり保証ではありません。購入前にランタイム、ドライバー、モデル版の要件を確認してください。
あなたのマシン
今回の実行に必要なメモリ予算とワークロードを設定します。
ハードウェア 89 件 · モデル 92 件 · 2026-08-23 確認
マッチレポート
VRAM 内で動く構成と、低速なシステムメモリへのオフロードを分けて表示します。
Qwen · 信頼度: 中
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLlama · 信頼度: 中
llama-cli -m ./models/llama-3-2-1b-q4_K_M.ggufGemma · 信頼度: 中
llama-cli -m ./models/gemma-3-1b-q4_K_M.ggufQwen · 信頼度: 中
llama-cli -m ./models/qwen3-1.7b-q4_K_M.ggufLlama · 信頼度: 中
llama-cli -m ./models/llama-3-2-3b-q4_K_M.ggufHugging Face · 信頼度: 中
llama-cli -m ./models/smollm3-3b-q4_K_M.ggufMistral · 信頼度: 中
llama-cli -m ./models/ministral-3b-q4_K_M.ggufMicrosoft · 信頼度: 中
llama-cli -m ./models/phi-4-mini-q4_K_M.ggufMicrosoft · 信頼度: 中
llama-cli -m ./models/phi-3.5-mini-q4_K_M.ggufQwen · 信頼度: 中
llama-cli -m ./models/qwen3-4b-q4_K_M.ggufGemma · 信頼度: 中
llama-cli -m ./models/gemma-3-4b-q4_K_M.ggufGemma · 信頼度: 中
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf範囲にはランタイム負荷と OS 予約分を含みます。実性能はモデル、バックエンド、ドライバー、冷却、プロンプトで変わります。
計算方法
重み、コンテキスト、ランタイム負荷、メモリ構成を別々の制約として推定します。
パラメーター数を VRAM と同一視せず、量子化重みの容量にランタイム余裕を加えます。
長いコンテキストは KV キャッシュを増やし、同じモデルでもネイティブ適合からオフロードへ変わる場合があります。
システムメモリへのオフロードは動作しても速度と遅延が大きく異なるため、別結果として示します。
よくある質問
Q4 版は基本的なランタイム負荷を含めて通常約 5~7 GB 必要です。長いコンテキスト、大きいバッチ、高精度では 8 GB を超える場合があります。
同じではありません。CPU と GPU が一つのメモリ領域を共有するため大型モデルを載せやすい一方、macOS と他の処理用の予約が必要です。
モデルの一部をシステム RAM に置き、CPU または PCIe 経由で転送します。起動できても、すべてを GPU メモリに置く場合より通常かなり低速です。
ベンチマークの主張ではなく、保守的なモデル推定です。正確な速度はランタイム、カーネル、モデル、ドライバー、冷却、処理内容で変わります。