LOKALE KI-KOMPATIBILITÄT

AI Rig Match

Finde Sprach-, Coding-, Bild- und Videomodelle für deine GPU oder deinen Apple-Silicon-Mac.

Kapazität und Geschwindigkeit sind modellierte Schätzwerte, keine Garantie. Prüfe vor dem Hardwarekauf Laufzeit-, Treiber- und Modellanforderungen.

DEIN SYSTEM

Hardwareprofil erstellen

Lege Speicherbudget und Arbeitslast für diesen Lauf fest.

89 Hardwareprofile · 92 Modelle · geprüft am 2026-08-23

MATCH-BERICHT

Kompatible Modelle

Ergebnisse trennen native VRAM-Nutzung von langsamerem System-RAM-Offload.

48Nativ
3Offload
8Upgrade

Qwen3 0.6B

0.6Bllama.cpp

Qwen · Konfidenz: mittel

Passt nativ
Modellspeicher0,9 / 29,4 GB
Geschätzte Geschwindigkeit
452,9–685,2 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · Konfidenz: mittel

Passt nativ
Modellspeicher1,3 / 29,4 GB
Geschätzte Geschwindigkeit
423–640 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · Konfidenz: mittel

Passt nativ
Modellspeicher1,3 / 29,4 GB
Geschätzte Geschwindigkeit
423–640 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · Konfidenz: mittel

Passt nativ
Modellspeicher1,5 / 29,4 GB
Geschätzte Geschwindigkeit
355,1–537,2 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · Konfidenz: mittel

Passt nativ
Modellspeicher2,4 / 29,4 GB
Geschätzte Geschwindigkeit
248,2–375,5 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · Konfidenz: mittel

Passt nativ
Modellspeicher2,4 / 29,4 GB
Geschätzte Geschwindigkeit
256,4–387,8 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · Konfidenz: mittel

Passt nativ
Modellspeicher2,6 / 29,4 GB
Geschätzte Geschwindigkeit
241–364,5 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · Konfidenz: mittel

Passt nativ
Modellspeicher2,9 / 29,4 GB
Geschätzte Geschwindigkeit
221,9–335,8 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · Konfidenz: mittel

Passt nativ
Modellspeicher3 / 29,4 GB
Geschätzte Geschwindigkeit
215,6–326,2 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · Konfidenz: mittel

Passt nativ
Modellspeicher3,3 / 29,4 GB
Geschätzte Geschwindigkeit
200,2–302,9 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · Konfidenz: mittel

Passt nativ
Modellspeicher3,5 / 29,4 GB
Geschätzte Geschwindigkeit
192–290,5 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · Konfidenz: mittel

Passt nativ
Modellspeicher4 / 29,4 GB
Geschätzte Geschwindigkeit
173–261,7 Token/s
Quantisierung
Q4
Kontext
8K
Mindest-RAM
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

Die Bereiche enthalten Laufzeitbedarf und OS-Reserve. Reale Leistung variiert je nach Modell, Backend, Treiber, Kühlung und Prompt.

BERECHNUNGSMETHODE

Ein Eignungsergebnis mit offenen Annahmen

Gewichte, Kontext, Laufzeitbedarf und Speichertopologie werden als getrennte Grenzen behandelt.

Gewichte vor Marketingnamen

Jedes Profil beginnt mit quantisierten Gewichten und Laufzeitreserve, statt Parameterzahl direkt mit VRAM gleichzusetzen.

Kontext kostet Speicher

Längerer Kontext erhöht den KV-Cache. Dasselbe Modell kann dadurch von nativer Nutzung zu Offload wechseln.

Offload ist nicht nativ

System-RAM-Offload wird getrennt gezeigt, weil er zwar laufen kann, aber Geschwindigkeit und Latenz deutlich verändert.

HÄUFIGE FRAGEN

Fragen zu lokaler KI-Hardware

Wie viel VRAM braucht ein 8B-Sprachmodell?

Ein Q4-Build benötigt mit grundlegender Laufzeitreserve meist etwa 5–7 GB. Längerer Kontext, größere Batches oder höhere Präzision können 8 GB überschreiten.

Ist Apples gemeinsamer Speicher dasselbe wie GPU-VRAM?

Nein. CPU und GPU teilen einen Speicherpool. Das hilft bei großen Modellen, aber macOS und andere Prozesse benötigen weiterhin eine Reserve.

Was bedeutet Offload?

Ein Teil des Modells bleibt im System-RAM und läuft über CPU oder PCIe. Das Modell kann starten, ist aber meist viel langsamer als vollständig im GPU-Speicher.

Sind die Geschwindigkeitsbereiche Benchmarks?

Nein, es sind konservative Modellschätzungen. Die genaue Leistung hängt von Laufzeit, Kernel, Modell-Build, Treiber, Kühlung und Arbeitslast ab.