Qwen3 0.6B
0.6Bllama.cppQwen · Konfidenz: mittel
- Geschätzte Geschwindigkeit
- 452,9–685,2 Token/s
- Quantisierung
- Q4
- Kontext
- 8K
- Mindest-RAM
- 16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLOKALE KI-KOMPATIBILITÄT
Finde Sprach-, Coding-, Bild- und Videomodelle für deine GPU oder deinen Apple-Silicon-Mac.
Kapazität und Geschwindigkeit sind modellierte Schätzwerte, keine Garantie. Prüfe vor dem Hardwarekauf Laufzeit-, Treiber- und Modellanforderungen.
DEIN SYSTEM
Lege Speicherbudget und Arbeitslast für diesen Lauf fest.
89 Hardwareprofile · 92 Modelle · geprüft am 2026-08-23
MATCH-BERICHT
Ergebnisse trennen native VRAM-Nutzung von langsamerem System-RAM-Offload.
Qwen · Konfidenz: mittel
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLlama · Konfidenz: mittel
llama-cli -m ./models/llama-3-2-1b-q4_K_M.ggufGemma · Konfidenz: mittel
llama-cli -m ./models/gemma-3-1b-q4_K_M.ggufQwen · Konfidenz: mittel
llama-cli -m ./models/qwen3-1.7b-q4_K_M.ggufLlama · Konfidenz: mittel
llama-cli -m ./models/llama-3-2-3b-q4_K_M.ggufHugging Face · Konfidenz: mittel
llama-cli -m ./models/smollm3-3b-q4_K_M.ggufMistral · Konfidenz: mittel
llama-cli -m ./models/ministral-3b-q4_K_M.ggufMicrosoft · Konfidenz: mittel
llama-cli -m ./models/phi-4-mini-q4_K_M.ggufMicrosoft · Konfidenz: mittel
llama-cli -m ./models/phi-3.5-mini-q4_K_M.ggufQwen · Konfidenz: mittel
llama-cli -m ./models/qwen3-4b-q4_K_M.ggufGemma · Konfidenz: mittel
llama-cli -m ./models/gemma-3-4b-q4_K_M.ggufGemma · Konfidenz: mittel
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.ggufDie Bereiche enthalten Laufzeitbedarf und OS-Reserve. Reale Leistung variiert je nach Modell, Backend, Treiber, Kühlung und Prompt.
BERECHNUNGSMETHODE
Gewichte, Kontext, Laufzeitbedarf und Speichertopologie werden als getrennte Grenzen behandelt.
Jedes Profil beginnt mit quantisierten Gewichten und Laufzeitreserve, statt Parameterzahl direkt mit VRAM gleichzusetzen.
Längerer Kontext erhöht den KV-Cache. Dasselbe Modell kann dadurch von nativer Nutzung zu Offload wechseln.
System-RAM-Offload wird getrennt gezeigt, weil er zwar laufen kann, aber Geschwindigkeit und Latenz deutlich verändert.
HÄUFIGE FRAGEN
Ein Q4-Build benötigt mit grundlegender Laufzeitreserve meist etwa 5–7 GB. Längerer Kontext, größere Batches oder höhere Präzision können 8 GB überschreiten.
Nein. CPU und GPU teilen einen Speicherpool. Das hilft bei großen Modellen, aber macOS und andere Prozesse benötigen weiterhin eine Reserve.
Ein Teil des Modells bleibt im System-RAM und läuft über CPU oder PCIe. Das Modell kann starten, ist aber meist viel langsamer als vollständig im GPU-Speicher.
Nein, es sind konservative Modellschätzungen. Die genaue Leistung hängt von Laufzeit, Kernel, Modell-Build, Treiber, Kühlung und Arbeitslast ab.