Qwen3 0.6B
0.6Bllama.cppQwen · Güven: orta
- Tahmini hız
- 452,9–685,2 token/sn
- Niceleme
- Q4
- Bağlam
- 8K
- En az RAM
- 16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufYEREL YAPAY ZEKÂ UYUMLULUĞU
GPU'nuz veya Apple Silicon Mac'iniz için yerel dil, kodlama, görüntü ve video modellerini bulun.
Kapasite ve hız model tabanlı tahminlerdir, garanti değildir. Donanım almadan önce çalışma ortamı, sürücü ve model sürümü gereksinimlerini doğrulayın.
SİSTEMİNİZ
Bu çalıştırma için önemli olan bellek bütçesini ve iş yükünü belirleyin.
89 donanım profili · 92 model · 2026-08-23 tarihinde doğrulandı
EŞLEŞME RAPORU
Sonuçlar yerel VRAM uyumunu daha yavaş sistem belleği aktarımından ayırır.
Qwen · Güven: orta
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLlama · Güven: orta
llama-cli -m ./models/llama-3-2-1b-q4_K_M.ggufGemma · Güven: orta
llama-cli -m ./models/gemma-3-1b-q4_K_M.ggufQwen · Güven: orta
llama-cli -m ./models/qwen3-1.7b-q4_K_M.ggufLlama · Güven: orta
llama-cli -m ./models/llama-3-2-3b-q4_K_M.ggufHugging Face · Güven: orta
llama-cli -m ./models/smollm3-3b-q4_K_M.ggufMistral · Güven: orta
llama-cli -m ./models/ministral-3b-q4_K_M.ggufMicrosoft · Güven: orta
llama-cli -m ./models/phi-4-mini-q4_K_M.ggufMicrosoft · Güven: orta
llama-cli -m ./models/phi-3.5-mini-q4_K_M.ggufQwen · Güven: orta
llama-cli -m ./models/qwen3-4b-q4_K_M.ggufGemma · Güven: orta
llama-cli -m ./models/gemma-3-4b-q4_K_M.ggufGemma · Güven: orta
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.ggufAralıklar çalışma ortamı yükünü ve işletim sistemi payını içerir. Gerçek performans model, arka uç, sürücü, sıcaklık ve isteme göre değişir.
HESAPLAMA YÖNTEMİ
Tahmin; ağırlıkları, bağlamı, çalışma yükünü ve bellek yapısını ayrı sınırlar olarak ele alır.
Her profil nicelenmiş ağırlık boyutuyla başlar ve parametre sayısını VRAM'e eşitlemeden çalışma payı ekler.
Daha uzun bağlam KV önbelleğini büyütür. Aynı model bağlam arttıkça yerel uyumdan aktarıma geçebilir.
Sistem RAM'i aktarımı çalışsa bile hız ve gecikme çok farklı olduğundan ayrı gösterilir.
SIK SORULAN SORULAR
Q4 sürümü temel çalışma yüküyle genellikle yaklaşık 5–7 GB ister. Uzun bağlam, büyük toplu işlem veya yüksek hassasiyet 8 GB'ı aşabilir.
Hayır. CPU ve GPU tek bellek havuzunu paylaşır. Bu büyük modelleri sığdırır, ancak macOS ve diğer işlemler için yine pay bırakılmalıdır.
Modelin bir kısmı sistem RAM'inde kalır ve CPU ya da PCIe üzerinden taşınır. Model açılabilir ancak tamamen GPU belleğinde çalışmaktan genellikle çok daha yavaştır.
Hayır, bunlar temkinli model tahminleridir. Kesin hız çalışma ortamı, çekirdek desteği, model yapısı, sürücü, soğutma ve iş yüküne bağlıdır.