YEREL YAPAY ZEKÂ UYUMLULUĞU

AI Rig Match

GPU'nuz veya Apple Silicon Mac'iniz için yerel dil, kodlama, görüntü ve video modellerini bulun.

Kapasite ve hız model tabanlı tahminlerdir, garanti değildir. Donanım almadan önce çalışma ortamı, sürücü ve model sürümü gereksinimlerini doğrulayın.

SİSTEMİNİZ

Donanım profili oluşturun

Bu çalıştırma için önemli olan bellek bütçesini ve iş yükünü belirleyin.

89 donanım profili · 92 model · 2026-08-23 tarihinde doğrulandı

EŞLEŞME RAPORU

Uyumlu modeller

Sonuçlar yerel VRAM uyumunu daha yavaş sistem belleği aktarımından ayırır.

48Yerel
3Aktarım
8Yükseltme

Qwen3 0.6B

0.6Bllama.cpp

Qwen · Güven: orta

Yerel uyum
Model belleği0,9 / 29,4 GB
Tahmini hız
452,9–685,2 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · Güven: orta

Yerel uyum
Model belleği1,3 / 29,4 GB
Tahmini hız
423–640 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · Güven: orta

Yerel uyum
Model belleği1,3 / 29,4 GB
Tahmini hız
423–640 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · Güven: orta

Yerel uyum
Model belleği1,5 / 29,4 GB
Tahmini hız
355,1–537,2 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · Güven: orta

Yerel uyum
Model belleği2,4 / 29,4 GB
Tahmini hız
248,2–375,5 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · Güven: orta

Yerel uyum
Model belleği2,4 / 29,4 GB
Tahmini hız
256,4–387,8 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · Güven: orta

Yerel uyum
Model belleği2,6 / 29,4 GB
Tahmini hız
241–364,5 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · Güven: orta

Yerel uyum
Model belleği2,9 / 29,4 GB
Tahmini hız
221,9–335,8 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · Güven: orta

Yerel uyum
Model belleği3 / 29,4 GB
Tahmini hız
215,6–326,2 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · Güven: orta

Yerel uyum
Model belleği3,3 / 29,4 GB
Tahmini hız
200,2–302,9 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · Güven: orta

Yerel uyum
Model belleği3,5 / 29,4 GB
Tahmini hız
192–290,5 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · Güven: orta

Yerel uyum
Model belleği4 / 29,4 GB
Tahmini hız
173–261,7 token/sn
Niceleme
Q4
Bağlam
8K
En az RAM
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

Aralıklar çalışma ortamı yükünü ve işletim sistemi payını içerir. Gerçek performans model, arka uç, sürücü, sıcaklık ve isteme göre değişir.

HESAPLAMA YÖNTEMİ

Varsayımları açık bir uyum sonucu

Tahmin; ağırlıkları, bağlamı, çalışma yükünü ve bellek yapısını ayrı sınırlar olarak ele alır.

Etiketlerden önce ağırlıklar

Her profil nicelenmiş ağırlık boyutuyla başlar ve parametre sayısını VRAM'e eşitlemeden çalışma payı ekler.

Bağlamın gerçek bir maliyeti vardır

Daha uzun bağlam KV önbelleğini büyütür. Aynı model bağlam arttıkça yerel uyumdan aktarıma geçebilir.

Aktarım yerel çalışma değildir

Sistem RAM'i aktarımı çalışsa bile hız ve gecikme çok farklı olduğundan ayrı gösterilir.

SIK SORULAN SORULAR

Yerel yapay zekâ donanımı soruları

8B dil modeli ne kadar VRAM ister?

Q4 sürümü temel çalışma yüküyle genellikle yaklaşık 5–7 GB ister. Uzun bağlam, büyük toplu işlem veya yüksek hassasiyet 8 GB'ı aşabilir.

Apple birleşik belleği GPU VRAM'iyle aynı mı?

Hayır. CPU ve GPU tek bellek havuzunu paylaşır. Bu büyük modelleri sığdırır, ancak macOS ve diğer işlemler için yine pay bırakılmalıdır.

Bellek aktarımı ne demektir?

Modelin bir kısmı sistem RAM'inde kalır ve CPU ya da PCIe üzerinden taşınır. Model açılabilir ancak tamamen GPU belleğinde çalışmaktan genellikle çok daha yavaştır.

Hız aralıkları kıyaslama sonucu mu?

Hayır, bunlar temkinli model tahminleridir. Kesin hız çalışma ortamı, çekirdek desteği, model yapısı, sürücü, soğutma ve iş yüküne bağlıdır.