Qwen3 0.6B
0.6Bllama.cppQwen · Confiance : moyenne
- Vitesse estimée
- 452,9–685,2 jetons/s
- Quantification
- Q4
- Contexte
- 8K
- RAM minimale
- 16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufCOMPATIBILITÉ IA LOCALE
Associez votre GPU ou Mac Apple Silicon à des modèles locaux de langage, code, image et vidéo.
La capacité et la vitesse sont des estimations modélisées, sans garantie. Vérifiez le runtime, le pilote et la version du modèle avant tout achat.
VOTRE MACHINE
Définissez la mémoire disponible et la charge utile pour cette exécution.
89 profils matériels · 92 modèles · vérifié le 2026-08-23
RAPPORT DE COMPATIBILITÉ
Les résultats séparent l'exécution native en VRAM du transfert plus lent vers la RAM.
Qwen · Confiance : moyenne
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLlama · Confiance : moyenne
llama-cli -m ./models/llama-3-2-1b-q4_K_M.ggufGemma · Confiance : moyenne
llama-cli -m ./models/gemma-3-1b-q4_K_M.ggufQwen · Confiance : moyenne
llama-cli -m ./models/qwen3-1.7b-q4_K_M.ggufLlama · Confiance : moyenne
llama-cli -m ./models/llama-3-2-3b-q4_K_M.ggufHugging Face · Confiance : moyenne
llama-cli -m ./models/smollm3-3b-q4_K_M.ggufMistral · Confiance : moyenne
llama-cli -m ./models/ministral-3b-q4_K_M.ggufMicrosoft · Confiance : moyenne
llama-cli -m ./models/phi-4-mini-q4_K_M.ggufMicrosoft · Confiance : moyenne
llama-cli -m ./models/phi-3.5-mini-q4_K_M.ggufQwen · Confiance : moyenne
llama-cli -m ./models/qwen3-4b-q4_K_M.ggufGemma · Confiance : moyenne
llama-cli -m ./models/gemma-3-4b-q4_K_M.ggufGemma · Confiance : moyenne
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.ggufLes plages incluent la surcharge du runtime et une réserve système. Les performances varient selon le modèle, le backend, le pilote, la température et le prompt.
MÉTHODE DE CALCUL
L'estimation traite séparément les poids, le contexte, la surcharge d'exécution et la topologie mémoire.
Chaque profil part de l'empreinte des poids quantifiés et ajoute une marge d'exécution, sans confondre paramètres et VRAM.
Un contexte plus long augmente le cache KV. Un même modèle peut passer du natif au transfert lorsque le contexte grandit.
Le transfert vers la RAM est affiché séparément car il peut fonctionner avec une vitesse et une latence très différentes.
QUESTIONS COURANTES
Une version Q4 demande souvent environ 5 à 7 Go avec la surcharge de base. Un contexte long, un lot plus grand ou une précision supérieure peuvent dépasser 8 Go.
Non. Le CPU et le GPU partagent une même mémoire. Cela aide les grands modèles, mais macOS et les autres processus ont toujours besoin d'une réserve.
Une partie du modèle reste en RAM et passe par le CPU ou le bus PCIe. Le modèle peut démarrer, mais il est généralement bien plus lent que s'il tenait dans la VRAM.
Non, ce sont des estimations prudentes. La vitesse exacte dépend du runtime, des noyaux, du modèle, du pilote, du refroidissement et de la charge.