COMPATIBILITÉ IA LOCALE

AI Rig Match

Associez votre GPU ou Mac Apple Silicon à des modèles locaux de langage, code, image et vidéo.

La capacité et la vitesse sont des estimations modélisées, sans garantie. Vérifiez le runtime, le pilote et la version du modèle avant tout achat.

VOTRE MACHINE

Créer un profil matériel

Définissez la mémoire disponible et la charge utile pour cette exécution.

89 profils matériels · 92 modèles · vérifié le 2026-08-23

RAPPORT DE COMPATIBILITÉ

Modèles compatibles

Les résultats séparent l'exécution native en VRAM du transfert plus lent vers la RAM.

48Natif
3Transfert
8Mise à niveau

Qwen3 0.6B

0.6Bllama.cpp

Qwen · Confiance : moyenne

Compatible en natif
Mémoire du modèle0,9 / 29,4 GB
Vitesse estimée
452,9–685,2 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · Confiance : moyenne

Compatible en natif
Mémoire du modèle1,3 / 29,4 GB
Vitesse estimée
423–640 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · Confiance : moyenne

Compatible en natif
Mémoire du modèle1,3 / 29,4 GB
Vitesse estimée
423–640 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · Confiance : moyenne

Compatible en natif
Mémoire du modèle1,5 / 29,4 GB
Vitesse estimée
355,1–537,2 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · Confiance : moyenne

Compatible en natif
Mémoire du modèle2,4 / 29,4 GB
Vitesse estimée
248,2–375,5 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · Confiance : moyenne

Compatible en natif
Mémoire du modèle2,4 / 29,4 GB
Vitesse estimée
256,4–387,8 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · Confiance : moyenne

Compatible en natif
Mémoire du modèle2,6 / 29,4 GB
Vitesse estimée
241–364,5 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · Confiance : moyenne

Compatible en natif
Mémoire du modèle2,9 / 29,4 GB
Vitesse estimée
221,9–335,8 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · Confiance : moyenne

Compatible en natif
Mémoire du modèle3 / 29,4 GB
Vitesse estimée
215,6–326,2 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · Confiance : moyenne

Compatible en natif
Mémoire du modèle3,3 / 29,4 GB
Vitesse estimée
200,2–302,9 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · Confiance : moyenne

Compatible en natif
Mémoire du modèle3,5 / 29,4 GB
Vitesse estimée
192–290,5 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · Confiance : moyenne

Compatible en natif
Mémoire du modèle4 / 29,4 GB
Vitesse estimée
173–261,7 jetons/s
Quantification
Q4
Contexte
8K
RAM minimale
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

Les plages incluent la surcharge du runtime et une réserve système. Les performances varient selon le modèle, le backend, le pilote, la température et le prompt.

MÉTHODE DE CALCUL

Un résultat dont les hypothèses sont visibles

L'estimation traite séparément les poids, le contexte, la surcharge d'exécution et la topologie mémoire.

Les poids avant les étiquettes

Chaque profil part de l'empreinte des poids quantifiés et ajoute une marge d'exécution, sans confondre paramètres et VRAM.

Le contexte a un coût réel

Un contexte plus long augmente le cache KV. Un même modèle peut passer du natif au transfert lorsque le contexte grandit.

Le transfert n'est pas du natif

Le transfert vers la RAM est affiché séparément car il peut fonctionner avec une vitesse et une latence très différentes.

QUESTIONS COURANTES

Questions sur le matériel IA local

Combien de VRAM faut-il pour un modèle de langage 8B ?

Une version Q4 demande souvent environ 5 à 7 Go avec la surcharge de base. Un contexte long, un lot plus grand ou une précision supérieure peuvent dépasser 8 Go.

La mémoire unifiée Apple équivaut-elle à la VRAM ?

Non. Le CPU et le GPU partagent une même mémoire. Cela aide les grands modèles, mais macOS et les autres processus ont toujours besoin d'une réserve.

Que signifie le transfert mémoire ?

Une partie du modèle reste en RAM et passe par le CPU ou le bus PCIe. Le modèle peut démarrer, mais il est généralement bien plus lent que s'il tenait dans la VRAM.

Les plages de vitesse sont-elles des benchmarks ?

Non, ce sont des estimations prudentes. La vitesse exacte dépend du runtime, des noyaux, du modèle, du pilote, du refroidissement et de la charge.