COMPATIBILIDADE DE IA LOCAL

AI Rig Match

Encontre modelos locais de linguagem, código, imagem e vídeo para sua GPU ou Mac com Apple Silicon.

Capacidade e velocidade são estimativas modeladas, não garantias. Confirme o runtime, o driver e a versão do modelo antes de comprar hardware.

SUA MÁQUINA

Crie um perfil de hardware

Defina a memória disponível e a carga de trabalho desta execução.

89 perfis de hardware · 92 modelos · verificado em 2026-08-23

RELATÓRIO DE COMPATIBILIDADE

Modelos compatíveis

Os resultados separam o uso nativo da VRAM da transferência mais lenta para a RAM.

48Nativo
3Transferência
8Upgrade

Qwen3 0.6B

0.6Bllama.cpp

Qwen · Confiança: média

Ajuste nativo
Memória do modelo0,9 / 29,4 GB
Velocidade estimada
452,9–685,2 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · Confiança: média

Ajuste nativo
Memória do modelo1,3 / 29,4 GB
Velocidade estimada
423–640 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · Confiança: média

Ajuste nativo
Memória do modelo1,3 / 29,4 GB
Velocidade estimada
423–640 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · Confiança: média

Ajuste nativo
Memória do modelo1,5 / 29,4 GB
Velocidade estimada
355,1–537,2 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · Confiança: média

Ajuste nativo
Memória do modelo2,4 / 29,4 GB
Velocidade estimada
248,2–375,5 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · Confiança: média

Ajuste nativo
Memória do modelo2,4 / 29,4 GB
Velocidade estimada
256,4–387,8 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · Confiança: média

Ajuste nativo
Memória do modelo2,6 / 29,4 GB
Velocidade estimada
241–364,5 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · Confiança: média

Ajuste nativo
Memória do modelo2,9 / 29,4 GB
Velocidade estimada
221,9–335,8 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · Confiança: média

Ajuste nativo
Memória do modelo3 / 29,4 GB
Velocidade estimada
215,6–326,2 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · Confiança: média

Ajuste nativo
Memória do modelo3,3 / 29,4 GB
Velocidade estimada
200,2–302,9 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · Confiança: média

Ajuste nativo
Memória do modelo3,5 / 29,4 GB
Velocidade estimada
192–290,5 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · Confiança: média

Ajuste nativo
Memória do modelo4 / 29,4 GB
Velocidade estimada
173–261,7 tokens/s
Quantização
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

Os intervalos incluem sobrecarga do runtime e reserva do sistema. O desempenho varia com modelo, backend, driver, temperatura e prompt.

MÉTODO DE CÁLCULO

Um resultado com as premissas expostas

A estimativa trata pesos, contexto, sobrecarga de execução e topologia de memória como limites separados.

Pesos antes dos rótulos

Cada perfil parte do tamanho dos pesos quantizados e soma uma margem de execução, sem igualar parâmetros a VRAM.

Contexto tem custo real

Um contexto maior aumenta o cache KV. O mesmo modelo pode passar de nativo para transferência quando o contexto cresce.

Transferência não é execução nativa

A transferência para RAM aparece separada porque pode funcionar com velocidade e latência muito diferentes.

DÚVIDAS FREQUENTES

Perguntas sobre hardware para IA local

Quanta VRAM um modelo de linguagem 8B precisa?

Uma versão Q4 costuma precisar de cerca de 5–7 GB com a sobrecarga básica. Contexto longo, lotes maiores ou maior precisão podem passar de 8 GB.

A memória unificada da Apple é igual à VRAM?

Não. CPU e GPU compartilham um único conjunto de memória. Isso ajuda modelos grandes, mas o macOS e outros processos ainda precisam de uma reserva.

O que significa transferir para a RAM?

Parte do modelo fica na RAM e passa pela CPU ou PCIe. O modelo pode iniciar, mas costuma ser muito mais lento do que mantê-lo na memória da GPU.

Os intervalos de velocidade são benchmarks?

Não, são estimativas conservadoras. A velocidade exata depende do runtime, kernels, modelo, driver, refrigeração e carga.