COMPATIBILIDAD DE IA LOCAL

AI Rig Match

Encuentra modelos locales de lenguaje, código, imagen y video para tu GPU o Mac con Apple Silicon.

La capacidad y la velocidad son estimaciones modeladas, no garantías. Confirma el entorno, el controlador y la versión del modelo antes de comprar hardware.

TU EQUIPO

Crea un perfil de hardware

Define la memoria disponible y la carga de trabajo de esta ejecución.

89 perfiles de hardware · 92 modelos · verificado el 2026-08-23

INFORME DE COMPATIBILIDAD

Modelos compatibles

Los resultados separan el ajuste nativo en VRAM de la descarga más lenta a RAM.

48Nativo
3Descarga
8Mejora

Qwen3 0.6B

0.6Bllama.cpp

Qwen · Confianza: media

Ajuste nativo
Memoria del modelo0,9 / 29,4 GB
Velocidad estimada
452,9–685,2 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · Confianza: media

Ajuste nativo
Memoria del modelo1,3 / 29,4 GB
Velocidad estimada
423–640 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · Confianza: media

Ajuste nativo
Memoria del modelo1,3 / 29,4 GB
Velocidad estimada
423–640 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · Confianza: media

Ajuste nativo
Memoria del modelo1,5 / 29,4 GB
Velocidad estimada
355,1–537,2 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · Confianza: media

Ajuste nativo
Memoria del modelo2,4 / 29,4 GB
Velocidad estimada
248,2–375,5 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · Confianza: media

Ajuste nativo
Memoria del modelo2,4 / 29,4 GB
Velocidad estimada
256,4–387,8 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · Confianza: media

Ajuste nativo
Memoria del modelo2,6 / 29,4 GB
Velocidad estimada
241–364,5 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · Confianza: media

Ajuste nativo
Memoria del modelo2,9 / 29,4 GB
Velocidad estimada
221,9–335,8 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · Confianza: media

Ajuste nativo
Memoria del modelo3 / 29,4 GB
Velocidad estimada
215,6–326,2 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · Confianza: media

Ajuste nativo
Memoria del modelo3,3 / 29,4 GB
Velocidad estimada
200,2–302,9 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · Confianza: media

Ajuste nativo
Memoria del modelo3,5 / 29,4 GB
Velocidad estimada
192–290,5 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · Confianza: media

Ajuste nativo
Memoria del modelo4 / 29,4 GB
Velocidad estimada
173–261,7 tokens/s
Cuantización
Q4
Contexto
8K
RAM mínima
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

Los rangos incluyen la sobrecarga del entorno y una reserva del sistema. El rendimiento varía según modelo, backend, controlador, temperatura y prompt.

MÉTODO DE CÁLCULO

Un resultado con sus supuestos a la vista

La estimación trata por separado pesos, contexto, sobrecarga del entorno y topología de memoria.

Pesos antes que etiquetas

Cada perfil parte del tamaño de los pesos cuantizados y suma margen de ejecución, sin equiparar parámetros con VRAM.

El contexto tiene un coste real

Un contexto mayor aumenta la caché KV. El mismo modelo puede pasar de nativo a descarga al crecer el contexto.

La descarga no es ejecución nativa

La descarga a RAM se muestra aparte porque puede funcionar con una experiencia de velocidad y latencia muy distinta.

PREGUNTAS FRECUENTES

Preguntas sobre hardware para IA local

¿Cuánta VRAM necesita un modelo de lenguaje 8B?

Una versión Q4 suele necesitar unos 5–7 GB con la sobrecarga básica. Un contexto largo, lotes mayores o más precisión pueden superar los 8 GB.

¿La memoria unificada de Apple es igual a la VRAM?

No. CPU y GPU comparten una memoria. Esto ayuda con modelos grandes, pero macOS y otros procesos siguen necesitando una reserva.

¿Qué significa descargar a RAM?

Parte del modelo permanece en RAM y pasa por la CPU o PCIe. Puede iniciar el modelo, pero suele ser mucho más lento que mantenerlo en la memoria de la GPU.

¿Los rangos de velocidad son benchmarks?

No, son estimaciones conservadoras. La velocidad exacta depende del entorno, los kernels, el modelo, el controlador, la refrigeración y la carga.