Qwen3 0.6B
0.6Bllama.cppQwen · Confianza: media
- Velocidad estimada
- 452,9–685,2 tokens/s
- Cuantización
- Q4
- Contexto
- 8K
- RAM mínima
- 16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufCOMPATIBILIDAD DE IA LOCAL
Encuentra modelos locales de lenguaje, código, imagen y video para tu GPU o Mac con Apple Silicon.
La capacidad y la velocidad son estimaciones modeladas, no garantías. Confirma el entorno, el controlador y la versión del modelo antes de comprar hardware.
TU EQUIPO
Define la memoria disponible y la carga de trabajo de esta ejecución.
89 perfiles de hardware · 92 modelos · verificado el 2026-08-23
INFORME DE COMPATIBILIDAD
Los resultados separan el ajuste nativo en VRAM de la descarga más lenta a RAM.
Qwen · Confianza: media
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLlama · Confianza: media
llama-cli -m ./models/llama-3-2-1b-q4_K_M.ggufGemma · Confianza: media
llama-cli -m ./models/gemma-3-1b-q4_K_M.ggufQwen · Confianza: media
llama-cli -m ./models/qwen3-1.7b-q4_K_M.ggufLlama · Confianza: media
llama-cli -m ./models/llama-3-2-3b-q4_K_M.ggufHugging Face · Confianza: media
llama-cli -m ./models/smollm3-3b-q4_K_M.ggufMistral · Confianza: media
llama-cli -m ./models/ministral-3b-q4_K_M.ggufMicrosoft · Confianza: media
llama-cli -m ./models/phi-4-mini-q4_K_M.ggufMicrosoft · Confianza: media
llama-cli -m ./models/phi-3.5-mini-q4_K_M.ggufQwen · Confianza: media
llama-cli -m ./models/qwen3-4b-q4_K_M.ggufGemma · Confianza: media
llama-cli -m ./models/gemma-3-4b-q4_K_M.ggufGemma · Confianza: media
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.ggufLos rangos incluyen la sobrecarga del entorno y una reserva del sistema. El rendimiento varía según modelo, backend, controlador, temperatura y prompt.
MÉTODO DE CÁLCULO
La estimación trata por separado pesos, contexto, sobrecarga del entorno y topología de memoria.
Cada perfil parte del tamaño de los pesos cuantizados y suma margen de ejecución, sin equiparar parámetros con VRAM.
Un contexto mayor aumenta la caché KV. El mismo modelo puede pasar de nativo a descarga al crecer el contexto.
La descarga a RAM se muestra aparte porque puede funcionar con una experiencia de velocidad y latencia muy distinta.
PREGUNTAS FRECUENTES
Una versión Q4 suele necesitar unos 5–7 GB con la sobrecarga básica. Un contexto largo, lotes mayores o más precisión pueden superar los 8 GB.
No. CPU y GPU comparten una memoria. Esto ayuda con modelos grandes, pero macOS y otros procesos siguen necesitando una reserva.
Parte del modelo permanece en RAM y pasa por la CPU o PCIe. Puede iniciar el modelo, pero suele ser mucho más lento que mantenerlo en la memoria de la GPU.
No, son estimaciones conservadoras. La velocidad exacta depende del entorno, los kernels, el modelo, el controlador, la refrigeración y la carga.