Qwen3 0.6B
0.6Bllama.cppQwen · Confiança: média
- Velocidade estimada
- 452,9–685,2 tokens/s
- Quantização
- Q4
- Contexto
- 8K
- RAM mínima
- 16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufCOMPATIBILIDADE DE IA LOCAL
Encontre modelos locais de linguagem, código, imagem e vídeo para sua GPU ou Mac com Apple Silicon.
Capacidade e velocidade são estimativas modeladas, não garantias. Confirme o runtime, o driver e a versão do modelo antes de comprar hardware.
SUA MÁQUINA
Defina a memória disponível e a carga de trabalho desta execução.
89 perfis de hardware · 92 modelos · verificado em 2026-08-23
RELATÓRIO DE COMPATIBILIDADE
Os resultados separam o uso nativo da VRAM da transferência mais lenta para a RAM.
Qwen · Confiança: média
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLlama · Confiança: média
llama-cli -m ./models/llama-3-2-1b-q4_K_M.ggufGemma · Confiança: média
llama-cli -m ./models/gemma-3-1b-q4_K_M.ggufQwen · Confiança: média
llama-cli -m ./models/qwen3-1.7b-q4_K_M.ggufLlama · Confiança: média
llama-cli -m ./models/llama-3-2-3b-q4_K_M.ggufHugging Face · Confiança: média
llama-cli -m ./models/smollm3-3b-q4_K_M.ggufMistral · Confiança: média
llama-cli -m ./models/ministral-3b-q4_K_M.ggufMicrosoft · Confiança: média
llama-cli -m ./models/phi-4-mini-q4_K_M.ggufMicrosoft · Confiança: média
llama-cli -m ./models/phi-3.5-mini-q4_K_M.ggufQwen · Confiança: média
llama-cli -m ./models/qwen3-4b-q4_K_M.ggufGemma · Confiança: média
llama-cli -m ./models/gemma-3-4b-q4_K_M.ggufGemma · Confiança: média
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.ggufOs intervalos incluem sobrecarga do runtime e reserva do sistema. O desempenho varia com modelo, backend, driver, temperatura e prompt.
MÉTODO DE CÁLCULO
A estimativa trata pesos, contexto, sobrecarga de execução e topologia de memória como limites separados.
Cada perfil parte do tamanho dos pesos quantizados e soma uma margem de execução, sem igualar parâmetros a VRAM.
Um contexto maior aumenta o cache KV. O mesmo modelo pode passar de nativo para transferência quando o contexto cresce.
A transferência para RAM aparece separada porque pode funcionar com velocidade e latência muito diferentes.
DÚVIDAS FREQUENTES
Uma versão Q4 costuma precisar de cerca de 5–7 GB com a sobrecarga básica. Contexto longo, lotes maiores ou maior precisão podem passar de 8 GB.
Não. CPU e GPU compartilham um único conjunto de memória. Isso ajuda modelos grandes, mas o macOS e outros processos ainda precisam de uma reserva.
Parte do modelo fica na RAM e passa pela CPU ou PCIe. O modelo pode iniciar, mas costuma ser muito mais lento do que mantê-lo na memória da GPU.
Não, são estimativas conservadoras. A velocidade exata depende do runtime, kernels, modelo, driver, refrigeração e carga.