Qwen3 0.6B
0.6Bllama.cppQwen · 신뢰도: 보통
- 예상 속도
- 452.9–685.2 토큰/초
- 양자화
- Q4
- 컨텍스트
- 8K
- 최소 RAM
- 16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf로컬 AI 호환성
GPU 또는 Apple Silicon Mac에서 실행할 수 있는 언어, 코딩, 이미지, 비디오 모델을 찾아보세요.
용량과 속도는 모델 기반 추정치이며 보장값이 아닙니다. 하드웨어 구매 전 런타임, 드라이버, 모델 버전 요구 사항을 확인하세요.
내 장비
이번 실행에 필요한 메모리 예산과 작업 유형을 설정하세요.
하드웨어 프리셋 89개 · 모델 92개 · 2026-08-23 확인
매칭 보고서
VRAM 기본 실행과 더 느린 시스템 메모리 오프로딩을 구분합니다.
Qwen · 신뢰도: 보통
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLlama · 신뢰도: 보통
llama-cli -m ./models/llama-3-2-1b-q4_K_M.ggufGemma · 신뢰도: 보통
llama-cli -m ./models/gemma-3-1b-q4_K_M.ggufQwen · 신뢰도: 보통
llama-cli -m ./models/qwen3-1.7b-q4_K_M.ggufLlama · 신뢰도: 보통
llama-cli -m ./models/llama-3-2-3b-q4_K_M.ggufHugging Face · 신뢰도: 보통
llama-cli -m ./models/smollm3-3b-q4_K_M.ggufMistral · 신뢰도: 보통
llama-cli -m ./models/ministral-3b-q4_K_M.ggufMicrosoft · 신뢰도: 보통
llama-cli -m ./models/phi-4-mini-q4_K_M.ggufMicrosoft · 신뢰도: 보통
llama-cli -m ./models/phi-3.5-mini-q4_K_M.ggufQwen · 신뢰도: 보통
llama-cli -m ./models/qwen3-4b-q4_K_M.ggufGemma · 신뢰도: 보통
llama-cli -m ./models/gemma-3-4b-q4_K_M.ggufGemma · 신뢰도: 보통
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf범위에는 런타임 오버헤드와 OS 예약 공간이 포함됩니다. 실제 성능은 모델 빌드, 백엔드, 드라이버, 발열, 프롬프트에 따라 달라집니다.
계산 방식
가중치, 컨텍스트, 런타임 오버헤드, 메모리 구조를 각각 별도의 제약으로 계산합니다.
파라미터 수를 VRAM과 같다고 보지 않고 양자화 가중치 용량에 런타임 여유를 더합니다.
긴 컨텍스트는 KV 캐시 부담을 늘려 같은 모델도 기본 실행에서 오프로딩 상태로 바뀔 수 있습니다.
시스템 메모리 오프로딩은 실행은 가능해도 속도와 지연이 크게 달라 별도로 표시합니다.
자주 묻는 질문
Q4 빌드는 기본 런타임 오버헤드를 포함해 보통 약 5~7GB가 필요합니다. 긴 컨텍스트, 큰 배치, 높은 정밀도에서는 8GB를 넘을 수 있습니다.
아닙니다. CPU와 GPU가 하나의 메모리 풀을 공유해 큰 모델을 담기 쉽지만 macOS와 다른 프로세스를 위한 여유 공간은 필요합니다.
모델 일부를 시스템 RAM에 두고 CPU 또는 PCIe 경로로 이동합니다. 모델을 실행할 수는 있지만 전체를 GPU 메모리에 둘 때보다 보통 훨씬 느립니다.
벤치마크 주장이 아닌 보수적인 모델 추정치입니다. 실제 속도는 런타임, 커널 지원, 모델 빌드, 드라이버, 냉각, 작업 유형에 따라 달라집니다.