로컬 AI 호환성

AI Rig Match

GPU 또는 Apple Silicon Mac에서 실행할 수 있는 언어, 코딩, 이미지, 비디오 모델을 찾아보세요.

용량과 속도는 모델 기반 추정치이며 보장값이 아닙니다. 하드웨어 구매 전 런타임, 드라이버, 모델 버전 요구 사항을 확인하세요.

내 장비

하드웨어 프로필 만들기

이번 실행에 필요한 메모리 예산과 작업 유형을 설정하세요.

하드웨어 프리셋 89개 · 모델 92개 · 2026-08-23 확인

매칭 보고서

호환 모델

VRAM 기본 실행과 더 느린 시스템 메모리 오프로딩을 구분합니다.

48기본 실행
3오프로딩
8업그레이드

Qwen3 0.6B

0.6Bllama.cpp

Qwen · 신뢰도: 보통

VRAM 기본 실행
모델 메모리0.9 / 29.4 GB
예상 속도
452.9–685.2 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · 신뢰도: 보통

VRAM 기본 실행
모델 메모리1.3 / 29.4 GB
예상 속도
423–640 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · 신뢰도: 보통

VRAM 기본 실행
모델 메모리1.3 / 29.4 GB
예상 속도
423–640 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · 신뢰도: 보통

VRAM 기본 실행
모델 메모리1.5 / 29.4 GB
예상 속도
355.1–537.2 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · 신뢰도: 보통

VRAM 기본 실행
모델 메모리2.4 / 29.4 GB
예상 속도
248.2–375.5 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · 신뢰도: 보통

VRAM 기본 실행
모델 메모리2.4 / 29.4 GB
예상 속도
256.4–387.8 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · 신뢰도: 보통

VRAM 기본 실행
모델 메모리2.6 / 29.4 GB
예상 속도
241–364.5 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · 신뢰도: 보통

VRAM 기본 실행
모델 메모리2.9 / 29.4 GB
예상 속도
221.9–335.8 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · 신뢰도: 보통

VRAM 기본 실행
모델 메모리3 / 29.4 GB
예상 속도
215.6–326.2 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · 신뢰도: 보통

VRAM 기본 실행
모델 메모리3.3 / 29.4 GB
예상 속도
200.2–302.9 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · 신뢰도: 보통

VRAM 기본 실행
모델 메모리3.5 / 29.4 GB
예상 속도
192–290.5 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · 신뢰도: 보통

VRAM 기본 실행
모델 메모리4 / 29.4 GB
예상 속도
173–261.7 토큰/초
양자화
Q4
컨텍스트
8K
최소 RAM
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

범위에는 런타임 오버헤드와 OS 예약 공간이 포함됩니다. 실제 성능은 모델 빌드, 백엔드, 드라이버, 발열, 프롬프트에 따라 달라집니다.

계산 방식

가정을 공개하는 적합도 결과

가중치, 컨텍스트, 런타임 오버헤드, 메모리 구조를 각각 별도의 제약으로 계산합니다.

마케팅 명칭보다 가중치 우선

파라미터 수를 VRAM과 같다고 보지 않고 양자화 가중치 용량에 런타임 여유를 더합니다.

컨텍스트에도 비용이 듭니다

긴 컨텍스트는 KV 캐시 부담을 늘려 같은 모델도 기본 실행에서 오프로딩 상태로 바뀔 수 있습니다.

오프로딩은 기본 실행이 아닙니다

시스템 메모리 오프로딩은 실행은 가능해도 속도와 지연이 크게 달라 별도로 표시합니다.

자주 묻는 질문

로컬 AI 하드웨어 질문

8B 언어 모델에는 VRAM이 얼마나 필요한가요?

Q4 빌드는 기본 런타임 오버헤드를 포함해 보통 약 5~7GB가 필요합니다. 긴 컨텍스트, 큰 배치, 높은 정밀도에서는 8GB를 넘을 수 있습니다.

Apple 통합 메모리는 GPU VRAM과 같은가요?

아닙니다. CPU와 GPU가 하나의 메모리 풀을 공유해 큰 모델을 담기 쉽지만 macOS와 다른 프로세스를 위한 여유 공간은 필요합니다.

오프로딩이란 무엇인가요?

모델 일부를 시스템 RAM에 두고 CPU 또는 PCIe 경로로 이동합니다. 모델을 실행할 수는 있지만 전체를 GPU 메모리에 둘 때보다 보통 훨씬 느립니다.

속도 범위는 벤치마크 결과인가요?

벤치마크 주장이 아닌 보수적인 모델 추정치입니다. 실제 속도는 런타임, 커널 지원, 모델 빌드, 드라이버, 냉각, 작업 유형에 따라 달라집니다.