СОВМЕСТИМОСТЬ С ЛОКАЛЬНЫМ ИИ

AI Rig Match

Подберите языковые, программные, графические и видеомодели для своей видеокарты или Mac с Apple Silicon.

Объём и скорость являются расчётными оценками, а не гарантией. Перед покупкой проверьте требования среды, драйвера и версии модели.

ВАША СИСТЕМА

Создайте профиль оборудования

Задайте доступную память и тип нагрузки для этого запуска.

Профилей: 89 · моделей: 92 · проверено 2026-08-23

ОТЧЁТ О СОВМЕСТИМОСТИ

Совместимые модели

Нативное размещение в видеопамяти отделено от более медленной выгрузки в ОЗУ.

48Нативно
3Выгрузка
8Апгрейд

Qwen3 0.6B

0.6Bllama.cpp

Qwen · Надёжность: средняя

Помещается нативно
Память модели0,9 / 29,4 GB
Расчётная скорость
452,9–685,2 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · Надёжность: средняя

Помещается нативно
Память модели1,3 / 29,4 GB
Расчётная скорость
423–640 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · Надёжность: средняя

Помещается нативно
Память модели1,3 / 29,4 GB
Расчётная скорость
423–640 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · Надёжность: средняя

Помещается нативно
Память модели1,5 / 29,4 GB
Расчётная скорость
355,1–537,2 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · Надёжность: средняя

Помещается нативно
Память модели2,4 / 29,4 GB
Расчётная скорость
248,2–375,5 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · Надёжность: средняя

Помещается нативно
Память модели2,4 / 29,4 GB
Расчётная скорость
256,4–387,8 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · Надёжность: средняя

Помещается нативно
Память модели2,6 / 29,4 GB
Расчётная скорость
241–364,5 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · Надёжность: средняя

Помещается нативно
Память модели2,9 / 29,4 GB
Расчётная скорость
221,9–335,8 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · Надёжность: средняя

Помещается нативно
Память модели3 / 29,4 GB
Расчётная скорость
215,6–326,2 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · Надёжность: средняя

Помещается нативно
Память модели3,3 / 29,4 GB
Расчётная скорость
200,2–302,9 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · Надёжность: средняя

Помещается нативно
Память модели3,5 / 29,4 GB
Расчётная скорость
192–290,5 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · Надёжность: средняя

Помещается нативно
Память модели4 / 29,4 GB
Расчётная скорость
173–261,7 токенов/с
Квантизация
Q4
Контекст
8K
Минимум ОЗУ
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

Диапазоны учитывают среду выполнения и резерв ОС. Реальная скорость зависит от сборки модели, бэкенда, драйвера, охлаждения и запроса.

МЕТОДИКА РАСЧЁТА

Результат с открытыми допущениями

Веса, контекст, накладные расходы и архитектура памяти рассматриваются как отдельные ограничения.

Сначала веса, потом названия

Расчёт начинается с объёма квантованных весов и добавляет запас для среды, не приравнивая параметры к видеопамяти.

Контекст тоже занимает память

Длинный контекст увеличивает KV-кэш. Одна модель может перейти от нативного режима к выгрузке при росте контекста.

Выгрузка не равна нативному режиму

Выгрузка в ОЗУ показана отдельно: она может запустить модель, но скорость и задержка будут заметно отличаться.

ЧАСТЫЕ ВОПРОСЫ

Вопросы об оборудовании для локального ИИ

Сколько видеопамяти нужно языковой модели 8B?

Сборке Q4 обычно нужно около 5–7 ГБ с базовыми накладными расходами. Длинный контекст, большой пакет или высокая точность могут превысить 8 ГБ.

Общая память Apple равна видеопамяти GPU?

Нет. CPU и GPU используют единый пул памяти. Это помогает вместить крупные модели, но macOS и другим процессам всё равно нужен резерв.

Что означает выгрузка в ОЗУ?

Часть модели остаётся в системной памяти и передаётся через CPU или PCIe. Модель может запуститься, но обычно намного медленнее полного размещения в видеопамяти.

Диапазоны скорости получены в тестах?

Нет, это консервативные расчётные диапазоны. Точная скорость зависит от среды, ядер, сборки модели, драйвера, охлаждения и нагрузки.