Qwen3 0.6B
0.6Bllama.cppQwen · Надёжность: средняя
- Расчётная скорость
- 452,9–685,2 токенов/с
- Квантизация
- Q4
- Контекст
- 8K
- Минимум ОЗУ
- 16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufСОВМЕСТИМОСТЬ С ЛОКАЛЬНЫМ ИИ
Подберите языковые, программные, графические и видеомодели для своей видеокарты или Mac с Apple Silicon.
Объём и скорость являются расчётными оценками, а не гарантией. Перед покупкой проверьте требования среды, драйвера и версии модели.
ВАША СИСТЕМА
Задайте доступную память и тип нагрузки для этого запуска.
Профилей: 89 · моделей: 92 · проверено 2026-08-23
ОТЧЁТ О СОВМЕСТИМОСТИ
Нативное размещение в видеопамяти отделено от более медленной выгрузки в ОЗУ.
Qwen · Надёжность: средняя
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLlama · Надёжность: средняя
llama-cli -m ./models/llama-3-2-1b-q4_K_M.ggufGemma · Надёжность: средняя
llama-cli -m ./models/gemma-3-1b-q4_K_M.ggufQwen · Надёжность: средняя
llama-cli -m ./models/qwen3-1.7b-q4_K_M.ggufLlama · Надёжность: средняя
llama-cli -m ./models/llama-3-2-3b-q4_K_M.ggufHugging Face · Надёжность: средняя
llama-cli -m ./models/smollm3-3b-q4_K_M.ggufMistral · Надёжность: средняя
llama-cli -m ./models/ministral-3b-q4_K_M.ggufMicrosoft · Надёжность: средняя
llama-cli -m ./models/phi-4-mini-q4_K_M.ggufMicrosoft · Надёжность: средняя
llama-cli -m ./models/phi-3.5-mini-q4_K_M.ggufQwen · Надёжность: средняя
llama-cli -m ./models/qwen3-4b-q4_K_M.ggufGemma · Надёжность: средняя
llama-cli -m ./models/gemma-3-4b-q4_K_M.ggufGemma · Надёжность: средняя
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.ggufДиапазоны учитывают среду выполнения и резерв ОС. Реальная скорость зависит от сборки модели, бэкенда, драйвера, охлаждения и запроса.
МЕТОДИКА РАСЧЁТА
Веса, контекст, накладные расходы и архитектура памяти рассматриваются как отдельные ограничения.
Расчёт начинается с объёма квантованных весов и добавляет запас для среды, не приравнивая параметры к видеопамяти.
Длинный контекст увеличивает KV-кэш. Одна модель может перейти от нативного режима к выгрузке при росте контекста.
Выгрузка в ОЗУ показана отдельно: она может запустить модель, но скорость и задержка будут заметно отличаться.
ЧАСТЫЕ ВОПРОСЫ
Сборке Q4 обычно нужно около 5–7 ГБ с базовыми накладными расходами. Длинный контекст, большой пакет или высокая точность могут превысить 8 ГБ.
Нет. CPU и GPU используют единый пул памяти. Это помогает вместить крупные модели, но macOS и другим процессам всё равно нужен резерв.
Часть модели остаётся в системной памяти и передаётся через CPU или PCIe. Модель может запуститься, но обычно намного медленнее полного размещения в видеопамяти.
Нет, это консервативные расчётные диапазоны. Точная скорость зависит от среды, ядер, сборки модели, драйвера, охлаждения и нагрузки.