Qwen3 0.6B
0.6Bllama.cppQwen · 置信度: 中
- 估算速度
- 452.9–685.2 词元/秒
- 量化
- Q4
- 上下文
- 8K
- 最低内存
- 16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf本地 AI 兼容性
根据你的 GPU 或 Apple 芯片 Mac,匹配可本地运行的语言、编程、图像与视频模型。
容量与速度为模型化估算,并非保证。购买硬件前请确认运行时、驱动与具体模型版本要求。
你的设备
设置本次运行所需的内存预算与工作负载。
89 个硬件预设 · 92 个模型 · 核验于 2026-08-23
匹配报告
结果会区分显存原生可跑与速度更慢的系统内存卸载。
Qwen · 置信度: 中
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLlama · 置信度: 中
llama-cli -m ./models/llama-3-2-1b-q4_K_M.ggufGemma · 置信度: 中
llama-cli -m ./models/gemma-3-1b-q4_K_M.ggufQwen · 置信度: 中
llama-cli -m ./models/qwen3-1.7b-q4_K_M.ggufLlama · 置信度: 中
llama-cli -m ./models/llama-3-2-3b-q4_K_M.ggufHugging Face · 置信度: 中
llama-cli -m ./models/smollm3-3b-q4_K_M.ggufMistral · 置信度: 中
llama-cli -m ./models/ministral-3b-q4_K_M.ggufMicrosoft · 置信度: 中
llama-cli -m ./models/phi-4-mini-q4_K_M.ggufMicrosoft · 置信度: 中
llama-cli -m ./models/phi-3.5-mini-q4_K_M.ggufQwen · 置信度: 中
llama-cli -m ./models/qwen3-4b-q4_K_M.ggufGemma · 置信度: 中
llama-cli -m ./models/gemma-3-4b-q4_K_M.ggufGemma · 置信度: 中
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf区间已计入运行时开销和系统预留。实际性能还会受模型构建、后端、驱动、散热与提示词影响。
计算方法
估算会分别处理权重、上下文、运行时开销与内存架构,不把它们混成一个数字。
每个配置从量化权重占用开始,并加入运行时余量,而不是直接把参数量等同于显存。
更长上下文会增加 KV 缓存压力。同一模型可能因上下文增长,从原生可跑变成需要卸载。
系统内存卸载单独展示,因为它虽能启动模型,但速度和延迟体验通常明显不同。
常见问题
Q4 版本加上基本运行时开销,通常需要约 5–7 GB。更长上下文、更大批次或更高精度可能会超过 8 GB。
不等同。Apple 芯片由 CPU 与 GPU 共享同一内存池,能更灵活地容纳大模型,但 macOS 和其他进程仍需保留内存。
部分模型保留在系统内存,并通过 CPU 或 PCIe 路径传输。这样可能让模型成功启动,但通常比全部放在显存中慢很多。
不是,它们是偏保守的模型化区间。实际速度取决于运行时、内核支持、模型构建、驱动、散热与工作负载。