本地 AI 兼容性

AI Rig Match

根据你的 GPU 或 Apple 芯片 Mac,匹配可本地运行的语言、编程、图像与视频模型。

容量与速度为模型化估算,并非保证。购买硬件前请确认运行时、驱动与具体模型版本要求。

你的设备

建立硬件配置

设置本次运行所需的内存预算与工作负载。

89 个硬件预设 · 92 个模型 · 核验于 2026-08-23

匹配报告

兼容模型

结果会区分显存原生可跑与速度更慢的系统内存卸载。

48原生
3卸载
8升级

Qwen3 0.6B

0.6Bllama.cpp

Qwen · 置信度: 中

显存原生可跑
模型内存0.9 / 29.4 GB
估算速度
452.9–685.2 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · 置信度: 中

显存原生可跑
模型内存1.3 / 29.4 GB
估算速度
423–640 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · 置信度: 中

显存原生可跑
模型内存1.3 / 29.4 GB
估算速度
423–640 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · 置信度: 中

显存原生可跑
模型内存1.5 / 29.4 GB
估算速度
355.1–537.2 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · 置信度: 中

显存原生可跑
模型内存2.4 / 29.4 GB
估算速度
248.2–375.5 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · 置信度: 中

显存原生可跑
模型内存2.4 / 29.4 GB
估算速度
256.4–387.8 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · 置信度: 中

显存原生可跑
模型内存2.6 / 29.4 GB
估算速度
241–364.5 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · 置信度: 中

显存原生可跑
模型内存2.9 / 29.4 GB
估算速度
221.9–335.8 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · 置信度: 中

显存原生可跑
模型内存3 / 29.4 GB
估算速度
215.6–326.2 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · 置信度: 中

显存原生可跑
模型内存3.3 / 29.4 GB
估算速度
200.2–302.9 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · 置信度: 中

显存原生可跑
模型内存3.5 / 29.4 GB
估算速度
192–290.5 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · 置信度: 中

显存原生可跑
模型内存4 / 29.4 GB
估算速度
173–261.7 词元/秒
量化
Q4
上下文
8K
最低内存
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

区间已计入运行时开销和系统预留。实际性能还会受模型构建、后端、驱动、散热与提示词影响。

计算方法

把假设说清楚的兼容结论

估算会分别处理权重、上下文、运行时开销与内存架构,不把它们混成一个数字。

先算权重,不看营销标签

每个配置从量化权重占用开始,并加入运行时余量,而不是直接把参数量等同于显存。

上下文确实占内存

更长上下文会增加 KV 缓存压力。同一模型可能因上下文增长,从原生可跑变成需要卸载。

卸载不等于原生可跑

系统内存卸载单独展示,因为它虽能启动模型,但速度和延迟体验通常明显不同。

常见问题

本地 AI 硬件问题

8B 语言模型需要多少显存?

Q4 版本加上基本运行时开销,通常需要约 5–7 GB。更长上下文、更大批次或更高精度可能会超过 8 GB。

Apple 统一内存等同于 GPU 显存吗?

不等同。Apple 芯片由 CPU 与 GPU 共享同一内存池,能更灵活地容纳大模型,但 macOS 和其他进程仍需保留内存。

卸载是什么意思?

部分模型保留在系统内存,并通过 CPU 或 PCIe 路径传输。这样可能让模型成功启动,但通常比全部放在显存中慢很多。

速度区间是实测基准吗?

不是,它们是偏保守的模型化区间。实际速度取决于运行时、内核支持、模型构建、驱动、散热与工作负载。