本地 AI 算力与显存匹配

AI Rig Match

根据你的显卡或 Mac 硬件配置,一键测算能流畅运行哪些大语言模型、代码助手、AI 生图与视频模型。

显存占用与推理速度为理论测算值,供选型与部署参考。实际效果受推理框架(Ollama / llama.cpp / vLLM)、驱动版本及机器散热影响。

硬件与场景配置

选择或检测你的设备

配置你的显卡/芯片型号、内存容量以及目标使用场景。

已收录 89 款硬件预设 · 92 款主流大模型 · 数据更新于 2026-08-23

兼容性分析报告

大模型兼容性测算结果

清晰区分「纯显存流畅运行」、「内存分流降速运行」与「显存不足需升级」。

48纯显存流畅
3需内存分流
8显存不足

Qwen3 0.6B

0.6Bllama.cpp

Qwen · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存0.9 / 29.4 GB
预估生成速度
452.9–685.2 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存1.3 / 29.4 GB
预估生成速度
423–640 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存1.3 / 29.4 GB
预估生成速度
423–640 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存1.5 / 29.4 GB
预估生成速度
355.1–537.2 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存2.4 / 29.4 GB
预估生成速度
248.2–375.5 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存2.4 / 29.4 GB
预估生成速度
256.4–387.8 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存2.6 / 29.4 GB
预估生成速度
241–364.5 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存2.9 / 29.4 GB
预估生成速度
221.9–335.8 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存3 / 29.4 GB
预估生成速度
215.6–326.2 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存3.3 / 29.4 GB
预估生成速度
200.2–302.9 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存3.5 / 29.4 GB
预估生成速度
192–290.5 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · 测算置信度: 中

显存全载 · 流畅运行
所需显存/内存4 / 29.4 GB
预估生成速度
173–261.7 tokens/秒
量化规格
Q4
上下文深度
8K
建议系统内存
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

测算数值已计入推理引擎常驻开销与操作系统预留显存。实际推理速度取决于部署工具(Ollama / llama.cpp / vLLM)、驱动版本与硬件散热状态。

测算原理

为什么我们的显存测算更精准?

拒绝单纯拿参数量乘以精度的粗暴算法。我们独立拆解模型权重、KV Cache 上下文消耗、推理引擎常驻底噪与硬件架构差异,给出真实的运行预期。

精算真实净占用,拒绝粗暴估算

从量化后的模型净权重出发,自动加上 CUDA/Metal 等推理引擎的常驻开销与安全余量,绝不简单把「7B/14B 参数量」直接等同于显存占用,避免一启动就 OOM 报错。

动态评估长上下文(KV Cache)消耗

上下文越长,KV Cache 占用的显存呈线性甚至指数级暴增。同一个模型,4K 短对话能跑得飞起,到了 32K 或 128K 长文档可能就会爆显存。我们按设定的上下文深度动态精算。

分清「纯显存直出」与「CPU 内存分流」

显存不够时,部分框架(如 llama.cpp)支持将图层卸载到系统内存(CPU Offload)。虽能启动,但生成速度可能断崖式下跌。我们将其明确区分,不把「勉强能跑」和「流畅好用」混为一谈。

常见问题

本地大模型与硬件选型常见问题

运行一个 8B(80亿参数)大模型到底需要多大显存?

以最常用的 4-bit 量化(Q4)为例,模型权重约占 4.5 GB,加上推理引擎(如 Ollama)运行时开销与默认 4K 上下文,通常需要 6–7 GB 显存;如果开启 32K+ 长上下文或使用 Q8 高精度,则建议 8–12 GB 以上显存。

Mac 的统一内存(Unified Memory)可以直接当显存用吗?

可以,但不能 100% 全部用于模型。Apple 芯片的 CPU 与 GPU 共享同一内存池,非常适合运行超大模型;但 macOS 系统和其他后台软件需要保留基础内存,系统默认通常允许模型最大使用约 70%~75% 的统一内存。

什么是「内存卸载(CPU / RAM Offload)」?

当显卡显存装不下整个模型时,推理框架(如 llama.cpp / Ollama)支持将部分模型层放到电脑系统内存中由 CPU 计算。这能让你在小显存上勉强运行大模型,但由于跨 PCIe 总线传输与 CPU 算力瓶颈,生成速度会明显变慢(例如从 40 tokens/s 降至 2~5 tokens/s)。

页面上预估的生成速度(tokens/s)准确吗?

预估速度结合了硬件显存带宽、算力与主流部署框架的理论测算区间。实际推理速度还会受到量化格式(GGUF / AWQ / EXL2)、推理后端(vLLM / llama.cpp / MLC-LLM)、驱动版本及整机散热状态的影响。