ความเข้ากันได้ของ AI ในเครื่อง

AI Rig Match

จับคู่ GPU หรือ Mac ที่ใช้ Apple Silicon กับโมเดลภาษา เขียนโค้ด รูปภาพ และวิดีโอที่รันในเครื่องได้

ความจุและความเร็วเป็นค่าประเมินจากแบบจำลอง ไม่ใช่การรับประกัน โปรดตรวจสอบ runtime ไดรเวอร์ และรุ่นโมเดลก่อนซื้อฮาร์ดแวร์

เครื่องของคุณ

สร้างโปรไฟล์ฮาร์ดแวร์

กำหนดงบหน่วยความจำและงานที่ต้องการสำหรับการรันนี้

ฮาร์ดแวร์ 89 รายการ · โมเดล 92 รายการ · ตรวจสอบเมื่อ 2026-08-23

รายงานการจับคู่

โมเดลที่เข้ากันได้

ผลลัพธ์แยกการรันใน VRAM โดยตรงจากการถ่ายไป RAM ระบบที่ช้ากว่า

48โดยตรง
3ถ่ายไป RAM
8อัปเกรด

Qwen3 0.6B

0.6Bllama.cpp

Qwen · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล0.9 / 29.4 GB
ความเร็วโดยประมาณ
452.9–685.2 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.gguf

Llama 3.2 1B

1Bllama.cpp

Llama · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล1.3 / 29.4 GB
ความเร็วโดยประมาณ
423–640 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/llama-3-2-1b-q4_K_M.gguf

Gemma 3 1B

1Bllama.cpp

Gemma · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล1.3 / 29.4 GB
ความเร็วโดยประมาณ
423–640 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/gemma-3-1b-q4_K_M.gguf

Qwen3 1.7B

1.7Bllama.cpp

Qwen · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล1.5 / 29.4 GB
ความเร็วโดยประมาณ
355.1–537.2 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/qwen3-1.7b-q4_K_M.gguf

Llama 3.2 3B

3Bllama.cpp

Llama · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล2.4 / 29.4 GB
ความเร็วโดยประมาณ
248.2–375.5 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/llama-3-2-3b-q4_K_M.gguf

SmolLM3 3B

3Bllama.cpp

Hugging Face · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล2.4 / 29.4 GB
ความเร็วโดยประมาณ
256.4–387.8 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/smollm3-3b-q4_K_M.gguf

Ministral 3B

3Bllama.cpp

Mistral · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล2.6 / 29.4 GB
ความเร็วโดยประมาณ
241–364.5 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/ministral-3b-q4_K_M.gguf

Phi-4 Mini

3.8Bllama.cpp

Microsoft · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล2.9 / 29.4 GB
ความเร็วโดยประมาณ
221.9–335.8 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/phi-4-mini-q4_K_M.gguf

Phi-3.5 Mini

3.8Bllama.cpp

Microsoft · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล3 / 29.4 GB
ความเร็วโดยประมาณ
215.6–326.2 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/phi-3.5-mini-q4_K_M.gguf

Qwen3 4B

4Bllama.cpp

Qwen · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล3.3 / 29.4 GB
ความเร็วโดยประมาณ
200.2–302.9 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/qwen3-4b-q4_K_M.gguf

Gemma 3 4B

4Bllama.cpp

Gemma · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล3.5 / 29.4 GB
ความเร็วโดยประมาณ
192–290.5 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/gemma-3-4b-q4_K_M.gguf

Gemma 3n E2B

5B / 2B activellama.cpp

Gemma · ความมั่นใจ: ปานกลาง

รันในหน่วยความจำได้
หน่วยความจำโมเดล4 / 29.4 GB
ความเร็วโดยประมาณ
173–261.7 โทเคน/วินาที
การควอนไทซ์
Q4
บริบท
8K
RAM ขั้นต่ำ
16 GB
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.gguf

ช่วงค่ารวมภาระ runtime และหน่วยความจำสำรองของระบบ ประสิทธิภาพจริงขึ้นกับโมเดล backend ไดรเวอร์ อุณหภูมิ และพรอมต์

วิธีคำนวณ

ผลการจับคู่ที่เปิดเผยสมมติฐาน

การประเมินแยกน้ำหนักโมเดล บริบท ภาระ runtime และโครงสร้างหน่วยความจำเป็นข้อจำกัดแต่ละส่วน

คำนวณน้ำหนักก่อนชื่อการตลาด

แต่ละโปรไฟล์เริ่มจากขนาดน้ำหนักที่ควอนไทซ์แล้วเพิ่มพื้นที่สำหรับ runtime แทนการเทียบจำนวนพารามิเตอร์กับ VRAM โดยตรง

บริบทมีต้นทุนจริง

บริบทที่ยาวขึ้นเพิ่มภาระ KV cache โมเดลเดียวกันอาจเปลี่ยนจากรันโดยตรงเป็นต้องถ่ายไป RAM

การถ่ายไป RAM ไม่ใช่การรันโดยตรง

แสดงการถ่ายไป RAM แยกต่างหาก เพราะแม้รันได้ แต่ความเร็วและเวลาแฝงต่างกันมาก

คำถามพบบ่อย

คำถามเรื่องฮาร์ดแวร์ AI ในเครื่อง

โมเดลภาษา 8B ต้องใช้ VRAM เท่าใด?

รุ่น Q4 มักใช้ประมาณ 5–7 GB รวมภาระพื้นฐาน บริบทยาว batch ใหญ่ หรือความแม่นยำสูงอาจเกิน 8 GB

หน่วยความจำแบบรวมของ Apple เหมือน VRAM หรือไม่?

ไม่เหมือน CPU และ GPU ใช้หน่วยความจำก้อนเดียวร่วมกัน จึงใส่โมเดลใหญ่ได้ง่ายขึ้น แต่ macOS และโปรเซสอื่นยังต้องมีพื้นที่สำรอง

การถ่ายไป RAM หมายถึงอะไร?

บางส่วนของโมเดลอยู่ใน RAM ระบบและส่งผ่าน CPU หรือ PCIe ทำให้เปิดโมเดลได้ แต่มักช้ากว่าการเก็บข้อมูลทั้งหมดในหน่วยความจำ GPU มาก

ช่วงความเร็วเป็นผล benchmark หรือไม่?

ไม่ใช่ แต่เป็นค่าประเมินแบบเผื่อไว้ ความเร็วจริงขึ้นกับ runtime การรองรับ kernel รุ่นโมเดล ไดรเวอร์ การระบายความร้อน และประเภทงาน