Qwen3 0.6B
0.6Bllama.cppQwen · ความมั่นใจ: ปานกลาง
- ความเร็วโดยประมาณ
- 452.9–685.2 โทเคน/วินาที
- การควอนไทซ์
- Q4
- บริบท
- 8K
- RAM ขั้นต่ำ
- 16 GB
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufความเข้ากันได้ของ AI ในเครื่อง
จับคู่ GPU หรือ Mac ที่ใช้ Apple Silicon กับโมเดลภาษา เขียนโค้ด รูปภาพ และวิดีโอที่รันในเครื่องได้
ความจุและความเร็วเป็นค่าประเมินจากแบบจำลอง ไม่ใช่การรับประกัน โปรดตรวจสอบ runtime ไดรเวอร์ และรุ่นโมเดลก่อนซื้อฮาร์ดแวร์
เครื่องของคุณ
กำหนดงบหน่วยความจำและงานที่ต้องการสำหรับการรันนี้
ฮาร์ดแวร์ 89 รายการ · โมเดล 92 รายการ · ตรวจสอบเมื่อ 2026-08-23
รายงานการจับคู่
ผลลัพธ์แยกการรันใน VRAM โดยตรงจากการถ่ายไป RAM ระบบที่ช้ากว่า
Qwen · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/qwen3-0.6b-q4_K_M.ggufLlama · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/llama-3-2-1b-q4_K_M.ggufGemma · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/gemma-3-1b-q4_K_M.ggufQwen · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/qwen3-1.7b-q4_K_M.ggufLlama · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/llama-3-2-3b-q4_K_M.ggufHugging Face · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/smollm3-3b-q4_K_M.ggufMistral · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/ministral-3b-q4_K_M.ggufMicrosoft · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/phi-4-mini-q4_K_M.ggufMicrosoft · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/phi-3.5-mini-q4_K_M.ggufQwen · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/qwen3-4b-q4_K_M.ggufGemma · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/gemma-3-4b-q4_K_M.ggufGemma · ความมั่นใจ: ปานกลาง
llama-cli -m ./models/gemma-3n-e2b-q4_K_M.ggufช่วงค่ารวมภาระ runtime และหน่วยความจำสำรองของระบบ ประสิทธิภาพจริงขึ้นกับโมเดล backend ไดรเวอร์ อุณหภูมิ และพรอมต์
วิธีคำนวณ
การประเมินแยกน้ำหนักโมเดล บริบท ภาระ runtime และโครงสร้างหน่วยความจำเป็นข้อจำกัดแต่ละส่วน
แต่ละโปรไฟล์เริ่มจากขนาดน้ำหนักที่ควอนไทซ์แล้วเพิ่มพื้นที่สำหรับ runtime แทนการเทียบจำนวนพารามิเตอร์กับ VRAM โดยตรง
บริบทที่ยาวขึ้นเพิ่มภาระ KV cache โมเดลเดียวกันอาจเปลี่ยนจากรันโดยตรงเป็นต้องถ่ายไป RAM
แสดงการถ่ายไป RAM แยกต่างหาก เพราะแม้รันได้ แต่ความเร็วและเวลาแฝงต่างกันมาก
คำถามพบบ่อย
รุ่น Q4 มักใช้ประมาณ 5–7 GB รวมภาระพื้นฐาน บริบทยาว batch ใหญ่ หรือความแม่นยำสูงอาจเกิน 8 GB
ไม่เหมือน CPU และ GPU ใช้หน่วยความจำก้อนเดียวร่วมกัน จึงใส่โมเดลใหญ่ได้ง่ายขึ้น แต่ macOS และโปรเซสอื่นยังต้องมีพื้นที่สำรอง
บางส่วนของโมเดลอยู่ใน RAM ระบบและส่งผ่าน CPU หรือ PCIe ทำให้เปิดโมเดลได้ แต่มักช้ากว่าการเก็บข้อมูลทั้งหมดในหน่วยความจำ GPU มาก
ไม่ใช่ แต่เป็นค่าประเมินแบบเผื่อไว้ ความเร็วจริงขึ้นกับ runtime การรองรับ kernel รุ่นโมเดล ไดรเวอร์ การระบายความร้อน และประเภทงาน