Kuantisasi
Kuantisasi mengurangi presisi bobot model untuk mengecilkan ukuran file dan penggunaan memori. Kuant lebih kecil lebih cepat dan butuh lebih sedikit RAM; kuant lebih besar biasanya menjawab lebih akurat.
Kuantisasi umum
| Nama | Peran tipikal | Ukuran relatif (vs Q8_0) |
|---|---|---|
| Q2_K / IQ2 | Sangat kecil; kehilangan kualitas nyata pada tugas kompleks | ~40% |
| Q3_K_M | Ringkas; cukup untuk tugas sederhana | ~55% |
| Q4_K_M | Default umum — keseimbangan baik untuk penggunaan lokal | ~70% |
| Q5_K_M | Fidelitas lebih tinggi, lebih besar | ~82% |
| Q6_K | Kualitas mendekati Q8 | ~90% |
| Q8_0 | Kuant lokal umum terbesar; mendekati fidelitas asli | 100% |
| F16 | Half precision tak terkompresi; jarang praktis secara lokal | ~200% |
Ukuran di atas bersifat relatif. Ukuran riil berbeda per model — selalu baca daftar file aktual di halaman detail model atau di tampilan Discover desktop.
Cara memilih
- Perkirakan anggaran: RAM tersedia (CPU) atau VRAM (offload GPU), dikurangi konteks/KV cache dan overhead OS. Lihat Konteks dan memori.
- Pilih kuant terbesar yang muat nyaman — sisakan ruang untuk pertumbuhan konteks.
- Default ke Q4_K_M bila ragu; itu titik keseimbangan umum komunitas.
- Untuk embeddings dan model audio, kuantisasi kurang penting — model-model ini biasanya kecil.
Kuantisasi tidak mengubah kemampuan
Q4_K_M dan Q8_0 dari model yang sama berbagi arsitektur dan kemampuan yang sama; kualitasnya berbeda. Badge kemampuan berasal dari model, bukan file. Lihat Kemampuan.
Contoh
Daftar file riil dengan ukuran byte muncul di setiap halaman detail model, misalnya tabel GGUF pada entri katalog model mana pun.
Kesalahan umum
- Mengunduh Q8_0 dari model 30B di mesin 16 GB — OOM pasti. Lihat Masalah memori.
- Menilai kualitas dari ukuran file antar model berbeda — bandingkan kuant hanya dalam satu model.