BotConnector
Masuk Workspace Buka Aplikasi

Kuantisasi

Kuantisasi mengurangi presisi bobot model untuk mengecilkan ukuran file dan penggunaan memori. Kuant lebih kecil lebih cepat dan butuh lebih sedikit RAM; kuant lebih besar biasanya menjawab lebih akurat.

Kuantisasi umum

NamaPeran tipikalUkuran relatif (vs Q8_0)
Q2_K / IQ2Sangat kecil; kehilangan kualitas nyata pada tugas kompleks~40%
Q3_K_MRingkas; cukup untuk tugas sederhana~55%
Q4_K_MDefault umum — keseimbangan baik untuk penggunaan lokal~70%
Q5_K_MFidelitas lebih tinggi, lebih besar~82%
Q6_KKualitas mendekati Q8~90%
Q8_0Kuant lokal umum terbesar; mendekati fidelitas asli100%
F16Half precision tak terkompresi; jarang praktis secara lokal~200%

Ukuran di atas bersifat relatif. Ukuran riil berbeda per model — selalu baca daftar file aktual di halaman detail model atau di tampilan Discover desktop.

Cara memilih

  1. Perkirakan anggaran: RAM tersedia (CPU) atau VRAM (offload GPU), dikurangi konteks/KV cache dan overhead OS. Lihat Konteks dan memori.
  2. Pilih kuant terbesar yang muat nyaman — sisakan ruang untuk pertumbuhan konteks.
  3. Default ke Q4_K_M bila ragu; itu titik keseimbangan umum komunitas.
  4. Untuk embeddings dan model audio, kuantisasi kurang penting — model-model ini biasanya kecil.

Kuantisasi tidak mengubah kemampuan

Q4_K_M dan Q8_0 dari model yang sama berbagi arsitektur dan kemampuan yang sama; kualitasnya berbeda. Badge kemampuan berasal dari model, bukan file. Lihat Kemampuan.

Contoh

Daftar file riil dengan ukuran byte muncul di setiap halaman detail model, misalnya tabel GGUF pada entri katalog model mana pun.

Kesalahan umum

  • Mengunduh Q8_0 dari model 30B di mesin 16 GB — OOM pasti. Lihat Masalah memori.
  • Menilai kualitas dari ukuran file antar model berbeda — bandingkan kuant hanya dalam satu model.