Masalah memori
warning
Masalah memori
Saat pemuatan
OOM pemuatan = file model + KV cache + overhead > memori tersedia. Solusi, dari termurah:
- Kuantisasi lebih kecil — Q5_K_M → Q4_K_M hemat ~25% (Kuantisasi).
- Konteks lebih rendah —
botconnector run <model> --ctx 4096(Konteks dan memori). - Offload GPU lebih sedikit — parsial alih-alih penuh (Backend).
- Model lebih kecil — turun satu kelas parameter.
- Tutup aplikasi rakus memori — browser terkenal pelakunya.
Saat generasi
Pertumbuhan konteks mendorong KV cache naik di tengah sesi. Jika OOM terjadi di tengah chat:
- turunkan
--ctxsaat pemuatan berikutnya, - jaga percakapan lebih pendek,
- aktifkan kuantisasi KV cache bila didukung.
Memori GPU (VRAM)
OOM VRPM adalah kasus tersendiri — model + KV harus muat di VRAM untuk offload penuh; offload parsial bila tidak. Lihat Masalah GPU.
Hitungan cepat
Perkirakan sebelum pemuatan: ukuran file model + ~0,5–1 GB overhead + KV (tergantung konteks). Tabel terhitung: Konteks dan memori.
Pencegahan
- Cek angka RAM/VRAM dari
botconnector doctorterhadap ukuran file sebelum mengunduh kuant. - Halaman detail model mencantumkan ukuran persis per kuantisasi — pilih yang menyisakan ruang.