BotConnector
Masuk Workspace Buka Aplikasi

Masalah memori

warning

Masalah memori

Saat pemuatan

OOM pemuatan = file model + KV cache + overhead > memori tersedia. Solusi, dari termurah:

  1. Kuantisasi lebih kecil — Q5_K_M → Q4_K_M hemat ~25% (Kuantisasi).
  2. Konteks lebih rendah — botconnector run <model> --ctx 4096 (Konteks dan memori).
  3. Offload GPU lebih sedikit — parsial alih-alih penuh (Backend).
  4. Model lebih kecil — turun satu kelas parameter.
  5. Tutup aplikasi rakus memori — browser terkenal pelakunya.

Saat generasi

Pertumbuhan konteks mendorong KV cache naik di tengah sesi. Jika OOM terjadi di tengah chat:

  • turunkan --ctx saat pemuatan berikutnya,
  • jaga percakapan lebih pendek,
  • aktifkan kuantisasi KV cache bila didukung.

Memori GPU (VRAM)

OOM VRPM adalah kasus tersendiri — model + KV harus muat di VRAM untuk offload penuh; offload parsial bila tidak. Lihat Masalah GPU.

Hitungan cepat

Perkirakan sebelum pemuatan: ukuran file model + ~0,5–1 GB overhead + KV (tergantung konteks). Tabel terhitung: Konteks dan memori.

Pencegahan

  • Cek angka RAM/VRAM dari botconnector doctor terhadap ukuran file sebelum mengunduh kuant.
  • Halaman detail model mencantumkan ukuran persis per kuantisasi — pilih yang menyisakan ruang.