BotConnector
Masuk Workspace Buka Aplikasi

Konteks dan memori

warning

Rumus memori

Total memori saat pemuatan ≈

text
ukuran file model
+ KV cache   (berskala dengan panjang konteks dan model)
+ overhead runtime (~0,5–1 GB)

Intuisi KV cache

KV cache menyimpan state attention per token untuk seluruh konteks. Konteks lebih panjang = cache lebih besar:

  • Model 7B di Q4 (~4,7 GB) dengan konteks 4K: KV cache kira-kira 0,3–0,5 GB.
  • Model yang sama di konteks 32K: KV cache tumbuh ke beberapa GB.
  • Kuantisasi KV cache (Q8) menguranginya dengan penurunan kualitas kecil bila didukung.

Contoh perhitungan

SetupFile modelKonteksKV cache (perkiraan)Total
7B Q4_K_M, 4K4,7 GB4K~0,5 GB~6 GB
7B Q4_K_M, 32K4,7 GB32K~4 GB~9,5 GB
14B Q4_K_M, 8K9 GB8K~1,5 GB~11 GB
30B MoE Q4, 8K19 GB8K~2 GB~22 GB

Selalu sisakan 1–2 GB untuk OS dan runtime itu sendiri.

Memilih konteks

  • Chat: 4K–8K biasanya cukup.
  • Dokumen/kode panjang: 16K–32K bila memori mengizinkan.
  • Menetapkan konteks saat pemuatan:
powershell
botconnector run <model> --ctx 8192

GPU offload berinteraksi dengan konteks

KV cache bisa tinggal di GPU juga. Bila model + KV muat di VRAM Anda mendapat percepatan penuh; bila hanya model yang muat, cache tinggal di RAM sistem dan transfer memperlambat generasi.

Penyelesaian masalah

  • OOM saat pemuatan → kuant lebih kecil, konteks lebih kecil, offload lebih sedikit. Masalah memori
  • Generasi melambat seiring waktu → konteks memenuhi; pantau botconnector ps. Masalah runtime