Konteks dan memori
warning
Rumus memori
Total memori saat pemuatan ≈
text
ukuran file model
+ KV cache (berskala dengan panjang konteks dan model)
+ overhead runtime (~0,5–1 GB)Intuisi KV cache
KV cache menyimpan state attention per token untuk seluruh konteks. Konteks lebih panjang = cache lebih besar:
- Model 7B di Q4 (~4,7 GB) dengan konteks 4K: KV cache kira-kira 0,3–0,5 GB.
- Model yang sama di konteks 32K: KV cache tumbuh ke beberapa GB.
- Kuantisasi KV cache (Q8) menguranginya dengan penurunan kualitas kecil bila didukung.
Contoh perhitungan
| Setup | File model | Konteks | KV cache (perkiraan) | Total |
|---|---|---|---|---|
| 7B Q4_K_M, 4K | 4,7 GB | 4K | ~0,5 GB | ~6 GB |
| 7B Q4_K_M, 32K | 4,7 GB | 32K | ~4 GB | ~9,5 GB |
| 14B Q4_K_M, 8K | 9 GB | 8K | ~1,5 GB | ~11 GB |
| 30B MoE Q4, 8K | 19 GB | 8K | ~2 GB | ~22 GB |
Selalu sisakan 1–2 GB untuk OS dan runtime itu sendiri.
Memilih konteks
- Chat: 4K–8K biasanya cukup.
- Dokumen/kode panjang: 16K–32K bila memori mengizinkan.
- Menetapkan konteks saat pemuatan:
powershell
botconnector run <model> --ctx 8192GPU offload berinteraksi dengan konteks
KV cache bisa tinggal di GPU juga. Bila model + KV muat di VRAM Anda mendapat percepatan penuh; bila hanya model yang muat, cache tinggal di RAM sistem dan transfer memperlambat generasi.
Penyelesaian masalah
- OOM saat pemuatan → kuant lebih kecil, konteks lebih kecil, offload lebih sedikit. Masalah memori
- Generasi melambat seiring waktu → konteks memenuhi; pantau
botconnector ps. Masalah runtime