Backend CUDA
Beta
warning
CUDA Beta
Apa itu?
CUDA adalah API komputasi GPU NVIDIA. Build CUDA llama.cpp meng-offload layer model ke GPU NVIDIA dan biasanya backend tercepat untuk perangkat keras NVIDIA.
Kapan memakainya?
- Mesin apa pun dengan GPU NVIDIA modern dan VRAM cukup untuk model (penuh atau parsial).
Prasyarat
- GPU NVIDIA dengan driver terkini.
- Paket runtime CUDA:
botconnector runtime install— lihat botconnector runtime.
Contoh kerja minimum
powershell
botconnector runtime use cuda
botconnector run <publisher>/<model>
botconnector psOpsi
- Offload penuh saat model + KV cache muat di VRAM — throughput terbaik.
- Offload parsial (
n-gpu-layers) membagi layer antara GPU dan CPU saat VRAM kurang. Lihat Backend.
Keterbatasan
- Beta Kompatibilitas driver/generasi GPU harus diverifikasi — GPU lama bisa fallback atau gagal.
- VRAM, bukan RAM sistem, adalah sumber daya pembatas: model 4,7 GB butuh ~5–6 GB VRAM dengan konteks. Lihat Konteks dan memori.
- Penggunaan GPU campuran oleh game/aplikasi lain mengurangi VRAM tersedia.
Penyelesaian masalah
Error CUDA, OOM di VRAM, transfer lambat: Masalah GPU.