BotConnector
Masuk Workspace Buka Aplikasi

Backend CUDA

Beta
warning

CUDA Beta

Apa itu?

CUDA adalah API komputasi GPU NVIDIA. Build CUDA llama.cpp meng-offload layer model ke GPU NVIDIA dan biasanya backend tercepat untuk perangkat keras NVIDIA.

Kapan memakainya?

  • Mesin apa pun dengan GPU NVIDIA modern dan VRAM cukup untuk model (penuh atau parsial).

Prasyarat

  • GPU NVIDIA dengan driver terkini.
  • Paket runtime CUDA: botconnector runtime install — lihat botconnector runtime.

Contoh kerja minimum

powershell
botconnector runtime use cuda
botconnector run <publisher>/<model>
botconnector ps

Opsi

  • Offload penuh saat model + KV cache muat di VRAM — throughput terbaik.
  • Offload parsial (n-gpu-layers) membagi layer antara GPU dan CPU saat VRAM kurang. Lihat Backend.

Keterbatasan

  • Beta Kompatibilitas driver/generasi GPU harus diverifikasi — GPU lama bisa fallback atau gagal.
  • VRAM, bukan RAM sistem, adalah sumber daya pembatas: model 4,7 GB butuh ~5–6 GB VRAM dengan konteks. Lihat Konteks dan memori.
  • Penggunaan GPU campuran oleh game/aplikasi lain mengurangi VRAM tersedia.

Penyelesaian masalah

Error CUDA, OOM di VRAM, transfer lambat: Masalah GPU.