Backend
warning
Backend
Apa itu backend?
Backend menentukan di mana dan bagaimana perhitungan tensor berjalan. Model adalah file GGUF yang agnostik backend; model yang sama bisa berjalan di CPU, Vulkan, atau CUDA. Pilihan backend memengaruhi kecepatan dan penempatan memori, bukan kemampuan.
Pemilihan otomatis (default)
auto memilih yang pertama tersedia: CUDA → Vulkan → CPU, dengan CPU sebagai fallback permanen:
powershell
botconnector runtime use autoMengunci backend
powershell
botconnector runtime use cuda
botconnector runtime use vulkan
botconnector runtime use cpuVerifikasi yang aktif:
powershell
botconnector runtime statusHalaman backend
GPU offload
Backend GPU memindahkan layer ke VRAM ("offload"). Opsi saat pemuatan:
- Offload penuh — semua layer di GPU; tercepat; butuh VRAM ≥ model + KV cache.
- Offload parsial — sebagian layer di GPU, sisanya di CPU; memakai keduanya.
- Tanpa offload — CPU saja.
Offload lebih besar tidak selalu lebih cepat saat transfer PCIe mendominasi; ukur dengan model Anda. Lihat Konteks dan memori.
Berganti backend
Mengganti backend membutuhkan reload: botconnector unload lalu botconnector run <model>.
Penyelesaian masalah
Kegagalan spesifik backend: Masalah GPU dan Masalah runtime.