Backend Vulkan
Beta
warning
Vulkan Beta
Apa itu?
Vulkan adalah API GPU portabel. Satu build Vulkan llama.cpp mencakup GPU AMD, Intel, dan NVIDIA — berguna saat Anda tidak punya (atau tidak mau) toolchain CUDA.
Kapan memakainya?
- GPU AMD atau Intel (tanpa opsi CUDA).
- Mesin NVIDIA tanpa paket runtime CUDA.
- Setup portabel di mana satu runtime harus bekerja di banyak mesin.
Prasyarat
- Driver GPU terbaru dengan dukungan Vulkan.
- Paket runtime Vulkan:
botconnector runtime install— lihat botconnector runtime.
Contoh kerja minimum
powershell
botconnector runtime use vulkan
botconnector run <publisher>/<model>
botconnector psOpsi
- n-gpu-layers — berapa banyak layer pindah ke GPU. Offload lebih banyak = lebih cepat tapi butuh lebih banyak VRAM.
- Offload penuh saat model + KV cache muat di VRAM; parsial bila tidak.
Keterbatasan
- Beta Cakupan perangkat harus diverifikasi per mesin — dukungan driver Vulkan bervariasi kualitasnya di llama.cpp.
- GPU terintegrasi berbagi RAM sistem; model besar bisa gagal dengan out-of-memory saat alokasi compute buffer.
- GPU sangat lama (pra-Vulkan-1.1) tidak dapat dipakai.
Catatan performa
- Vulkan sering tertinggal dari CUDA di perangkat NVIDIA; jika Anda punya GPU NVIDIA, utamakan CUDA.
- Sistem UMA (iGPU + memori bersama) mendapat manfaat dari RAM lebih cepat.
Penyelesaian masalah
Perangkat Vulkan tidak ditemukan, crash saat init, OOM: Masalah GPU.