Kecocokan perangkat keras
warning
Kecocokan perangkat keras
Tujuan
Tahu sebelum mengunduh apakah sebuah model benar-benar akan termuat dan berjalan di mesin Anda.
Yang perlu disiapkan
- Fakta mesin Anda:
botconnector doctormelaporkan CPU, RAM, dan backend GPU (Instal Local Runtime). - Ukuran file model dari Katalog model.
Langkah-langkah
- Baca total RAM bebas Anda (dan VRAM, kalau backend GPU aktif) dari
botconnector doctor. - Periksa daftar file model di katalog. Setiap kuantisasi menampilkan ukuran file persisnya — file harus lebih kecil dari memori yang bisa Anda sisihkan. Lihat Kuantisasi untuk trade-off-nya.
- Tambahkan anggaran konteks. KV cache bertambah seiring panjang konteks, di atas bobot model — lihat Konteks dan memori. Model yang muat pada konteks 4K bisa jadi tidak muat pada 32k.
- Pertimbangkan offload GPU. Layer yang di-offload ke VRAM mengurangi tekanan RAM; backend memilih otomatis atau bisa dipatok — lihat Backend.
- Verifikasi saat memuat.
botconnector psmenampilkan pemakaian memori nyata setelah pemuatan (Jalankan model).
Hasil yang diharapkan
Model yang termuat sempurna, menyisakan ruang untuk sistem Anda, dan menahan panjang konteks yang Anda butuhkan. Filter kecocokan perangkat keras di katalog sudah mengerjakan tahap awalnya untuk Anda.
Jika gagal
- Pemuatan berhenti karena kehabisan memori: pilih kuantisasi lebih kecil atau konteks lebih rendah — Masalah memori.
- Galat backend GPU saat offload: Masalah GPU.
- Runtime tidak mau mulai: Masalah runtime.
- Masalah umum: Penyelesaian masalah.
Langkah berikutnya
Memilih antar kandidat dengan percaya diri: Memilih model, lalu mengunduh: Unduh model.