Apa itu?
Model vision menerima gambar bersama teks. Di dunia GGUF llama.cpp ini butuh dua file: model GGUF utama dan sebuah proyektor (mmproj-*.gguf) yang mengkodekan gambar ke ruang embedding model.
Kapan memakainya?
- Mendeskripsikan, membandingkan, atau mengekstrak teks (gaya OCR) dari gambar secara lokal.
- Otomasi yang harus menalar tentang tangkapan layar atau foto tanpa mengunggahnya ke mana pun.
Prasyarat
- GGUF multimodal dengan proyektor
mmproj— halaman detail model mencantumkan file proyektor bila ada. - Runtime dengan dukungan multimodal. Experimental
Contoh kerja minimum
Aplikasi desktop mendeteksi dan memuat proyektor otomatis saat model vision berjalan. Melalui API, gambar dikirim dalam konten pesan:
json
{
"model": "<publisher>/<vision-model>",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "What does this diagram show?"},
{"type": "image_url", "image_url": {"url": "data:image/png;base64,..."}}
]
}]
}Konfigurasi/opsi
- Pemilihan proyektor otomatis bila tepat satu mmproj ada; override manual direncanakan.
- Ukuran dan jumlah gambar menghabiskan ruang konteks — percakapan panjang dengan gambar memenuhi konteks lebih cepat.
Keterbatasan
- Bergantung model/runtime — badge Vision disimpulkan; keberhasilan bergantung pada dukungan runtime untuk arsitektur itu.
- Beberapa model vision dirilis tanpa file proyektor; input gambar kemudian tidak berfungsi.
- Penanganan gambar lebih lambat dan memakai lebih banyak memori daripada chat teks saja.
Penyelesaian masalah
- "Model mengabaikan gambar" → proyektor hilang atau tidak dimuat; cek daftar file model untuk mmproj.
- Output kacau pada gambar → ketidakcocokan arsitektur model dan runtime; lihat Masalah runtime.
Terkait
- Kemampuan
- Mengunduh model — file proyektor terunduh bersama model.