BotConnector
Masuk Workspace Buka Aplikasi

Vision

Apa itu?

Model vision menerima gambar bersama teks. Di dunia GGUF llama.cpp ini butuh dua file: model GGUF utama dan sebuah proyektor (mmproj-*.gguf) yang mengkodekan gambar ke ruang embedding model.

Kapan memakainya?

  • Mendeskripsikan, membandingkan, atau mengekstrak teks (gaya OCR) dari gambar secara lokal.
  • Otomasi yang harus menalar tentang tangkapan layar atau foto tanpa mengunggahnya ke mana pun.

Prasyarat

  • GGUF multimodal dengan proyektor mmproj — halaman detail model mencantumkan file proyektor bila ada.
  • Runtime dengan dukungan multimodal. Experimental

Contoh kerja minimum

Aplikasi desktop mendeteksi dan memuat proyektor otomatis saat model vision berjalan. Melalui API, gambar dikirim dalam konten pesan:

json
{
  "model": "<publisher>/<vision-model>",
  "messages": [{
    "role": "user",
    "content": [
      {"type": "text", "text": "What does this diagram show?"},
      {"type": "image_url", "image_url": {"url": "data:image/png;base64,..."}}
    ]
  }]
}

Konfigurasi/opsi

  • Pemilihan proyektor otomatis bila tepat satu mmproj ada; override manual direncanakan.
  • Ukuran dan jumlah gambar menghabiskan ruang konteks — percakapan panjang dengan gambar memenuhi konteks lebih cepat.

Keterbatasan

  • Bergantung model/runtime — badge Vision disimpulkan; keberhasilan bergantung pada dukungan runtime untuk arsitektur itu.
  • Beberapa model vision dirilis tanpa file proyektor; input gambar kemudian tidak berfungsi.
  • Penanganan gambar lebih lambat dan memakai lebih banyak memori daripada chat teks saja.

Penyelesaian masalah

  • "Model mengabaikan gambar" → proyektor hilang atau tidak dimuat; cek daftar file model untuk mmproj.
  • Output kacau pada gambar → ketidakcocokan arsitektur model dan runtime; lihat Masalah runtime.

Terkait