BotConnector
Masuk Workspace Buka Aplikasi

Embeddings

Apa itu?

Model embedding mengonversi teks menjadi vektor numerik. Teks yang mirip menghasilkan vektor yang mirip, memungkinkan pencarian semantik, clustering, dan retrieval (RAG). Mereka bukan model chat — teks masuk, angka keluar.

Kapan memakainya?

  • Pencarian semantik lokal atas dokumen, catatan, atau kode.
  • Membangun pipeline RAG tanpa mengirim data ke mana pun.

Prasyarat

  • GGUF embedding (pipeline feature-extraction) — filter katalog dengan Embeddings.
  • Model embedding yang dimuat di runtime.

Contoh kerja minimum

bash
curl http://127.0.0.1:11435/v1/embeddings \
  -H "Content-Type: application/json" \
  -d '{"model":"<publisher>/<embedding-model>","input":["BotConnector runs local models","Local inference keeps data on device"]}'

Mengembalikan satu vektor per string input. Input yang sebanding menghasilkan cosine similarity tinggi.

Konfigurasi/opsi

  • Vektor punya dimensi tetap per model (misal 768, 1024) — mencampur model berarti meng-embed ulang korpus Anda.
  • Batch beberapa input dalam satu permintaan untuk throughput.

Keterbatasan

  • Bukan model chat: jangan arahkan klien chat ke model embedding.
  • Model embedding terkuantisasi kehilangan sedikit akurasi; model embedding biasanya cukup kecil untuk berjalan di presisi lebih tinggi.
  • Satu model dimuat pada satu waktu di pratinjau — berganti antara model chat dan embedding membongkar yang lain. Lihat Menjalankan model.

Penyelesaian masalah

Error dimensi vektor, 404 untuk model: Masalah API dan Masalah model.

Terkait