Embeddings
Apa itu?
Model embedding mengonversi teks menjadi vektor numerik. Teks yang mirip menghasilkan vektor yang mirip, memungkinkan pencarian semantik, clustering, dan retrieval (RAG). Mereka bukan model chat — teks masuk, angka keluar.
Kapan memakainya?
- Pencarian semantik lokal atas dokumen, catatan, atau kode.
- Membangun pipeline RAG tanpa mengirim data ke mana pun.
Prasyarat
- GGUF embedding (pipeline
feature-extraction) — filter katalog dengan Embeddings. - Model embedding yang dimuat di runtime.
Contoh kerja minimum
bash
curl http://127.0.0.1:11435/v1/embeddings \
-H "Content-Type: application/json" \
-d '{"model":"<publisher>/<embedding-model>","input":["BotConnector runs local models","Local inference keeps data on device"]}'Mengembalikan satu vektor per string input. Input yang sebanding menghasilkan cosine similarity tinggi.
Konfigurasi/opsi
- Vektor punya dimensi tetap per model (misal 768, 1024) — mencampur model berarti meng-embed ulang korpus Anda.
- Batch beberapa input dalam satu permintaan untuk throughput.
Keterbatasan
- Bukan model chat: jangan arahkan klien chat ke model embedding.
- Model embedding terkuantisasi kehilangan sedikit akurasi; model embedding biasanya cukup kecil untuk berjalan di presisi lebih tinggi.
- Satu model dimuat pada satu waktu di pratinjau — berganti antara model chat dan embedding membongkar yang lain. Lihat Menjalankan model.
Penyelesaian masalah
Error dimensi vektor, 404 untuk model: Masalah API dan Masalah model.