BotConnector
Masuk Workspace Buka Aplikasi

Audio

Experimental

Apa itu?

Model audio mencakup pengenalan suara (ASR, gaya Whisper), sintesis suara (TTS), dan pemahaman audio. Badge muncul untuk repositori yang ditandai tugas audio/speech.

Kapan memakainya?

  • Mentranskripsi rapat atau catatan suara sepenuhnya lokal.
  • Menghasilkan output suara tanpa cloud TTS.

Prasyarat

  • GGUF audio — filter katalog dengan Audio.
  • Dukungan runtime untuk arsitektur audio itu. Experimental Dukungan bervariasi per keluarga model; periksa halaman detail model dan status.

Contoh kerja minimum

Planned Endpoint transkripsi/sintesis audio belum bagian dari API lokal. Permukaan yang dimaksudkan: input audio diterima pada endpoint gaya chat untuk model ASR, dan rute generasi audio khusus untuk TTS. Bagian ini hanya mendokumentasikan niat — jangan berharap panggilan berfungsi hari ini.

Konfigurasi/opsi

  • Konversi sample rate dan format adalah tanggung jawab pemanggil di antarmuka yang direncanakan.
  • Model audio sering memasangkan decoder dengan GGUF utama; kedua file muncul di daftar file model.

Keterbatasan

  • Bergantung model/runtime — lebih dari teks: audio butuh dukungan runtime spesifik arsitektur.
  • Rekaman panjang menghabiskan konteks sebanding panjang audio.
  • Badge disimpulkan dari tag Hub; tidak semua repositori bertag bisa dipakai lokal.

Penyelesaian masalah

Model termuat tapi permintaan audio gagal → runtime tidak mendukung arsitekturnya; lihat Masalah runtime.

Terkait