Audio
Experimental
Apa itu?
Model audio mencakup pengenalan suara (ASR, gaya Whisper), sintesis suara (TTS), dan pemahaman audio. Badge muncul untuk repositori yang ditandai tugas audio/speech.
Kapan memakainya?
- Mentranskripsi rapat atau catatan suara sepenuhnya lokal.
- Menghasilkan output suara tanpa cloud TTS.
Prasyarat
- GGUF audio — filter katalog dengan Audio.
- Dukungan runtime untuk arsitektur audio itu. Experimental Dukungan bervariasi per keluarga model; periksa halaman detail model dan status.
Contoh kerja minimum
Planned Endpoint transkripsi/sintesis audio belum bagian dari API lokal. Permukaan yang dimaksudkan: input audio diterima pada endpoint gaya chat untuk model ASR, dan rute generasi audio khusus untuk TTS. Bagian ini hanya mendokumentasikan niat — jangan berharap panggilan berfungsi hari ini.
Konfigurasi/opsi
- Konversi sample rate dan format adalah tanggung jawab pemanggil di antarmuka yang direncanakan.
- Model audio sering memasangkan decoder dengan GGUF utama; kedua file muncul di daftar file model.
Keterbatasan
- Bergantung model/runtime — lebih dari teks: audio butuh dukungan runtime spesifik arsitektur.
- Rekaman panjang menghabiskan konteks sebanding panjang audio.
- Badge disimpulkan dari tag Hub; tidak semua repositori bertag bisa dipakai lokal.
Penyelesaian masalah
Model termuat tapi permintaan audio gagal → runtime tidak mendukung arsitekturnya; lihat Masalah runtime.