Tips & Efisiensi Token
Pelajari cara kerja sistem BotConnector agar jatah paket Anda bertahan hingga 2x sampai 3x lebih lama, hemat biaya, dan terhindar dari pemborosan kuota.
1. Rahasia "Prompt Caching" (Diskon Token hingga 90% – 98%)
Saat Anda mengobrol panjang dengan AI, di setiap giliran (turn) baru, aplikasi mengirimkan kembali seluruh riwayat percakapan dari awal agar AI tetap mengingat konteks pembicaraan sebelumnya.
Di BotConnector, sistem secara otomatis memanfaatkan Prompt Caching (didukung pada Claude, OpenAI, Gemini, DeepSeek, dan GLM). Riwayat percakapan yang sudah pernah diproses disimpan di memori server dan dibaca kembali dengan tarif diskon drastis mengikuti tarif resmi developer:
| Model AI | Tarif Input Normal / 1M Token | Tarif Cache Read / 1M Token |
|---|---|---|
| Claude Sonnet 5.5 | $2,00 | $0,20 |
| Claude Opus 5.5 | $4,00 | $0,20 |
| GPT-6 Luna | $0,10 | $0,01 |
| Gemini 3.1 Flash Lite | $0,25 | $0,025 |
| Gemini 3.8 Flash | $0,75 | $0,075 |
| GLM-5.3 Flash | $0,15 | $0,03 |
| DeepSeek V4.1 Flash | $0,15 | $0,003 |
4 Aturan Emas agar Percakapan Selalu Kena "Hot Cache":
- Jaga Jeda Balasan di Bawah 5 Menit: Server penyedia model (seperti Anthropic dan OpenAI) menyimpan memori cache selama 5 menit. Setiap kali Anda mengirim pesan lanjutan, timer 5 menit otomatis diperpanjang kembali. Selama jeda antar pertanyaan Anda tidak melebihi 5 menit, seluruh riwayat percakapan sebelumnya akan terus berada dalam status Hot Cache dan dihitung dengan harga diskon.
- Ambang Batas 1.024 Token (Khusus Model Claude): Pada model Claude (Sonnet 5.5 dan Opus 5.5), Anthropic mewajibkan panjang teks awal minimal 1.024 token (~750 kata) agar fitur cache aktif. Jika Anda mengunggah dokumen kerja, file referensi, atau instruksi kodingan panjang di pesan pertama, teks tersebut langsung terkunci di cache dan dibaca super murah di pesan-pesan berikutnya.
- Gunakan Alur Obrolan Mengalir Maju (Append-Only): Caching bekerja dengan mencocokkan awalan teks secara persis dari kata pertama. Hindari mengedit pesan di tengah obrolan lama (misal mengedit pertanyaan ke-2 dari 10 pertanyaan). Mengedit pesan lama akan membatalkan cache dari nomor 2 ke bawah. Cukup lanjutkan obrolan ke bawah.
- Instruksi Sistem (System Prompt) yang Statis: Jika Anda mengatur Custom Instructions atau kepribadian AI, hindari menyisipkan tanggal atau jam real-time (seperti waktu jam/detik berjalan). Perubahan detik/menit akan mengubah awalan token dan membuat cache gagal terbaca (cache miss).
2. Strategi Memilih Model Sesuai Beban Tugas
Tidak semua tugas membutuhkan model termahal. Menggunakan model yang tepat untuk tugas yang tepat adalah kunci utama hemat kuota:
- Tugas Ringan & Tanya Jawab Cepat: (Cari definisi kata, perbaiki tata bahasa, terjemahan kalimat pendek, ringkas teks singkat)
→ Gunakan Model Gratis / Flash: Agnes 3.0 Flash, Space Bunny, Ling 3.0 Flash, atau Gemini 3.1 Flash Lite. Biayanya hanya Rp 0 s.d. Rp 6 per pesan. - Riset Harian, Brainstorming & Penulisan Dokumen: (Membuat draf artikel, diskusi strategi, analisis ide bisnis)
→ Gunakan Model Cerdas Hemat: GPT-6 Luna atau GLM-5.3 Flash. Keduanya sangat responsif, memiliki penalaran kuat, dan sangat hemat allowance (~Rp 25 s.d. Rp 45 per sesi percakapan panjang). - Coding Rumit, Arsitektur Sistem & Dokumen Teknis Mendalam: (Menganalisis codebase ratusan baris, debugging logika sulit, telaah jurnal ilmiah)
→ Gunakan Model Frontier: Claude Sonnet 5.5, GPT-6 Sol, atau Gemini 3.1 Pro Preview. Manfaatkan prompt cache dengan menaruh file kode di awal obrolan, sehingga revisi kode berikutnya hanya memakan biaya output token. - Frontier Teratas & Penalaran Ekstrem:
→ Gunakan Claude Opus 5.5 (Tersedia eksklusif di Paket Ultra).
3. Tips Khusus untuk Programmer & AI Coding Agent
Bagi Anda yang menggunakan Web App BotConnector atau menghubungkan API BotConnector ke tools coding (seperti Claude Code, Aider, Cline, Cursor, atau OpenCode):
- Muat Konteks Proyek Sekaligus di Awal: Lampirkan
README.md, aturan arsitektur, dan struktur folder di sesi awal. Konteks ini akan langsung masuk ke Hot Cache. - Kirim Perintah Terfokus: Minta perbaikan fungsi secara bertahap per file alih-alih meminta AI menulis ulang seluruh proyek dalam satu prompt. Ini menghemat token output yang tarifnya lebih tinggi.
4. Trik Memaksimalkan Kuota Gambar
- Eksplorasi Ide dengan Kuota Harian Gratis: Manfaatkan kuota 10–50 gambar gratis per hari untuk mencoba berbagai gaya prompt dan komposisi visual.
- Simpan Kuota Bulanan untuk Hasil Akhir: Kuota gambar bulanan (tier Hemat, Menengah, dan Premium) sebaiknya digunakan saat prompt sudah matang untuk menghasilkan gambar beresolusi tinggi atau ilustrasi siap pakai.