Pocket TTS: Ketika Kyutai Labs Menantang Dominasi GPU di Ranah TTS, Bisakah Bertahan?

Pocket TTS: Ketika Kyutai Labs Menantang Dominasi GPU di Ranah TTS, Bisakah Bertahan?

Oleh Reggi, 25 Sep 2026

Pernah dong, kita semua merasakan betapa ribetnya saat mau pakai model AI yang powerful tapi syaratnya harus punya kartu grafis sekelas sultan, atau minimal langganan API cloud yang tagihannya bikin deg-degan? Rasanya kayak punya mobil balap tapi cuma bisa jalan di sirkuit privat berbayar. Nah, di tengah gempuran tren "GPU-or-nothing" ini, muncul satu proyek yang berani beda: Pocket TTS: TTS Real-Time Open Source dari Kyutai Labs. Mereka datang dengan klaim yang cukup menantang: Text-to-Speech (TTS) berkualitas tinggi yang dirancang untuk CPU, bukan GPU. Kedengarannya terlalu bagus buat jadi kenyataan, kan?

Lawan Arus Hype: Mengapa CPU-First Ini Penting?

Sejak awal, Kyutai Labs dengan Pocket TTS-nya sudah pasang badan di segmen "lightweight". Mereka ingin kita melupakan semua keribetan urusan GPU dan web API yang jadi jembatan ke model-model TTS raksasa. Ibaratnya, kalau kompetitor lain sibuk adu kuda pacu tercepat di jalan tol super lebar (GPU), Pocket TTS ini malah fokus bikin motor trail paling lincah dan irit yang bisa lewat jalan setapak mana pun (CPU).

Kenapa ini jadi terobosan? Bayangkan: kita bisa menghasilkan audio cuma dengan pip install dan panggil satu fungsi Python. Simpel. Enggak perlu pusing kompatibilitas CUDA, driver, atau beli rig baru. Ini membuka gerbang AI ke banyak developer dan pengguna dengan setup standar. Data Kyutai sendiri cukup mengesankan:

  • Model Kecil: Hanya 100 juta parameter. Ini ukuran yang sangat ringkas untuk sebuah model TTS.
  • Efisiensi CPU: Hanya butuh 2 core CPU saja. Artinya, laptop kantor atau bahkan Raspberry Pi pun punya potensi.
  • Latensi Rendah: Sekitar 200 milidetik untuk mendapatkan chunk audio pertama. Ini krusial untuk aplikasi real-time seperti asisten suara atau live narration.
  • Lebih Cepat dari Real-Time: Klaimnya, bisa sampai ~6x lebih cepat dari real-time di CPU MacBook Air M4. Sebuah performa yang bikin GPU sebelah gigit jari, setidaknya di skenario tertentu.
  • Streaming Audio: Fitur penting untuk aplikasi interaktif, di mana audio bisa diputar sambil proses generation masih berjalan.

Poin-poin di atas bukan cuma sekadar angka. Ini adalah fondasi yang memungkinkan developer untuk membangun aplikasi TTS yang responsif, deployable di banyak platform tanpa biaya infrastruktur selangit, dan bahkan bisa dijalankan secara offline untuk privasi data.

Fitur-fitur yang Bikin Ngiler: Bukan Cuma Kencang di CPU

Oke, cepat dan irit itu penting. Tapi, apakah fitur-fiturnya komplit? Jawabannya, lebih dari cukup untuk kebanyakan kasus. Pocket TTS menawarkan:

  • Voice Cloning: Ini salah satu fitur paling keren. Kita bisa memberikan file audio (misalnya, .wav atau .mp3) sebagai prompt, dan model akan meniru karakteristik suara dari sample tersebut. Kyutai bahkan menyarankan untuk membersihkan sample audio agar hasilnya optimal. Proses ini awalnya lumayan lambat, tapi kita bisa export voice state ke file safetensors agar loading di kemudian hari jauh lebih cepat.
  • Multi-Language Support: Bahasa Inggris, Prancis, Jerman, Portugis, Italia, Spanyol sudah didukung. Bahkan ada varian 24-layer yang kualitasnya lebih tinggi (tapi lebih lambat) untuk bahasa non-Inggris.
  • Input Teks Tak Terbatas: Mampu menangani input teks sepanjang apa pun. Jadi, mau bikin audiobook dari novel tebal? Gas!
  • API Python & CLI: Fleksibilitas ini memungkinkan developer mengintegrasikannya ke aplikasi atau sekadar pakai via command line untuk batch processing.
  • In-browser & Alternatif Implementasi: Walaupun belum ada dukungan resmi Kyutai, komunitas sudah banyak berkarya. Ada port Rust, ONNX Runtime Web, Candle, bahkan ke MLX yang dioptimalkan untuk Apple Silicon, memungkinkan Pocket TTS berjalan langsung di browser atau berbagai platform lainnya.

Instalasi dan Uji Coba: Semudah 'pip install'?

Kyutai mempermudah developer dengan beberapa opsi instalasi dan penggunaan. Yang paling umum tentu saja via pip:

bash
pip install pocket-tts

Tapi, ada catatan penting untuk pengguna Linux. Secara default, pip mungkin akan menarik build PyTorch versi CUDA yang besarnya bisa sampai beberapa gigabyte, padahal kita mau pakai CPU-only. Untuk menghindari ini, pakai extra-index-url ke PyTorch CPU index:

bash
pip install pocket-tts --extra-index-url https://download.pytorch.org/whl/cpu

Setelah terinstal, kita bisa langsung pakai via CLI:

bash
uvx pocket-tts generate --text "Halo dunia, ini adalah pengujian." --voice alba

Atau kalau mau lebih fleksibel, pakai sebagai library Python:

python
from pocket_tts import TTSModel import scipy.io.wavfile # Load model (sekali saja, simpan di memori) tts_model = TTSModel.load_model() # Dapatkan 'state' untuk suara tertentu (juga simpan di memori) # Bisa dari nama suara bawaan, file WAV lokal, atau dari Hugging Face voice_state = tts_model.get_state_for_audio_prompt("alba") # Generate audio audio = tts_model.generate_audio(voice_state, "Hello world, this is a test.") # Simpan ke file WAV scipy.io.wavfile.write("output.wav", tts_model.sample_rate, audio.numpy())

Untuk voice cloning yang lebih cepat, jangan lupa pakai fungsi export_model_state untuk menyimpan voice embedding ke file safetensors. Ini akan mengurangi waktu loading secara signifikan.

Realita GPU: Benar-benar Nggak Butuh?

Ini bagian yang paling menarik dan jujur dari dokumentasi Kyutai. Mereka awalnya mengklaim tidak melihat speedup signifikan di GPU pada hardware dengan performa CPU single-thread kuat (seperti Apple Silicon), karena modelnya kecil dan batch size yang digunakan hanya 1. Logis.

TAPI, ADA TAPINYA.

Pengukuran di cloud x86 VM (4 vCPU) dengan GPU Tesla T4 menunjukkan hasil yang berbeda. Di sana, memindahkan model ke GPU memberikan speedup konsisten sekitar 2.6x dibandingkan CPU (RTF ~2.3-2.5x di CPU vs. ~6.28x di GPU). Ini artinya, jika CPU kita tidak sekuat chip laptop modern atau thread-limited, GPU masih sangat layak dicoba.

Kyutai Labs dengan jujur mengakui ini dan bahkan memberikan workaround bagi yang ingin mencoba di GPU, meskipun tidak didukung secara resmi melalui argumen device pada TTSModel.load_model():

python
tts_model = TTSModel.load_model() tts_model.to("cuda") # Pindahkan model ke GPU secara manual # ... lanjutkan generate audio audio = tts_model.generate_audio(voice_state, "Hello world, this is a test.") # Pastikan audio dipindahkan kembali ke CPU sebelum .numpy() scipy.io.wavfile.write("output.wav", tts_model.sample_rate, audio.detach().cpu().numpy())

Ada beberapa hal yang perlu diperhatikan kalau mau pakai GPU: CLI generate punya opsi --device, tapi serve dan Docker image masih CPU-only. Lalu, quantization int8 dynamic (quantize=True) hanya bisa jalan di CPU. Intinya, kalau kamu punya GPU nganggur dan CPU-mu bukan yang paling kencang di dunia, jangan ragu bereksperimen. Bisa jadi malah lebih ngebut.

Community Power: Ketika Open Source Bicara

Dampak open-source dari Pocket TTS ini sudah terasa luas. Bukan cuma developer yang bisa utak-atik kode, tapi komunitas juga aktif melatih model untuk berbagai bahasa dan menciptakan proyek-proyek menarik.

Model Bahasa Komunitas (Beberapa contoh pilihan):

| Model | Pengembang | Detail Pocket TTS Czech by @vvolhejn | Pocket TTS Hindi by Saryps Labs | Pocket TTS Korean 300M by @seastar105 | Pocket TTS Persian (Farsi) by @mallahyari | Pocket TTS Indonesian by @anak10thn (6 layers) | Pocket TTS Estonian by @cbentes | Pocket TTS Cymraeg (Welsh) by EryriLabs (24 layers) | Pocket TTS Polish by @shefowl (6 layers)

Ini adalah bukti nyata bagaimana model open-source bisa diadopsi dan diadaptasi untuk kebutuhan spesifik komunitas lokal. Kehadiran model bahasa Indonesia tentu sangat relevan untuk konteks kita, membuka banyak kemungkinan aplikasi lokal.

Selain itu, beragam proyek yang menggunakan Pocket TTS juga menunjukkan seberapa serbagunanya framework ini. Dari screen reader (pocket-reader), integrasi ke Home Assistant (pocket-tts-wyoming), aplikasi macOS native, sampai server yang kompatibel dengan OpenAI API (pocket-tts-openai_streaming_server, pocket-tts-server), Unity, bahkan ComfyUI. Yang paling menarik, ada proyek seperti Sonorus yang memungkinkan kita berbicara dengan karakter Hogwarts Legacy menggunakan suara aslinya, atau LocalVocal.ai untuk Mac dengan Apple Silicon yang menawarkan conversational voice-harness lokal. Ini bukan cuma proof-of-concept, tapi implementasi nyata yang fungsional.

Etika dan Batasan Penggunaan

Sebagai tool yang kuat, Pocket TTS juga membawa tanggung jawab etis. Kyutai Labs sudah jelas menegaskan batasan penggunaannya: dilarang keras untuk peniruan suara tanpa izin, misinformasi, disinformasi, penipuan, atau konten ilegal/berbahaya. Ini penting. Teknologi ini powerful, tapi harus dipakai secara bijak dan bertanggung jawab.

Kesimpulan: Masa Depan TTS Ada di Tangan Siapa?

Kyutai Labs dengan Pocket TTS telah membuktikan bahwa performa tinggi di ranah TTS tidak selalu harus identik dengan horsepower GPU yang membakar listrik dan dompet. Dengan fokus pada efisiensi CPU, model kecil, dan latensi rendah, mereka menawarkan alternatif yang sangat menarik, terutama untuk skenario edge computing, aplikasi offline, dan developer dengan budget terbatas.

Meskipun ada caveat performa GPU di beberapa hardware x86 cloud, inti filosofi Pocket TTS tetap kuat: mendemokratisasi akses ke teknologi TTS real-time. Kehadiran komunitas yang aktif, yang bahkan berhasil melatih model bahasa Indonesia, semakin menguatkan posisi Pocket TTS sebagai salah satu pemain kunci di masa depan TTS yang lebih inklusif dan terdesentralisasi. Jadi, jika Anda mencari solusi TTS yang ringan, cepat, dan open source, Pocket TTS layak jadi bahan pertimbangan serius.

Referensi

https://github.com/kyutai-labs/pocket-tts


Sedang Ramai Dibaca