Pocket TTS: Revolusi TTS di CPU? Kyutai Lab Bikin Gempar dengan Model Real-Time yang Bikin GPU Nganggur!

Pocket TTS: Revolusi TTS di CPU? Kyutai Lab Bikin Gempar dengan Model Real-Time yang Bikin GPU Nganggur!

Oleh Reggi, 25 Sep 2026

Di era ketika setiap aplikasi AI seolah wajib disokong GPU monster atau koneksi ke cloud API berbayar, muncul kabar dari Kyutai Labs yang cukup bikin mata melotot. Mereka merilis Pocket TTS: TTS Real-Time Open Source dari Kyutai Labs, sebuah aplikasi text-to-speech (TTS) yang diklaim sangat efisien, berjalan mulus di CPU, dan bisa ngebut tanpa perlu hardware kelas dewa. Jujur saja, klaim semacam ini langsung memicu skeptisisme alamiah seorang tech-blogger veteran seperti saya. Tapi setelah mengulik lebih dalam referensi yang ada, sepertinya Kyutai Labs ini bukan sedang nge-prank. Mereka justru sedang menantang status quo industri.

Kita semua tahu, generative AI, terutama yang terkait suara, biasanya identik dengan resource hog. Butuh GPU dengan VRAM segede gaban atau setidaknya berlangganan layanan cloud dengan biaya bulanan yang lumayan. Problem ini bikin banyak developer independen atau proyek-proyek embedded mikir keras. Nah, Pocket TTS ini datang membawa angin segar. "Lupakan ribetnya GPU dan web API," begitu kira-kira pesannya. Cukup pip install dan panggil fungsi, audio sudah siap keluar. Ini bukan cuma "mempermudah", tapi "mendobrak" barrier to entry yang selama ini cukup tinggi.

Kok Bisa TTS Real-Time Cuma Modal CPU? Ini Dia Resep Rahasianya

Pertanyaan pertama yang muncul adalah, "Emang iya, bisa se-efisien itu?" Referensi menunjukkan beberapa alasan mengapa Pocket TTS bisa menjadi game-changer di ranah CPU:

  • Model Size Kecil: Modelnya cuma 100 juta parameter. Di tengah tren model yang ukurannya terabyte, 100 juta itu tergolong mini. Ini kunci utama kenapa dia bisa lincah di CPU. Ibaratnya, bukan truk besar yang butuh jalan tol lebar, tapi motor yang bisa nyelip di mana saja.
  • Efisiensi Optimal: Dirancang khusus untuk efisiensi CPU. Bahkan, hanya butuh 2 CPU core saja untuk beroperasi. Ini penting buat device dengan resource terbatas atau server yang ingin menghemat overhead.
  • Latensi Rendah: Klaimnya, latensi untuk mendapatkan first audio chunk hanya sekitar 200ms. Ini sangat krusial untuk aplikasi real-time seperti asisten suara atau screen reader yang butuh respons instan.
  • Lebih Cepat dari Real-Time: Di MacBook Air M4 (CPU kencang single-thread), performanya mencapai 6x real-time. Artinya, kalau ada teks sepanjang 1 menit, dia bisa menyelesaikannya dalam 10 detik. Gila!

Kombinasi faktor-faktor ini yang membuat Pocket TTS tidak cuma viable di CPU, tapi juga performant. Ini bukan sekadar "bisa jalan", tapi "bisa lari kencang".

Fitur-Fitur Andalan yang Bikin Pengembang Auto-Install

Selain performa yang bikin terheran-heran, Pocket TTS juga datang dengan segudang fitur praktis yang membuatnya langsung siap tempur untuk berbagai skenario:

  • Dukungan Multi-bahasa: Secara bawaan sudah mendukung Inggris, Prancis, Jerman, Portugis, Italia, dan Spanyol. Plus, ada varian 24-layer untuk bahasa non-Inggris yang kualitasnya lebih tinggi (tapi sedikit lebih lambat).
  • Voice Cloning: Ini fitur favorit para developer yang ingin bikin app personal. Kamu bisa memasukkan file .wav sebagai input suara, dan Pocket TTS akan mencoba meniru gaya bicara dari suara tersebut. Bahkan ada rekomendasi untuk membersihkan sampel agar kualitasnya optimal.
  • Input Teks Tak Terbatas: Mampu menangani input teks yang panjangnya "tak terbatas" (infinitely long). Buat audiobook generator atau narrator dokumen panjang, ini adalah fitur esensial.
  • API Python & CLI: Fleksibilitas ini sangat disukai. Mau integrasi di codebase Python? Ada API-nya. Mau cepat generate dari command line? Ada CLI-nya. Bahkan bisa di-serve sebagai local server HTTP dengan web interface untuk testing cepat, yang jelas jauh lebih efisien karena modelnya disimpan di memori.

Mempercepat Voice Cloning dengan Safetensors

Meskipun processing audio file untuk voice cloning terbilang cukup lambat, Kyutai Labs memberikan solusi cerdas. Kamu bisa menggunakan command export-voice untuk mengubah audio file menjadi voice embedding berekstensi .safetensors. File ini, yang pada dasarnya adalah representasi kvcache dari suara, bisa dimuat sangat cepat di kemudian hari.

python
from pocket_tts import TTSModel, export_model_state model = TTSModel.load_model() # Export state from an audio file model_state = model.get_state_for_audio_prompt("your_voice.wav") export_model_state(model_state, "./your_voice.safetensors") # Later, load it super fast model_state_copy = model.get_state_for_audio_prompt("./your_voice.safetensors") audio = model.generate_audio(model_state_copy, "Halo dunia! Ini suara kloning saya.")

Ini mirip seperti caching atau pre-rendering aset penting, jadi runtime aplikasi bisa loading suara kustom dengan latency minimal.

Instalasi dan Deployment: Gampang, Tapi Ada Beberapa Detail yang Perlu Diperhatikan

Untuk memulai, setup Pocket TTS tergolong simpel. Mayoritas pengguna cukup dengan:

bash
pip install pocket-tts

Atau menggunakan uv yang lebih modern:

bash
uv add pocket-tts

Namun, ada sedikit catatan penting, terutama untuk pengguna Linux. Secara default, pip akan mengunduh build PyTorch versi CUDA, bahkan jika kamu hanya ingin menjalankan di CPU. Ini bisa menambah ukuran install beberapa gigabyte yang tidak perlu. Solusinya, instal dengan --extra-index-url yang menunjuk ke build PyTorch khusus CPU:

bash
pip install pocket-tts --extra-index-url https://download.pytorch.org/whl/cpu

Untuk pengguna macOS dan Windows, masalah ini tidak relevan karena default build PyTorch sudah CPU-only. Detail kecil semacam ini menunjukkan bahwa Kyutai Labs memang serius memikirkan developer experience.

Untuk generate suara dari command line, kamu bisa pakai:

bash
uvx pocket-tts generate --text "Halo dunia, ini contoh suara dari Pocket TTS!" --voice alba

Atau jika ingin testing cepat dengan web interface lokal:

bash
uvx pocket-tts serve

Kemudian buka http://localhost:8000 di browser kamu. Praktis dan efisien.

Sensasi GPU: Benarkah CPU Sudah Cukup Perkasa?

Meskipun Pocket TTS didesain untuk CPU, referensi juga mengulas kemungkinan penggunaannya di GPU. Awalnya, ada asumsi bahwa di CPU dengan single-thread performance tinggi (seperti Apple Silicon), GPU tidak akan memberikan speedup yang signifikan karena modelnya kecil dan batch size-nya 1.

Namun, realita di cloud x86 VM dengan Tesla T4 menunjukkan hasil yang berbeda: GPU justru memberikan speedup yang konsisten, sekitar 2.6x lebih cepat dibanding CPU. Real-time factor (RTF) meningkat dari 2.3-2.5x di CPU menjadi 6.28x di GPU.

Ini artinya, kinerja di GPU sangat hardware-dependent. Jika CPU kamu punya keterbatasan thread atau performanya tidak sekencang laptop modern, mencoba di GPU bisa sangat worth it. Kendalanya? Tidak ada device argument di TTSModel.load_model(), jadi harus explicitly memindahkan model ke GPU secara manual:

python
tts_model = TTSModel.load_model() tts_model.to("cuda") # Pindahkan model ke GPU # ... audio = tts_model.generate_audio(voice_state, "Hello world, this is a test.") # Audio hasil generate ada di GPU, perlu dipindah ke CPU sebelum di-save scipy.io.wavfile.write("output.wav", tts_model.sample_rate, audio.detach().cpu().numpy())

Beberapa catch lainnya adalah quantize=True (int8 dynamic quantization) hanya jalan di CPU, dan ada potensi isu kompatibilitas torch atau torchao jika kamu punya pinned versi CUDA yang spesifik. Ini penting banget untuk diketahui developer yang ingin tweak performa maksimal.

Kekuatan Sejati Open Source: Komunitas yang Tak Terbendung

Salah satu aspek paling menarik dari Pocket TTS adalah pendekatannya yang open source. Kyutai Labs bahkan sudah merilis training code-nya, yang berarti siapa pun bisa mulai melatih model mereka sendiri. Ini membuka pintu lebar-lebar bagi komunitas untuk berinovasi.

Lihat saja daftar model yang sudah dilatih oleh komunitas:

BahasaKontributorLayersContoh Teks
Czech@vvolhejnN/A"Dnešek je velmi dobrý den"
HindiSaryps LabsN/A"आज का दिन बहुत अच्छा है"
Korean@seastar105300M"안녕하세요. 한국어 음성 합성 모델입니다."
Persian@mallahyariN/A"سلام، حال شما چطور است؟"
Indonesian@anak10thn6"Selamat pagi. Ini model sintesis suara bahasa Indonesia."
Estonian@cbentesN/A"Tere! Mina olen eesti keele kõnesüntesaator..."
WelshEryriLabs24"Mae'r tywydd yn braf yng Nghymru heddiw."
Polish@shefowl6"Dzień dobry. Nazywam się Krzysztof Wiśniewski i mówię po polsku."

Pocket TTS Indonesian dari @anak10thn adalah bukti nyata bagaimana developer lokal kita juga turut berkontribusi! Ini menunjukkan bahwa fondasi yang kuat dari Pocket TTS memungkinkan adaptasi ke berbagai bahasa dan kebutuhan.

Selain itu, komunitas juga aktif membuat implementasi alternatif (Rust, MLX, C++, C#) dan berbagai proyek yang memanfaatkan Pocket TTS, seperti:

  • pocket-reader: Screen reader berbasis browser.
  • pocket-tts-wyoming: Kontainer Docker untuk integrasi dengan Home Assistant Voice.
  • Sonorus: Mod untuk Hogwarts Legacy yang memungkinkan karakter berbicara dengan suara aslinya.
  • Native macOS App dan Electron macOS App: Aplikasi desktop tanpa Python, berjalan on-device.
  • pocket-tts-openai_streaming_server: Server streaming yang kompatibel dengan API OpenAI.
  • ComfyUI-Pocket-TTS: TTS berbasis CPU untuk ComfyUI.
  • seshat-tts: Accessibility tool real-time untuk game dan aplikasi.
  • LocalVocal.ai: Harness suara konversasional lokal untuk Mac dengan Apple Silicon.

Daftar ini adalah testament akan potensi besar Pocket TTS. Dari screen reader hingga game modding dan smart home, aplikasinya luas sekali.

Etika dan Batasan: Tanggung Jawab dalam Kloning Suara

Seperti teknologi AI generatif lainnya, Pocket TTS juga tidak lepas dari isu etika. Kyutai Labs secara tegas mencantumkan "Prohibited use" yang melarang keras penggunaan model untuk:

  • Voice impersonation atau cloning tanpa izin yang sah.
  • Misinformasi, disinformasi, atau penipuan (misal: fake news, panggilan penipuan).
  • Membuat konten ilegal, berbahaya, memfitnah, atau melanggar privasi.

Ini adalah langkah yang patut diacungi jempol. Di tengah hype teknologi, penting untuk selalu mengingatkan para pengembang dan pengguna akan tanggung jawab etis dalam memanfaatkan tool sekuat ini.

Kesimpulan: Sebuah Era Baru untuk TTS Lokal?

Pocket TTS dari Kyutai Labs adalah sebuah statement. Di saat industri gencar-gencarnya mendorong reliance pada GPU atau layanan cloud berbayar, mereka hadir dengan solusi open source yang efisien di CPU. Ini bukan cuma tentang performa, tapi juga tentang demokratisasi akses ke teknologi TTS tingkat lanjut.

Bagi developer di Indonesia, khususnya yang sering berhadapan dengan keterbatasan budget hardware atau ingin deploy aplikasi TTS di embedded devices, Pocket TTS adalah anugerah. Kemampuan voice cloning, dukungan multi-bahasa (termasuk bahasa Indonesia dari komunitas!), dan kemudahan deployment lokal menjadikannya pilihan yang sangat menarik.

Apakah ini akhir dari dominasi GPU di ranah TTS? Tentu belum. Tapi ini adalah awal yang sangat menjanjikan untuk ekosistem real-time text-to-speech yang lebih inklusif dan terjangkau. Kyutai Labs telah membuka gerbang, sekarang tinggal bagaimana komunitas memanfaatkannya.

Referensi

https://github.com/kyutai-labs/pocket-tts


Sedang Ramai Dibaca