Capek Bayar API Cloud? Pocket TTS Buktikan Voice Cloning Real-Time Bisa Jalan Lancar Cuma Pakai 2 Core CPU

Capek Bayar API Cloud? Pocket TTS Buktikan Voice Cloning Real-Time Bisa Jalan Lancar Cuma Pakai 2 Core CPU

Oleh Reggi, 25 Sep 2026

Kalau ada satu hal yang bikin malas saat mencoba teknologi voice cloning lokal, itu adalah urusan hardware. Kita sering kali dipaksa melakukan setup environment yang rumit, mengunduh model berukuran raksasa, hingga kehabisan memori kartu grafis bahkan sebelum satu kalimat pun selesai diucapkan. Di sinilah Pocket TTS: TTS Real-Time Open Source dari Kyutai Labs hadir sebagai antitesis dari semua kerumitan tersebut.

Kyutai Labs merancang pustaka ini dengan satu misi yang sangat pragmatis: membuang ketergantungan pada GPU mahal dan API cloud berbayar. Hasilnya adalah sebuah mesin text-to-speech (TTS) yang siap pakai, hemat daya, dan cukup dijalankan di atas prosesor komputer harian Anda. Mari kita bedah bagaimana teknologi ini bekerja dan mengapa rilis ini menjadi angin segar bagi para developer serta praktisi teknologi.


Mengapa Harus Peduli dengan Model 100M Parameter?

Di era saat semua pengembang berlomba-lomba memperbesar ukuran parameter model AI, Kyutai Labs justru mengambil arah berlawanan. Mereka merilis model super ringkas dengan ukuran hanya 100 juta parameter.

Bagi yang biasa bergelut dengan model berukuran miliaran parameter, angka 100M mungkin terdengar sangat kecil. Namun, di sinilah letak kehebatannya. Dengan ukuran sekecil ini, Pocket TTS mampu menghasilkan latensi yang luar biasa rendah, hanya membutuhkan waktu sekitar 200 milidetik untuk menyemburkan potongan audio pertama (first audio chunk).

Berikut adalah spesifikasi mendasar dan kemampuan utama yang dibawa oleh Pocket TTS:

  • Berjalan di CPU: Tidak memerlukan instalasi PyTorch versi CUDA yang berat untuk penggunaan standar.
  • Audio Streaming: Audio tidak perlu digenerate utuh terlebih dahulu baru diputar, melainkan dikirimkan secara bertahap (streaming) secara instan.
  • Hemat Resource: Hanya membutuhkan 2 core CPU untuk bekerja secara optimal.
  • Voice Cloning Lokal: Anda bisa meniru karakter suara apa pun hanya dengan memberikan sampel file audio format wav sebagai referensi.
  • Input Teks Tanpa Batas: Sistem mampu menangani input teks yang panjang tanpa batasan karakter konvensional.

Ekspektasi vs Realita Performa: CPU vs GPU

Satu hal yang sering kali menjadi perdebatan di komunitas hardware adalah apakah GPU selalu mutlak diperlukan untuk urusan kecerdasan buatan. Pocket TTS memberikan jawaban yang cukup mengejutkan melalui pengujian performa nyata.

Pada arsitektur Apple Silicon seperti laptop dengan prosesor MacBook Air M4, performa Pocket TTS mampu menembus angka 6 kali lebih cepat dari real-time. Menariknya, pada hardware dengan performa single-thread yang sangat kuat seperti ini, penggunaan GPU justru tidak memberikan peningkatan kecepatan yang berarti. Hal ini disebabkan oleh penggunaan ukuran batch tunggal (batch size of 1) serta ukuran model yang sangat kecil.

Namun, kondisinya akan sedikit berbeda jika Anda menggunakan infrastruktur cloud atau prosesor x86 yang memiliki keterbatasan thread. Mari kita lihat perbandingannya berdasarkan data laporan teknis mereka:

Jenis HardwareKonfigurasi PengujianPerforma Kecepatan (Real-Time Factor)
Apple Silicon (MacBook Air M4 CPU)Menggunakan 2 Core CPU~6.0x Lebih Cepat
Cloud x86 Virtual Machine4 vCPUs (Tanpa GPU)~2.3x - 2.5x Lebih Cepat
Cloud x86 VM + Tesla T4 GPUMode GPU Manual (CUDA)~6.28x Lebih Cepat (~2.6x Speedup vs CPU VM)

Dari data di atas, kita bisa menarik kesimpulan yang sangat pragmatis: jika Anda menjalankan model ini di laptop modern berarsitektur ARM, lupakan GPU. Namun, jika Anda mendeploy sistem ini di virtual machine (VM) cloud murah dengan CPU yang terbatas, memindahkan model ke GPU lawas seperti Tesla T4 akan memberikan suntikan performa hingga 2,6 kali lipat.


Panduan Instalasi Cepat Tanpa Bloatware

Salah satu masalah klasik saat menginstal library berbasis PyTorch di sistem operasi Linux adalah sistem secara otomatis akan menarik package CUDA dari PyPI yang berukuran hingga gigabytes. Padahal, kita hanya ingin menjalankannya di CPU.

Pocket TTS mengatasi masalah ini dengan mendukung manajer paket modern seperti uv. Jika Anda ingin menginstalnya di Linux tanpa mengunduh runtime CUDA sebesar 3 GB, Anda bisa memaksa instalasi menggunakan indeks CPU-only dari PyTorch.

Berikut cara instalasi bersih menggunakan terminal:

bash
# Menggunakan uv untuk menjalankan CLI secara instan tanpa install global uvx --index https://download.pytorch.org/whl/cpu pocket-tts generate # Atau install secara manual menggunakan pip dengan indeks CPU pip install pocket-tts --extra-index-url https://download.pytorch.org/whl/cpu

Untuk pengguna sistem operasi macOS dan Windows, Anda tidak perlu pusing memikirkan hal ini karena wheel default dari PyTorch di platform tersebut sudah dikonfigurasi secara CPU-only secara bawaan.


Implementasi Python API dan Trik Optimasi Memori

Integrasi Pocket TTS ke dalam basis kode Python Anda sangatlah sederhana. Namun, ada satu poin krusial yang perlu diperhatikan terkait efisiensi memori dan waktu eksekusi program.

Fungsi untuk memuat model (load_model()) dan memproses sampel suara (get_state_for_audio_prompt()) adalah proses yang memakan waktu paling lama. Oleh karena itu, sangat disarankan untuk menjaga model dan objek status suara tetap berada di dalam memori jika aplikasi Anda berjalan secara terus-menerus.

Berikut adalah contoh skrip Python dasar untuk melakukan generate audio:

python
from pocket_tts import TTSModel import scipy.io.wavfile # Muat model ke memori (lakukan ini sekali saja) tts_model = TTSModel.load_model() # Buat state untuk karakter suara menggunakan sampel bawaan "alba" voice_state = tts_model.get_state_for_audio_prompt("alba") # Proses teks menjadi data audio PCM 1D tensor audio = tts_model.generate_audio(voice_state, "Selamat pagi. Ini adalah uji coba suara.") # Simpan hasil generate ke file wav lokal scipy.io.wavfile.write("output.wav", tts_model.sample_rate, audio.numpy())

Trik Mempercepat Loading Menggunakan Safetensors

Jika aplikasi Anda sering berganti-ganti karakter suara (voice cloning), memproses file mentah wav atau mp3 secara berulang akan membuat aplikasi terasa lambat. Solusinya adalah mengekspor kondisi suara tersebut menjadi file berformat safetensors.

Proses ini akan menyimpan data key-value cache langsung ke dalam penyimpanan lokal, sehingga saat dijalankan kembali, sistem hanya perlu membaca file tanpa perlu melakukan kalkulasi ulang yang berat.

python
from pocket_tts import TTSModel, export_model_state model = TTSModel.load_model() # Ekspor profil suara mentah menjadi safetensors model_state = model.get_state_for_audio_prompt("suara_referensi.wav") export_model_state(model_state, "./suara_referensi.safetensors") # Di kemudian hari, muat file safetensors ini secara instan model_state_cepat = model.get_state_for_audio_prompt("./suara_referensi.safetensors") audio = model.generate_audio(model_state_cepat, "Halo dunia!")

Ekosistem Komunitas dan Model Bahasa Indonesia

Kabar terbaik bagi para pengembang lokal di tanah air adalah tersedianya model khusus bahasa Indonesia. Dikembangkan oleh kontributor komunitas dengan nama pengguna @anak10thn, model ini menggunakan konfigurasi 6 layers yang sangat optimal untuk dijalankan di perangkat berspesifikasi rendah.

Selain bahasa Indonesia, komunitas global juga telah melatih berbagai model untuk bahasa lain seperti bahasa Ceko, Hindi, Korea, Persia, Estonia, Welsh, hingga Polandia.

Untuk mencoba model bahasa Indonesia ini langsung dari baris perintah terminal, Anda hanya perlu menjalankan perintah berikut:

bash
uvx pocket-tts generate \ --config hf://anak10thn/pocket-tts-indonesian/indonesian_6l.yaml@6196fe14c6c2108332c16d33c864c8901c044aaa \ --text "Selamat pagi. Ini model sintesis suara bahasa Indonesia."

Fleksibilitas ini membuka ruang yang sangat luas bagi integrasi aplikasi pihak ketiga. Beberapa proyek komunitas bahkan sudah mengintegrasikan Pocket TTS ke berbagai platform populer, seperti:

  • ComfyUI-Pocket-TTS: Membawa generator suara lokal ke dalam alur kerja pemrosesan gambar berbasis node.
  • pocket-tts-wyoming: Integrasi server suara lokal untuk ekosistem smart home menggunakan Home Assistant.
  • Sonorus: Memungkinkan interaksi suara langsung dengan karakter di dalam game Hogwarts Legacy menggunakan suara asli mereka.
  • Native macOS App: Aplikasi bawaan Mac yang berjalan sepenuhnya secara lokal menggunakan Core ML tanpa ketergantungan pada Python.
  • pocket-tts-unity: Integrasi engine suara real-time langsung ke dalam game engine Unity 6.

Catatan Kritis dan Aturan Main yang Wajib Diperhatikan

Meski performanya mengagumkan untuk ukuran model CPU, Pocket TTS tetap memiliki batasan teknis yang perlu dipahami secara objektif. Saat ini, model belum mendukung penambahan jeda atau kesunyian (silence) secara manual di dalam input teks untuk mengatur ritme jeda bicara secara presisi.

Selain itu, fitur kuantisasi dinamis berbasis int8 (quantize=True) hanya dapat berjalan dengan baik di CPU. Jika Anda mencoba mengaktifkannya setelah memindahkan model ke kartu grafis berbasis CUDA, sistem akan langsung memuntahkan pesan error NotImplementedError.

Dari sisi etika penggunaan, Kyutai Labs menerapkan aturan yang sangat ketat. Penggunaan model ini dilarang keras untuk aktivitas manipulasi informasi, penipuan panggilan suara (fraudulent calls), serta kloning suara tokoh atau individu tanpa persetujuan eksplisit dan sah secara hukum. Sebagai pengembang yang bijak, kepatuhan terhadap regulasi ini mutlak diperlukan demi menjaga ekosistem AI tetap sehat dan aman untuk semua orang.

Referensi


Sedang Ramai Dibaca