Overview
Key Features
- Few-Shot Speaker Adaptation: Mengekstrak vektor representasi pembicara (speaker embeddings) dari cuplikan audio singkat tanpa perlu proses retraining model yang memakan waktu lama.
- Mobile Integration ("Tutur" App): Integrasi seamless ke dalam aplikasi mobile "Tutur", memungkinkan pengguna melakukan kloning dan sintesis suara secara cepat langsung dari perangkat genggam.
- Kontrol Prosodi & Emosi: Menyesuaikan nada bicara (pitch), kecepatan tempo, dan intonasi emosional (netral, antusias, tenang, formal).
- Neural Vocoder Berlatensi Rendah: Menghasilkan bentuk gelombang audio (raw audio waveforms) berkualitas tinggi mendekati standar rekaman studio menggunakan arsitektur HiFi-GAN / BigVGAN.
- Dukungan Multibahasa: Kemampuan menyintesis teks dalam bahasa Indonesia dan bahasa Inggris dengan tetap mempertahankan karakteristik unik suara penutur asli.
- Web & Mobile Interface: Antarmuka interaktif pada web dan aplikasi mobile untuk merekam/mengunggah sampel suara, memasukkan teks skrip, dan mendengarkan hasil sintesis secara instan.
Technologies Used
- PyTorch & CUDA: Framework komputasi utama untuk arsitektur deep learning dan akselerasi inferensi GPU.
- VITS & FastSpeech2: Model arsitektur end-to-end Text-to-Speech untuk pemetaan teks ke representasi mel-spektrogram.
- HiFi-GAN Vocoder: Neural vocoder berbasis GAN untuk sintesis audio resolusi tinggi.
- FastAPI Backend & On-Device Processing Optimization: Service RESTful API yang melayani permintaan sintesis audio secara asynchronous serta optimasi inferensi untuk perangkat mobile.
- Flutter / React Native & Web Audio API: Antarmuka aplikasi mobile "Tutur" serta dashboard visual untuk pemutar audio interaktif dan perekaman langsung.