Ilustrasi Google Rilis Gemini 3.5 Transcribe
Google merilis model kecerdasan buatan (AI) terbaru bernama Gemini 3.5 Transcribe. AI ini dirancang untuk mengubah ucapan menjadi teks dengan lebih cepat dan akurat.
Gemini 3.5 Transcribe tidak hanya menyalin percakapan, tetapi juga dapat memahami konteks pembicaraan dan merapikan hasil transkripsi. Berbeda dari teknologi speech-to-text konvensional, Gemini mampu menghilangkan kata-kata pengisi yang umum muncul saat seseorang berbicara, seperti "ehm" atau "eee".
Kemampuan tersebut membuat hasil transkripsi menjadi lebih bersih dan siap digunakan. Google mengklaim Gemini 3.5 Transcribe memiliki peningkatan kecepatan dan akurasi dibandingkan model speech-to-text sebelumnya, yakni Chirp 3.
Gemini 3.5 Transcribe Lebih Cepat
Menurut Google, Gemini 3.5 Transcribe mampu memproses suara menjadi teks akhir sekitar 70 persen lebih cepat dibandingkan Chirp 3. Dari sisi akurasi, model baru tersebut juga mencatat tingkat kesalahan yang lebih rendah.
Pada percakapan langsung (live speech), Gemini 3.5 Transcribe memiliki tingkat kesalahan sebesar 5,5 persen. Sebagai perbandingan, Chirp 3 mencatat tingkat kesalahan sebesar 7,32 persen berdasarkan pengukuran Google.
Selain mengubah suara menjadi teks, Gemini 3.5 Transcribe juga dapat melakukan penyuntingan secara langsung ketika pembicara mengoreksi perkataannya. Model tersebut turut mendukung kosakata khusus yang ditentukan pengguna.
Fitur ini dapat membantu menghasilkan transkripsi yang lebih akurat ketika percakapan mengandung istilah teknis, nama khusus, atau jargon tertentu. Google mengatakan Gemini 3.5 Transcribe mendukung 85 bahasa.
Model tersebut juga dapat mengenali percakapan yang melibatkan hingga tiga pembicara dalam satu rekaman audio. Kemampuan ini membuat Gemini 3.5 Transcribe tidak hanya ditujukan untuk kebutuhan transkripsi sederhana, tetapi juga dapat digunakan untuk berbagai percakapan dengan lebih dari satu orang.
Gemini 3.5 Transcribe saat ini telah digunakan dalam fitur Rambler di aplikasi keyboard Gboard. Namun, ketersediaannya masih terbatas pada perangkat Pixel 11.
Google berencana memperluas fitur Rambler ke lebih banyak perangkat yang memiliki kemampuan Gemini pada akhir 2026. Selain itu, pengguna aplikasi Gemini di macOS juga mulai mendapatkan manfaat dari Gemini 3.5 Transcribe untuk input suara.
Google juga membuka akses Gemini 3.5 Transcribe bagi pengembang melalui sejumlah layanan. Model ini mulai tersedia di Antigravity dan AI Studio.
Pengembang juga dapat mengaksesnya melalui Gemini API untuk memasukkan kemampuan voice-to-text berbasis AI ke dalam aplikasi yang mereka kembangkan. Dengan dukungan tersebut, kemampuan transkripsi Gemini 3.5 Transcribe tidak hanya digunakan dalam produk Google, tetapi juga berpotensi hadir dalam berbagai aplikasi pihak ketiga.
Google juga menyiapkan integrasi Gemini 3.5 Transcribe ke peramban Chrome. Jika tersedia, teknologi tersebut memungkinkan pengguna memanfaatkan input suara untuk mengisi berbagai kolom teks di internet.
Misalnya, pengguna dapat menggunakannya untuk menulis e-mail, membuat komentar, hingga memberikan perintah kepada chatbot AI.