Google resmi merilis model kecerdasan buatan (AI) audio terbarunya, Gemini 3.1 Flash Live. Model ini dirancang untuk membuat interaksi suara dengan AI terasa lebih alami, mendekati percakapan dengan manusia.
Dalam pengumuman di blog resminya, Google menyebut Gemini 3.1 Flash Live sebagai model dengan kualitas audio terbaik yang mereka miliki saat ini. Peningkatan mencakup presisi yang lebih baik serta latensi lebih rendah, sehingga respons suara dapat dihasilkan lebih cepat, akurat, dan terdengar natural. Google juga menekankan bahwa model ini mendukung dialog real-time dengan ritme percakapan yang lebih mengalir.
Google menyatakan pengaturan tersebut ditujukan untuk menghadirkan pengalaman interaksi yang lebih intuitif bagi pengembang, perusahaan, maupun pengguna umum. Perusahaan itu juga menyebut kualitas keseluruhan Gemini 3.1 Flash Live telah ditingkatkan agar lebih andal menangani tugas kompleks berskala besar, terutama dalam percakapan berbasis suara.
Untuk menguji kemampuannya, Gemini 3.1 Flash Live diuji menggunakan ComplexFunchBench Audio, benchmark AI yang mengukur kemampuan memahami instruksi kompleks serta melakukan function calling (memanggil API atau tool secara berurutan). Dalam pengujian ini, model tersebut meraih skor 90,8 persen. Sementara pada Audio MultiChallenge dari Scale AI dengan mode thinking aktif, Gemini 3.1 Flash Live mencatat skor total 36,1 persen.
Benchmark tersebut menilai kemampuan model mengikuti instruksi kompleks dan melakukan penalaran jangka panjang di tengah gangguan serta jeda yang lazim terjadi dalam percakapan audio di dunia nyata.
Lebih peka terhadap nuansa suara
Google juga menyebut Gemini 3.1 Flash Live mengalami peningkatan dalam pemahaman tonal. Dalam konteks Gemini Enterprise for Customer Experience, model ini diklaim lebih peka terhadap nuansa suara dibandingkan model 2.5 Flash Native Audio, termasuk nada (pitch) dan kecepatan bicara pengguna.
Selain itu, model ini disebut dapat menyesuaikan respons berdasarkan kondisi pengguna. Misalnya, ketika pengguna terdengar bingung atau frustrasi, Gemini 3.1 Flash Live akan memberikan jawaban yang lebih sesuai dengan situasi tersebut.
Tersedia di Search Live hingga API untuk pengembang
Gemini 3.1 Flash Live tersedia di sejumlah layanan Google, termasuk fitur Search Live untuk pengguna umum. Pengembang juga dapat mengaksesnya melalui Gemini Live API di Google Studio. Untuk kebutuhan bisnis, model ini tersedia melalui Gemini Enterprise for Customer Experience.
Sejumlah perusahaan seperti Verizon, LiveKit, dan The Home Depot turut memberikan umpan balik positif terkait penggunaan Gemini 3.1 Flash Live dalam alur kerja mereka. Menurut mereka, interaksi yang dihadirkan terasa lebih alami dan intuitif, serta memberikan respons lebih cepat dibandingkan model sebelumnya pada Gemini Live dan Search Live.
Google juga menyatakan model ini mampu mengikuti alur percakapan hingga dua kali lebih lama, sehingga dapat mempertahankan konteks dalam diskusi yang lebih panjang.
Dukungan multibahasa dan watermark audio
Gemini 3.1 Flash Live disebut memiliki kemampuan multibahasa secara bawaan, yang memungkinkan ekspansi global Search Live. Google menyatakan pengguna di lebih dari 200 negara dan wilayah kini dapat melakukan percakapan real-time dengan Google Search menggunakan bahasa pilihan mereka.
Dari sisi keamanan, Google menyematkan teknologi watermark bernama SynthID pada setiap audio yang dihasilkan Gemini 3.1 Flash Live. Watermark ini tidak terlihat oleh pengguna dan tertanam langsung pada output audio, namun dapat digunakan untuk mendeteksi konten yang dibuat oleh AI secara lebih andal.