Kısaca

Google, Gemini Audio ailesine 85'ten fazla dilde çalışan, dolgu sesleri temizleyen ve üç kişiye kadar konuşmacı ayrımı yapabilen Gemini 3.5 Transcribe ve yeni canlı ses modellerini ekledi.

Google, Gemini Audio altyapısını 85'ten fazla dili ve uzmanlık terimlerini otomatik olarak algılayabilen yeni Gemini 3.5 modelleriyle güncelledi. Tanıtılan Gemini 3.5 Live, 3.5 Live Experimental ve Gemini 3.5 Transcribe modelleri; arka plan gürültüsü bulunan ortamlarda ve konuşmanın kesintiye uğradığı durumlarda ses kontrollü yapay zekâ özelliklerinin hassasiyetini artırmayı hedefliyor.

Gemini ailesine yeni eklenen 3.5 Transcribe modeli, şirketin önceki konuşma tanıma modeli Chirp 3'e kıyasla özellikle çok dilli performans ve kelime hata oranlarında önemli bir ilerleme sunuyor. Kullanıcıların yalnızca seslerini kullanarak metin düzenlemesine olanak tanıyan model; metinleri otomatik olarak biçimlendiriyor ve konuşma aralarındaki duraklama ifadelerini kendiliğinden ayıklıyor. Kullanıcılar modele özel terim listeleri tanımlayarak sektörel jargona veya özel yazım kurallarına uyum sağlayabiliyor. Model ayrıca önceden kaydedilmiş ses dosyalarında üç farklı konuşmacıyı birbirinden ayırabiliyor ve kelime düzeyinde zaman damgaları üretiyor.

Gemini'nin sesli sohbet modunu çalıştıran konuşma tanıma altyapısını temel alan Gemini 3.5 Live ve 3.5 Live Experimental modelleri de eş zamanlı olarak kullanıma sunuldu. Gemini 3.5 Live modeli cümle ortasında araya girilmesini, dil tespitini ve canlı görsel işlemeyi daha verimli yönetiyor. Gemini 3.5 Live Experimental ise karmaşık mantık yürütme görevlerini çözerken ulaştığı aşamaları gerçek zamanlı ve adım adım sesli olarak aktarabiliyor.

Yeni ses özellikleri ilk aşamada İngilizce olarak macOS üzerindeki Gemini uygulamasında ve seçili ülkelerde Android işletim sisteminin Rambler dikte işlevinde kullanıma açıldı. Geliştiriciler modellere AI Studio ve Antigravity platformlarındaki Gemini API üzerinden genel ön izleme sürümüyle erişebiliyor. Google, modeller için Chrome tarayıcı desteğinin yakında ekleneceğini açıklarken, şirketin haziran ayında yayımlayacağını duyurduğu Gemini 3.5 Pro modelinin çıkışı henüz gerçekleşmedi.

Neden önemli?Gelişmiş ses tanıma modelleri, gürültülü ortamlarda ve kesintili konuşmalarda daha doğru transkripsiyon sağlayarak sesle metin düzenleme ve dikte süreçlerindeki hata oranlarını belirgin şekilde düşürüyor.

Şu ana kadar bildiklerimiz

  • Gemini 3.5 Transcribe, ses kayıtlarındaki duraklama ifadelerini ayıklayabiliyor ve üç kişiye kadar konuşmacı ayrımı yapabiliyor.
  • Yeni modeller 85'ten fazla dili ve kullanıcıların sisteme tanımlayabileceği özel teknik terim dağarcıklarını destekliyor.
  • Ses özellikleri macOS Gemini uygulamasında ve Android Rambler dikte aracında İngilizce olarak kullanıma sunuldu.

Cevabı beklenen sorular

  • Google'ın haziran ayında duyuracağını belirttiği Gemini 3.5 Pro modelinin ne zaman yayımlanacağı henüz bilinmiyor.
  • Modellerin diğer dillerdeki ve Chrome tarayıcısındaki genel dağıtım takvimi henüz netleşmedi.