Kısaca

Google, 85'ten fazla dili destekleyen ve konuşmadaki duraklama seslerini gerçek zamanlı düzelten Gemini 3.5 Transcribe modelini erişime açtı.

Google, gerçek zamanlı konuşma metinleştirme amacıyla geliştirdiği yeni yapay zekâ modeli Gemini 3.5 Transcribe'ı kullanıma sundu. 85'ten fazla dili otomatik olarak algılama yeteneğine sahip olan model, konuşma sırasında ortaya çıkan duraklama ve dolgu seslerini ("ııı" veya İngilizcedeki "um" gibi) ayıklıyor, dil sürçmelerini düzeltiyor ve metni noktalama işaretleriyle birlikte kendiliğinden biçimlendiriyor.

Google'ın paylaştığı teknik verilere göre yeni model, canlı akış modunda yüzde 4,0 kelime hata oranı (WER) sunarken, kayıtlı ses dosyalarının çözümlenmesinde bu oran yüzde 2,6 seviyesine kadar geriliyor. Model, kendisinden önceki ses tanıma sistemi Chirp 3 ile karşılaştırıldığında yüzde 70 oranında daha düşük bir işlem gecikmesiyle çalışıyor.

Gemini 3.5 Transcribe, "fonksiyon çağırma" (function calling) desteği sayesinde transkripsiyon sırasında diğer Gemini modellerine görsel üretimi veya web araması gibi ek görevleri doğrudan devredebiliyor. Model iki ayrı arayüz seçeneğiyle dağıtılıyor: Çok düşük gecikmeli gerçek zamanlı akışları yöneten Live API (gemini-3.5-transcribe-live) ve konuşmacı ayrımı ile zaman damgaları sunan Interactions API (gemini-3.5-transcribe).

Yeni model, geliştiriciler ve kurumsal müşteriler için Google AI Studio ile Gemini Enterprise Agent Platform üzerinde yayına alındı. Tüketici tarafında ise Android platformundaki Gboard klavyesine "Rambler" altyapısı üzerinden entegre edilen model, macOS işletim sistemindeki Gemini uygulamasında da aktif hâle getirildi. Google, modelin Chrome internet tarayıcısına yönelik desteğinin de yakında kullanıma sunulacağını bildirdi.

Neden önemli?Düşük gecikme süresi ve fonksiyon çağırma kabiliyeti, sesli asistanların diğer yapay zekâ görevlerini doğrudan tetiklemesini sağlayarak ses tabanlı uygulamaların verimini artırıyor.

Şu ana kadar bildiklerimiz

  • Gemini 3.5 Transcribe, canlı akışta yüzde 4,0 ve kayıtlı seslerde yüzde 2,6 kelime hata oranıyla çalışıyor.
  • Model, önceki sürüm Chirp 3'e göre yüzde 70 daha düşük gecikme süresine sahip.
  • Google AI Studio, Gemini Enterprise Agent Platform, Android için Gboard ve macOS Gemini uygulamasında kullanıma sunuldu.