Google, 100'den fazla dili destekleyen ve metin komutlarıyla özel karakter sesi üretimine izin veren Gemini 3.8 Flash TTS ile Gemini 3.8 Flash-Lite TTS modellerini duyurdu.
Google, konuşma üretimi alanında geliştirdiği Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS adlı iki yeni yapay zekâ modelini 23 Eylül 2026 tarihinde kullanıma sundu. Şirketin paylaştığı bilgilere göre Flash TTS sürümü oyun karakterleri, sesli kitaplar ve podcast gibi yaratıcı projelere odaklanırken, Flash-Lite TTS sürümü dublaj ve sesli asistanlar için yüksek hacimli ve düşük maliyetli üretime yöneliyor. Kullanıcılar, Gemini 3.8 Flash TTS modelinde metin komutları girerek bir sesin rolünü, aksanını ve vokal niteliklerini sıfırdan belirleyebiliyor. Sıfırdan üretim yapmak istemeyenler için sistemde Meksika İspanyolcası, Quebec Fransızcası ve İskoç İngilizcesi gibi bölgesel varyasyonları da kapsayan 2 binden fazla hazır ses seçeneği yer alıyor.
Her iki model de 100'den fazla dili desteklerken geliştiricilere metin satırlarına özel sahne yönergeleri ekleme imkânı tanıyor. Kullanıcılar tek bir senaryo metni üzerinden iki farklı sesin yer aldığı diyaloglar oluşturabiliyor; gülme, iç çekme ve duraksama gibi sesleri metne işleyerek tonlamayı yönlendirebiliyor. Google, modellerin uzun süreli ses üretiminde karakter sesinin değişmesini ifade eden ses kaymasını en aza indirdiğini belirtiyor. Hume AI tarafından yürütülen Ses Tasarımı Kıyaslaması'nda Flash TTS modeli 71,4 puan alırken, Genel Kalite Endeksi'nde de ilk sıraya yerleşti. Buna karşın The Decoder tarafından yapılan bağımsız denemelerde, stil yönlendirmeleri başarılı bir aksan üretse de arka planda tiz bir uğultu oluştuğu ve sesin kayıt sonunda değiştiği gözlendi.
Yeni modeller, 30 saniyelik bir ses kaydından profil oluşturabilen ses klonlama özelliği barındırıyor. Şirketin kurallarına göre ses kopyalama işleminin tamamlanabilmesi için ses sahibinin sistem üzerinden sözlü onay beyanı kaydetmesi ve bu kaydın ses örneğiyle birebir eşleşmesi şart koşuluyor. Üretilen tüm ses dosyalarına insan kulağının duyamayacağı SynthID filigranı ekleniyor ve kopyalanan sesler C2PA içerik kimlik bilgileriyle işaretleniyor. Ancak ses klonlama yeteneği, yerel veri gizliliği düzenlemeleri nedeniyle Google AI Studio üzerinde Avrupa Ekonomik Alanı, Birleşik Krallık, İsviçre ve Hindistan'ın yanı sıra Amerika Birleşik Devletleri'nin Illinois ve Teksas eyaletlerinde kullanıma sunulmadı.
Modellerin ücretlendirmesi girdi metni ve çıktı sesi için ayrı jetonlar üzerinden hesaplanıyor. Google'ın yayımladığı tarifeye göre bir saniyelik ses üretimi 25 ses jetonuna, bir saatlik üretim ise 90 bin ses jetonuna karşılık geliyor. 2026 yılı sonuna kadar geçerli indirimli tarifede bir saatlik ses çıktısı Flash TTS modelinde 0,81 dolar, Flash-Lite TTS modelinde ise 0,54 dolar olarak faturalandırılıyor; 1 Ocak 2027 itibarıyla bu birim fiyatlar sırasıyla 1,62 dolar ve 1,08 dolara yükselecek. Yeni modeller için henüz bölgesel veri işleme noktaları duyurulmazken, ücretsiz katmanda işlenen verilerin ürün geliştirmede kullanılacağı, ücretli katmandaki verilerin ise bu kapsamın dışında tutulacağı açıklandı.
Modeller şu anda Google AI Studio ve Gemini API üzerinden erişime açılırken, Flash TTS sürümü Gemini Notebook, Flash-Lite TTS sürümü ise Google Vids içine entegre edildi. LiveKit, Agora, Pipecat ve Vercel gibi geliştirici platformları Gemini API üzerinden modelleri desteklemeye başladı; Figma, HeyGen ve Wondercraft gibi şirketlerin de küresel dublaj ve yerelleştirme süreçleri için sisteme bağlandığı bildirildi. Google, Gemini Enterprise API üzerinden kurumsal erişimin de kısa süre içinde açılacağını bildirdi.
Neden önemli?Geliştiriciler harici ses kaydına ihtiyaç duymadan doğrudan senaryo üzerinden aksan ve duygu yönlendirmeli çok sesli diyaloglar oluşturarak üretim maliyetlerini düşürebilecek.
Şu ana kadar bildiklerimiz
- Gemini 3.8 Flash TTS ve Flash-Lite TTS modelleri 100'ün üzerinde dili destekliyor ve 2 binden fazla hazır ses seçeneği sunuyor.
- Sistemde 30 saniyelik ses örneği ve sahibinin sözlü onayıyla ses klonlama yapılabilirken, üretilen tüm içeriklere SynthID filigranı ekleniyor.
- Modellerde 1 saatlik ses çıktısı 90 bin jetona denk geliyor ve 2026 sonuna kadar Flash TTS için 0,81 dolar, Flash-Lite TTS için 0,54 dolar olarak ücretlendiriliyor.
Cevabı beklenen sorular
- Ses kopyalama özelliğinin Avrupa Ekonomik Alanı ve Birleşik Krallık gibi yasal kısıtlama bulunan bölgelerde ne zaman kullanıma açılacağı belirsizliğini koruyor.
Kaynaklar ve belgeler
Bu haberde kullanılan belgelere aşağıdaki bağlantılardan ulaşabilirsiniz.



