Tencent Hunyuan Konuşma Ekibi, gerçek zamanlı sesli diyalog sürerken arka planda kod yazma ve dosya arama gibi görevleri yürüten çok modlu yapay zekâ modeli Gander'ın teknik raporunu yayımladı.
Tencent'in Hunyuan Konuşma Ekibi ile üniversite araştırmacılarının 9 Eylül 2026 tarihinde teknik raporunu yayımladığı deneysel yapay zekâ modeli Gander, 20 Eylül 2026 itibarıyla paylaşılan teknik analizlerle sesli asistan mimarisine yeni bir yaklaşım getirdi. Alışılagelmiş sesli asistanlar kullanıcının sözünü bitirmesini bekleyen sıra tabanlı bir yapıyla çalışırken, Gander konuşma, görüntü ve metin akışını eş zamanlı olarak işleyebilen tam çift yönlü bir iletişim yapısı sunuyor. Model, bir saniyelik zaman dilimlerine dayanan akış mimarisi sayesinde kullanıcı konuşurken dahi yanıt verebiliyor, kullanıcının sözünü kesmeden veya komut beklemeden ara bildirimler iletebiliyor.
Gander, insan anatomisinden esinlenen ve teknik raporda "beyincik" ile "beyin" olarak adlandırılan iki parçalı bir işbirlikçi çerçeveye dayanıyor. Hızlı çalışan ön beyincik katmanı gerçek zamanlı ses ve video akışını takip edip konuşma zamanlamasını yönetirken, arka plandaki değiştirilebilir beyin katmanı akıl yürütme, dosya arama ve kod yazma gibi gecikme gerektiren karmaşık görevleri üstleniyor. Bu tasarımda arka plandaki akıl yürütme birimi, konuşma modelini yeniden eğitmeye gerek kalmadan Codex ya da Claude Code gibi harici ajan sistemleriyle değiştirilebiliyor; test süreçlerinde ise bu görevi OpenAI'ın GPT-5.6 ailesinden belirlenmemiş bir model üstlendi. Konuşmanın son iki dakikalık geçmişini bağlam belleğinde tutan sistem, konuşmanın başlangıç ve bitiş anlarını tespit etmek için ayrı bir modüle ihtiyaç duymadan doğrudan karar veriyor.
Teknik belgelere göre Gander, sesli asistanların performansını ölçen Full-Duplex-Bench v3 kıyaslamasındaki 100 farklı senaryonun tamamında doğru zamanda konuşmaya başladı. Model, kullanıcı konuşurken erken araya girme oranını yüzde 8 seviyesinde tutarak, yüzde 13,5 oranına sahip GPT-Realtime sistemini ve yaklaşık yüzde 48 oranına ulaşan en zayıf rakibini geride bıraktı. Ancak bu yüksek zamanlama başarısı genel görev doğruluğuna doğrudan yansımadı; Full-Duplex-Bench v3 testlerinde tek seferde doğru tamamlama oranı (Pass@1) 0,400 olarak kaydedildi. Araştırmacılar, test puanlamasının uçtan uca tüm sistemi kapsaması nedeniyle ses tanıma ve konuşma çıkışı hatalarının genel skoru aşağı çektiğini, akıl yürütme birimine doğrudan metin verildiğinde ise doğruluk oranının çok daha yüksek çıktığını belirtti. Ayrıca akıcı diyaloğa öncelik veren eğitim süreci, nesne sayma ve görüntü içinde konum belirleme gibi algı görevlerinde modelin temel aldığı MiniCPM-o 4.5'in gerisinde kalmasına yol açtı.
Yaklaşık 2,7 milyon veri örneğiyle eğitilen Gander, arka plan gürültüsü olduğunda veya ortamdaki konuşma doğrudan kendisine yöneltilmediğinde sessiz kalacak biçimde yapılandırıldı. BF16 duyarlılığında çalışan model, 16 kHz ses girişi kabul edip 24 kHz hızında ses çıkışı üretiyor ve saniyelik konuşma birimi başına düşünür biriminde 8 sözcüksel belirteç, konuşmacı biriminde ise 50 S3 belirteci kullanıyor. Tencent, Hunyuan Hy3 ve Hy4 gibi büyük metin modellerinden ayrı bir araştırma hattı olarak konumlandırdığı Gander'ın kodlarını ve temel aldığı MiniCPM-o 4.5 modelinden devralınan Apache 2.0 lisanslı ağırlıklarını GitHub ile Hugging Face üzerinden açık erişime sundu.
Neden önemli?Sırayla konuşma zorunluluğunu aşan bu mimari doğal etkileşim sağlasa da, sistem gecikmesini azaltırken görev doğruluğu ve görüntü algılama hassasiyetinden ödün verilmesi sesli modellerdeki temel mühendislik açmazını gösteriyor.
Şu ana kadar bildiklerimiz
- Gander, gerçek zamanlı diyaloğu yürüten beyincik ile arka plandaki akıl yürütme işlerini üstlenen değiştirilebilir beyin katmanından oluşuyor.
- Full-Duplex-Bench v3 testindeki 100 senaryoda zamanlama başarısı gösteren model, yüzde 8 erken araya girme oranıyla GPT-Realtime'ın yüzde 13,5'lik oranını geride bıraktı.
- MiniCPM-o 4.5 temel modeli üzerine inşa edilen ve Apache 2.0 lisansıyla açılan sistem yaklaşık 2,7 milyon örnekle eğitildi.
Cevabı beklenen sorular
- Gander mimarisi daha büyük parametreli amiral gemisi modellere uyarlandığında konuşma akıcılığı ile görev doğruluğu arasındaki denge nasıl korunacak?
- Tam çift yönlü çok modlu sistemleri adil ve standart biçimde ölçecek bağımsız bir kıyaslama metodolojisi sektörel olarak ne zaman kabul görecek?
Kaynaklar ve belgeler
Bu haberde kullanılan belgelere aşağıdaki bağlantılardan ulaşabilirsiniz.



