Meta'nın Superintelligence Labs birimi, konuşmaları 80 milisaniyelik dilimler halinde işleyerek yazıya döken, konuşmacıları ayıran ve cümle sınırlarını belirleyen Muse Voice Transcribe adlı gerçek zamanlı ses modelini kullanıma sundu.
Meta'nın Superintelligence Labs birimi, konuşmaları gerçek zamanlı olarak yazıya dönüştüren, farklı konuşmacıları birbirinden ayıran ve cümle sınırlarını tespit eden Muse Voice Transcribe adlı yeni ses modelini kullanıma sundu. Bu Spark ailesi modeli, gelen sesi 80 milisaniyelik parçalar halinde işliyor ve her parçadan sonra dinlemeye devam edip etmeyeceğine veya bir sonraki kelimeyi metin olarak çıkarıp çıkarmayacağına karar veriyor. Meta'ya göre, modelin her kelime için bekleme süresini dinamik olarak ayarlaması sayesinde, kolay kelimeler daha hızlı, zor kelimeler ise daha uzun dinleme süresiyle işlenerek hem doğruluk hem de hız dengesi sağlanıyor. Bu davranış, düşük hata oranları ve kısa gecikmeleri aynı anda ödüllendiren güçlendirmeli öğrenme ile geliştirildi.
Muse Voice Transcribe, konuşmacı atfı ve cümle sınırları gibi ek özelliklerini ayrı sistemler yerine aynı model içinde barındırıyor. Model, 20'den fazla konuşmacıyı aynı anda ayırt edebiliyor ve bir saatten uzun kayıtları herhangi bir son işlem gerektirmeden işleyebiliyor. Şirketin açıklamasına göre, model 70'ten fazla dilde eğitildi ve 25 dilde derinlemesine test edildi. Ayrıca, konuşmacıların cümle ortasında diller arasında geçiş yaptığı (code-switching) durumları da yönetebiliyor. Meta, bu modeli, yapay zeka gözlükleri gibi cihazlar aracılığıyla gerçek konuşmaları sürekli dinleyen kişisel yapay zeka asistanları için bir temel yapı taşı olarak görüyor.
Artificial Analysis tarafından yapılan bağımsız bir değerlendirme, Meta'nın iddialarını doğruluyor. Muse Voice Transcribe, İngilizce'de yüzde 3,1'lik bir kelime hata oranına ulaşarak konuşmacı konuşmayı bitirdikten 0,16 saniye sonra sonuç veriyor. Bu oran, ElevenLabs Scribe v2 Realtime'ın yüzde 3,6'lık ve AssemblyAI Universal-3.5 Pro Realtime'ın yüzde 4,0'lık oranlarından daha düşük. Meta, fiyatlandırma konusunda da rakiplerinin önüne geçiyor. Saatte 0,18 dolar veya 1.000 ses dakikası için 3 dolar maliyetiyle Cartesia Ink-2'nin 4 dolarından, ElevenLabs Scribe v2 Realtime ve Deepgram Flux'un ise 6,50 dolarından daha uygun bir seçenek sunuyor. Bu strateji, Muse Spark 1.1 ve Muse Spark 1.2 modellerinde de Meta'nın performans yerine fiyat rekabetine odaklandığını gösteriyor.
Model şu anda Meta AI ve Muse Code'daki sesli dikte özelliklerine güç veriyor ve Meta Model API aracılığıyla erişilebilir durumda. Kullanıcılar, herhangi bir uygulamada “Fn” tuşunu basılı tutarak deneyebilir. Bu gelişme, Meta'nın kişisel süper zeka vizyonunu destekleyen önemli bir adım olarak öne çıkıyor. Şirket, modelin parametre sayısını, eğitim verisi hacmini veya ses verisi kaynaklarını açıklamadı ve ağırlıklarını da yayınlamıyor.
Neden önemli?Bu model, gerçek zamanlı konuşma tanıma yetenekleri ve rekabetçi fiyatlandırmasıyla yapay zeka asistanlarının gelişiminde önemli bir rol oynayabilir ve sektördeki rekabeti artırabilir.
Şu ana kadar bildiklerimiz
- Meta'nın Superintelligence Labs ekibi, Muse Voice Transcribe adlı gerçek zamanlı bir ses modeli yayınladı.
- Model, konuşmaları 80 milisaniyelik parçalar halinde işleyerek yazıya döküyor, konuşmacıları ayırt ediyor ve cümle sınırlarını belirliyor.
- Artificial Analysis'e göre, Muse Voice Transcribe İngilizce'de yüzde 3,1'lik kelime hata oranı ve saatte 0,18 dolarlık fiyatıyla rakiplerinden daha iyi performans sergiliyor ve daha uygun maliyet sunuyor.
Cevabı beklenen sorular
- Meta'nın bu modeli, kişisel süper zeka vizyonunu ne zaman ve hangi kapsamda tam olarak hayata geçirecek?
- Modelin diğer dillere yönelik performans verileri ve fiyatlandırma detayları ne zaman açıklanacak?
- Muse Voice Transcribe'ın Meta dışındaki platformlara entegrasyonu ve yaygınlaşması nasıl bir yol izleyecek?



