Meta, son beş ay içindeki dördüncü yapay zekâ modeli olan Muse Spark 1.3'ü Muse Code ve Meta Model API üzerinden genel kullanıma sundu.
Meta, nisan ayında başlattığı serinin beş ay içindeki dördüncü sürümü olan Muse Spark 1.3 yapay zekâ modelini Muse Code ve Meta Model API üzerinden erişime açtı. Temmuz ayında 1.1, ağustos ayında ise 1.2 sürümü yayımlanan seride bu kez xhigh katmanı genel kullanıma sunulurken, daha yüksek işlem gücü gerektiren max katmanı ek güvenlik testlerinin tamamlanması amacıyla sınırlı bir ortak önizlemesi kapsamında tutuluyor. Bağımsız değerlendirme kuruluşu Artificial Analysis verilerine göre model, otonom ajan görevlerinde kayda değer kazanımlar elde etmesine rağmen genel performans tablosunda zirvedeki sistemlerin gerisinde kalıyor.
Modelin pazardaki en belirgin rekabet kozunu işlem maliyeti oluşturuyor. Girdi için milyon token başına 1,25 dolar ve çıktı için milyon token başına 4,25 dolarlık tarifesini koruyan Muse Spark 1.3'te bir dizin görevinin maliyeti 0,55 dolar olarak hesaplanıyor. Sürüm 1.2'deki 0,40 dolarlık maliyete göre bir miktar artış görülse de değerlendirme tablosunda 59 puan ve üzerinde yer alan modeller arasında daha ucuz bir seçenek bulunmuyor. Benzer dizin seviyesindeki rakip modellerin görev maliyetleri 0,94 dolar ile 1,23 dolar arasında seyrederken, Meta ve Artificial Analysis henüz max katmanı için resmi bir fiyat açıklamış değil.
Artificial Analysis'in Intelligence Index sıralamasında xhigh katmanı 61, max katmanı ise 62 puana ulaştı; serinin puanı temmuzda 53, ağustosta 57 seviyesindeydi. Bu artışta, dizin ağırlıklarının yüzde 20'sini oluşturan GDPval-AA v2, yüzde 16'sını kapsayan Terminal-Bench 2.1 ve yüzde 14'lük paya sahip tau3-Bench Banking testlerindeki sıçrama belirleyici oldu. Ajanların simüle edilmiş bankacılık ortamında araç kullandığı tau3-Banking testinde max katmanı yüzde 52 başarı oranına ulaşarak liderlik koltuğuna oturdu ve modelin zirvede yer aldığı tek kategori bu oldu. Genel erişime açılan xhigh sürümü ise yüzde 47 seviyesinde kalarak Claude Fable 5.1 (max) ve GLM-5.3-Flash modelleriyle aynı başarıyı paylaştı; önceki sürüm 1.2 bu testte yüzde 35 seviyesindeydi.
Terminal üzerinden kodlama yeteneklerini ölçen Terminal-Bench 2.1 testinde xhigh katmanı yüzde 80'den 85'e, max katmanı ise yüzde 86'ya yükseldi; ancak Claude Fable 5.1 modeli yüzde 91,4'lük max katmanı puanıyla bu alandaki liderliğini korudu. İnsan uzman performansının 1000 baz puan kabul edildiği 220 profesyonel görevi içeren GDPval-AA v2 testinde Meta, önceki 1.615 puanını xhigh ile 1.709'a, max ile 1.754'e taşıdı; bu kategoride de Claude Fable 5.1 max sürümüyle 1.853 puanda bulunuyor. Meta'nın max varyantındaki performans üstünlüğü, xhigh sürümüne kıyasla yüzde 62 daha fazla akıl yürütme tokenı harcanarak sağlanıyor.
Uzman düzeyindeki bilim sorularını kapsayan GPQA Diamond testinde yüzde 90'dan 94'e çıkan Muse Spark, 95,3 alan Gemini 3.8 Flash (high) ve 94,9 alan Grok 4.6 (high) modellerinin ardında yer aldı. Araştırma fiziğini ölçen CritPt testinde başarı yüzde 18'den 26'ya yükselse de yüzde 32,3 puanlı GPT-5.6 Sol (max) ve yüzde 31,1 puanlı Claude Fable 5.1 (xhigh) seviyelerine erişilemedi. Modelin bazı alanlarda ise gerileme kaydettiği görüldü: AA-LCR skoru yüzde 83'ten 79'a indi; emin olunmadığında yanıt vermekten kaçınma eğilimi nedeniyle AA-Omniscience olgusal doğruluk testi üç puana kadar düşüş yaşadı. Meta'nın ürün takviminde daha büyük modeller ve açık ağırlıklı bir sürümün yayımlanması yer alıyor.
Neden önemli?Model, lider yapay zekâ sistemlerinin gerisinde kalsa da görev başına 0,55 dolarlık maliyetiyle benzer performans gösteren rakiplerine kıyasla yazılım geliştiricilere belirgin bir fiyat avantajı sağlıyor.
Şu ana kadar bildiklerimiz
- Muse Spark 1.3, Muse Code ve Meta Model API üzerinden xhigh katmanıyla kullanıma sunulurken daha yüksek işlem gücü gerektiren max katmanı sınırlı ortak önizlemesinde tutuluyor.
- Model, Intelligence Index testinde max sürümüyle 62, xhigh sürümüyle 61 puana ulaşırken görev başına 0,55 dolarlık maliyetle 59 puan üzerindeki en ucuz seçenek oldu.
- Ajanların simüle edilmiş bankacılık senaryosunda araç kullandığı tau3-Banking testinde max sürümü yüzde 52 başarı oranıyla liderliğe yerleşti.
Cevabı beklenen sorular
- Ek güvenlik testlerinin ardından genel kullanıma açılacak olan Muse Spark 1.3 max katmanının fiyatlandırması nasıl olacak?
- Meta'nın ürün takviminde yer alan daha büyük modeller ve açık ağırlıklı sürümler ne zaman yayımlanacak?



