Kısaca

CozyBlaze tarafından yapılan deneyde OpenAI'ın GPT-6 Astra modeli, 3 bin 336 araç çağrısı gerçekleştirerek Portal oyununu baştan sona tamamen otonom bir şekilde bitirdi.

OpenAI tarafından geliştirilen GPT-6 Astra modeli, Valve imzalı birinci şahıs bulmaca oyunu Portal'ı baştan sona tamamen otonom bir şekilde tamamlayarak yapay zekâ araştırmalarında yeni bir eşiği geride bıraktı. Yapay zekâ odaklı teknik içerikleriyle tanınan CozyBlaze tarafından kurgulanan deney kapsamında model, herhangi bir insan müdahalesi ya da manuel yönlendirme olmaksızın oyunun bütün bölümlerini kendi başına çözdü. Atari 2600 platformundaki erken dönem iki boyutlu yapay zekâ denemelerinden bu yana katedilen mesafeyi somutlaştıran bu çalışma, çok modlu büyük dil modellerinin üç boyutlu uzamsal derinliğe ve karmaşık fizik motoruna sahip simülasyon ortamlarındaki problem çözme kabiliyetini ortaya koydu.

Deneyin arkasındaki teknik mimari, modelin oyun motoruyla iletişim kurmasını sağlayan Model Context Protocol (MCP) ve bu süreç için özel olarak geliştirilen SourcePauseTool (SPT) aracına dayandırıldı. Karar alma ve düşünme aşamasında oyun duraklatılarak yapay zekâya yüksek çözünürlüklü ekran görüntüleri ile oyuncunun haritadaki anlık üç boyutlu konum ve koordinat bilgileri aktarıldı. GPT-6 Astra bu görsel ve konumsal verileri işleyip bir sonraki portal atışını veya hareket hamlesini planladıktan sonra oyunun duraklatılması sonlandırıldı ve üretilen kontrol komutları doğrudan uygulandı. Düşünme süreleri dâhil edildiğinde toplamda 24 saati bulan oynanış süreci, kaydedilen hamlelerin gösterildiği yaklaşık iki saatlik özet video formatına indirgendi.

Portal'ın baştan sona bitirilmesi sürecinde GPT-6 Astra toplam 3.336 araç çağrısı (tool call) gerçekleştirdi ve sistem üzerinde 571,18 dolarlık bir API tüketim maliyeti meydana getirdi. Deneyin yürütücüsü CozyBlaze, bu harcamanın standart kullandıkça öde tarifesi yerine aylık 200 dolarlık Codex Pro aboneliği kapsamında sağlanan kullanım kotalarıyla karşılandığını açıkladı. Ortaya çıkan bu çağrı sıklığı ve veri transferi hacmi, çok modlu gelişmiş modellerin harici karar mekanizmalarıyla çalışırken tükettiği hesaplama gücünü ve yüksek maliyetli altyapı gereksinimini somut verilerle belgeledi.

Elde edilen sonucun teknik önemine dikkat çeken CozyBlaze, bu çalışmanın kesin bir yapay zekâ kıyaslama testi olarak yorumlanmaması gerektiğini ve mimaride hâlâ çözülmesi gereken çeşitli operasyonel kısıtların bulunduğunu belirtti. Bununla birlikte genel amaçlı bir yapay zekâ ajanının karmaşık kurallara sahip üç boyutlu bir oyunu tek başına tamamlayabilmesi, OpenAI'ın 2016 yılında ortaya koyduğu tek bir ajan yardımıyla farklı oyun ortamlarını çözme vizyonuna pratik bir yaklaşım sundu. Sistemin gerçek zamanlı refleksler yerine duraklatma mekanizmasıyla çalışması, otonom ajanın saf tepki süresinden ziyade durumsal muhakeme ve adım adım stratejik planlama gücüne dayandığını gösterdi.

Araştırmanın bağımsız geliştiriciler tarafından incelenebilmesi ve sonuçların yeniden üretilebilmesi için projenin tüm kaynak kodları ile kurulum talimatları GitHub platformunda paylaşıldı. Yazılım meraklıları ve araştırmacılar, SourcePauseTool yapılandırmasını ve Model Context Protocol entegrasyonunu bu açık kaynaklı depo üzerinden doğrudan inceleme imkânına sahip bulunuyor.

Neden önemli?Çok modlu yapay zekâ modellerinin harici araçlar ve ekran görüntüleriyle karmaşık üç boyutlu mekanikleri çözebilmesi, genel amaçlı otonom yazılım ajanlarının gelişiminde önemli bir eşiğe işaret ediyor.

Şu ana kadar bildiklerimiz

  • Deney boyunca GPT-6 Astra toplam 3.336 araç çağrısı gerçekleştirdi ve 571,18 dolarlık API maliyeti aylık 200 dolarlık Codex Pro aboneliğiyle karşılandı.
  • Model, oyunu Model Context Protocol ve SourcePauseTool adındaki özel duraklatma aracı vasıtasıyla iletilen ekran görüntüleri ve konum bilgileriyle yönetti.
  • Düşünme süreleri dâhil toplamda 24 saat süren oynanış sürecinin kodları ve kurulum talimatları GitHub üzerinden paylaşıldı.

Cevabı beklenen sorular

  • Benzer araç entegrasyonu mimarisinin duraklatma mekanizması olmadan gerçek zamanlı oyunlarda ve simülasyonlarda nasıl bir performans göstereceği henüz bilinmiyor.
  • Modelin Portal haricindeki farklı oyun mekaniklerine sahip ortamlara ek bir özelleştirme olmadan uyum sağlayıp sağlayamayacağı netlik kazanmadı.