Kısaca

Google ve DeepMind araştırmacıları, yapay zekâ ajanlarının temel modeli değiştirmeden geçmiş arama geçmişlerini yeniden oynatarak daha verimli stratejiler geliştirmesini sağlayan Dream-RSI yöntemini tanıttı.

Google ve DeepMind bünyesindeki araştırmacılar, yapay zekâ ajanlarının karmaşık arama ve optimizasyon görevlerindeki performansını artırmayı hedefleyen "Dream-RSI" adlı yeni bir yöntem geliştirdi. Otonom yapay zekâ ajanları; matematiksel problemlerin çözümü, yeni algoritmaların keşfi veya hızlı kod yazımı gibi alanlarda binlerce olası çözümü deneyerek ilerliyor. Ancak arama uzayı genişledikçe ajanın hangi yaklaşımı sürdüreceğine ya da hangi daldan vazgeçeceğine karar vermesi büyük bir hesaplama maliyeti doğuruyor. Dream-RSI çerçevesi, temel dil modelinin ağırlıklarını değiştirmek veya modeli yeniden eğitmek yerine, doğrudan ajanın arama kararlarını yöneten keşif politikasını optimize etmeye odaklanıyor.

Geleneksel yöntemlerde sabit bir arama stratejisi deneyimden öğrenemediği için benzer çıkmaz sokaklara tekrar girerken, canlı arama sırasında stratejiyi güncellemek her denemede yüksek hesaplama gücü harcanmasına yol açıyor. Araştırmacıların sunduğu çözüm, tamamlanan arama kayıtlarını birer "tekrar simülatörü" olarak kullanma mantığına dayanıyor. Canlı arama sırasında atılan her adım, üretilen kod ve değerlendiriciden alınan puanlar bir arama ağacı olarak kaydediliyor. Ajan, araştırmacıların "rüya görme" olarak adlandırdığı bu çevrimdışı aşamada, depolanan ağaç üzerinde binlerce alternatif zamanlama ve dal seçimi kuralını test ediyor. Sistem bu aşamada tamamen yeni çözümler üretmiyor; yalnızca mevcut kayıtlar üzerinden hangi stratejinin daha kısa yoldan sonuca ulaşacağını hesaplıyor ve en başarılı stratejiyi bir sonraki canlı çalıştırmaya aktarıyor.

Dream-RSI, Gemini 3.1 Pro ve Gemini 3.7 Flash modelleri kullanılarak üç ana alandaki sekiz farklı görevde test edildi. Genomik ve finans alanlarında yaygın kullanılan istatistiksel hesaplamalara yönelik program yazma görevinde sistem, altı test veri kümesinin tamamında yerleşik sklearn ve glmnet kütüphanelerinden daha hızlı çalışan algoritmalar üretti. Gemini 3.1 Pro ile yapılan bu testte algoritmanın ortalama çalışma süresi 3.587 milisaniyeden 2.931 milisaniyeye gerilerken, ajanın ihtiyaç duyduğu deneme sayısı 550'den 317'ye indi. Benzer bir görevi tamamlamak için 51.200 çalıştırma yapan SimpleTES adlı rakip sisteme kıyasla Dream-RSI, 317 denemeyle hedefi yakaladı. GPU çekirdek optimizasyonu görevlerinde ise sistem, VGG16 ve LayerNorm üzerinde aynı performansı 2,43 ve 1,79 kata kadar daha az nesil üreterek elde etti; ConvDiv görevinde ise aynı bütçede 2,09 kat daha yüksek performans sağladı.

Araştırma ekibinin gerçekleştirdiği ek analizler, yapay zekâ ajanlarına arama geçmişinden ders çıkarma yöntemi olarak doğrudan sözel talimatlar vermenin keşif performansını düşürdüğünü gösterdi. Arama geçmişini özetleyip modele nereyi araması gerektiğini belirten yönlendirici metinler eklenen versiyon, GPU çekirdek görevinde serbest keşif yapan sürüme kıyasla daha zayıf sonuç verdi. Araştırmacılar, aşırı özgül talimatların arama alanını daraltarak ajanın paralel ve geniş kapsamlı yaklaşımları denemesini engellediğini belirtti. İncelenen veriler, öğrenilen stratejinin ilk aşamada deneme sayısını azalttığını, ilerleme yavaşladığında ise arama çabasını yeniden artırarak yeni kazanımlar elde ettiğini ortaya koydu.

Yayımlanan sonuçlar önemli verimlilik artışlarına işaret etse de yöntemin belirli teknik sınırları bulunuyor. Tekrar simülasyonu yalnızca önceden kaydedilmiş arama ağacı içinde kalan sonuçları değerlendirebiliyor; ağaçta yer almayan denenmemiş bir dalın ne sonuç vereceği bu yöntemle öngörülemiyor. Ayrıca araştırmada tekrarlanan rastgele tohumlarla yapılmış nihai karşılaştırmalar ve simülasyon puanı artışının canlı kazanıma dönüşme korelasyonu yer almıyor. Sistemin geliştirdiği çözümler Lasso yol çözücü, üç matematik problemi ve dört GPU çekirdeği optimizasyonu gibi dar mühendislik alanlarıyla sınırlı tutuldu. Araştırmacılar ayrıntıları GitHub üzerinden paylaşırken, tam kod tabanının henüz bağımsız ekiplerce denenebilecek şekilde eksiksiz yayımlanmadığı kaydedildi.

Neden önemli?Yapay zekâ modellerini yeniden eğitmek yerine arama politikasını geçmiş verilerle test etmek, karmaşık kod ve matematik problemlerinde yüksek işlemci maliyetlerini düşürerek keşif sürecini hızlandırıyor.

Şu ana kadar bildiklerimiz

  • Dream-RSI, temel kodlama modelini yeniden eğitmek yerine yalnızca arama ağacındaki kararları yöneten keşif politikasını günceller.
  • Gemini 3.1 Pro ile yapılan istatistiksel hesaplama testinde ortalama çalışma süresi 3.587 milisaniyeden 2.931 milisaniyeye, deneme sayısı 550'den 317'ye düştü.
  • İki GPU çekirdeği görevinde yöntem, işlem çalıştırma sayısını 2,43 kata kadar azaltarak standart arama stratejisiyle aynı performansı yakaladı.

Cevabı beklenen sorular

  • Dream-RSI yaklaşımı dar kodlama ve matematik optimizasyonu dışındaki genel ajan görevlerinde benzer bir hesaplama tasarrufu sağlayabilecek mi?
  • Tam kodların kamuya açılmasının ardından bağımsız araştırmacılar bu sonuçları farklı modeller ve rastgele tohumlarla tekrarlayabilecek mi?
Kaynaklar ve belgeler

Bu haberde kullanılan belgelere aşağıdaki bağlantılardan ulaşabilirsiniz.