Kısaca

Google Research, yapay zekâ ajanlarının başarı ve başarısızlıklarını kaydederek sonraki görevlerde performanslarını artırmalarını sağlayan WikiSkill mimarisini duyurdu.

Google Research bünyesindeki araştırmacılar, yapay zekâ ajanlarının her görevden sonra öğrendiklerini sıfırlamak yerine kalıcı bir bilgi tabanında biriktirmesini sağlayan WikiSkill adlı yeni bir çerçeve geliştirdi. Andrej Karpathy tarafından ortaya atılan ve deneyimlerin birikimli bir bilgi tabanına dönüştürülmesini savunan "LLM Wiki" yaklaşımından esinlenen çalışma, yapay zekâ modellerinin ağırlıklarını değiştirmeden kendi çalışma yönergelerini kademeli olarak iyileştirmesini hedefliyor. Sistem, modelin sürekli öğrenme sorununu kökten çözmese de her işlemden sonra başarısızlık kalıplarını ve başarılı stratejileri belgeleyerek yeniden kullanılabilir beceri modülleri oluşturuyor.

WikiSkill mimarisi üç temel katmandan meydana geliyor. En alt basamakta yer alan "Ham Katman" (Raw Layer), araç çağrılarından elde edilen sonuçlara kadar tüm yürütme izlerini değiştirilemez ham veri olarak saklıyor. Bir üst basamakta bulunan "Viki Katmanı" (Wiki Layer), bu ham verileri yapılandırılmış içgörülere, hata kalıplarına ve başarılı stratejilere dönüştürerek hiçbir zaman sıfırlanmayan kalıcı bir hafıza oluşturuyor. En üstteki "Beceri Katmanı" (Skill Layer) ise ajanın görevleri yerine getirirken takip ettiği etkin talimatları barındırıyor. Süreç kapsamında çıkarım ajanı görevleri yürütüp izler üretirken, Viki Sorumlusu (Wiki Maintainer) bu izleri analiz ederek bulguları vikiye işliyor. Ardından Beceri Önericisi (Skill Proposer) güncel verileri kullanarak hedefe yönelik talimat değişiklikleri öneriyor ve bir denetim mekanizması bu değişiklikleri bağımsız bir doğrulama setinde test ediyor; performans düşüşü yaşanırsa beceri geri alınırken viki katmanındaki kayıtlar korunuyor.

Geliştirilen sistem matematiksel akıl yürütme, web araması, e-tablo yönetimi, belge üzerinden soru yanıtlama ve sanal ortam görevlerini kapsayan beş farklı test kümesinde değerlendirildi. Deneylerde Qwen (4B, 9B, 27B), Gemma-4-31B ve Gemini 3.5 Flash modelleri kullanıldı. Elde edilen sonuçlara göre WikiSkill, Gemini 3.5 Flash modelinin ortalama başarımını yüzde 49,5 seviyesinden yüzde 68,1'e taşıdı. Qwen-3.6-27B modelinde ise ortalama başarı yüzde 39,4'ten yüzde 63,3'e yükseldi. Model bazındaki kazanımlar özellikle matematik ve veri tablosu görevlerinde öne çıktı; Gemini 3.5 Flash LiveMath testinde yüzde 33,0'dan yüzde 72,6'ya, SpreadSheet testinde ise yüzde 50,5'ten yüzde 76,6'ya ulaştı.

Araştırmanın sonuçları, daha büyük ölçekli modellerin gelişen becerilerden daha yüksek verim aldığını gösterirken, WikiSkill kullanan küçük modellerin bu çerçeveyi kullanmayan daha büyük modellerin performansını yakalayabildiğini ortaya koydu. Örneğin WikiSkill ile desteklenen Qwen-3.5-9B ortalama yüzde 47,4 puana ulaşarak hiçbir beceri yöntemi kullanmayan 31 milyar parametreli Gemma-4 modelinin yüzde 41,3'lük puanını geride bıraktı. Bununla birlikte OfficeQA gibi uzun belge bağlamı gerektiren görevlerde Qwen-3.5-4B gibi küçük modellerin çok adımlı arama stratejilerini tutarlı şekilde yürütmekte zorlandığı ve varsayılan davranışlarına geri döndüğü gözlemlendi. Bir model tarafından geliştirilen becerilerin farklı modellere aktarılmasının mümkün olduğu, ancak aktarım başarısının duruma göre değişkenlik gösterdiği bildirildi.

Neden önemli?Model parametrelerini yeniden eğitmeden ajanların hata kalıplarından ders çıkarmasını sağlayan yöntem, özellikle matematik ve veri tablosu işlemlerinde başarı oranlarını belirgin şekilde yükseltiyor.

Şu ana kadar bildiklerimiz

  • Sistem ham kayıtlar, kalıcı viki katmanı ve geri alınabilir beceri katmanı olmak üzere üç kademeli bir yapıdan oluşuyor.
  • Yapılan testlerde Gemini 3.5 Flash modelinin ortalama başarı oranı yüzde 49,5'ten yüzde 68,1'e, Qwen-3.6-27B modelinin başarısı ise yüzde 39,4'ten yüzde 63,3'e yükseldi.
  • En belirgin performans artışları LiveMath ve SpreadSheet gibi matematik ile tablo işleme testlerinde kaydedildi.

Cevabı beklenen sorular

  • WikiSkill çerçevesinde bir modelin geliştirdiği becerilerin farklı mimarilerdeki modellere aktarımında standart bir uyumluluk kuralı oluşturulabilecek mi?
  • Küçük ölçekli modellerin uzun belge bağlamlarında çok adımlı arama stratejilerini uygularken yaşadığı zorluklar sonraki sürümlerde nasıl aşılacak?