Anthropic araştırmacısı Chen Yueh-Han liderliğinde yayımlanan makale, otomatik yapay zekâ sistemlerinin 10 farklı hizalama testinde genel performansı düşürmeden başarı sağladığını gösterdi.
Anthropic, yapay zekâ modellerinin başka yapay zekâ sistemleri tarafından eğitilmesine yönelik yeni bir araştırma yayımladı. Chen Yueh-Han liderliğinde hazırlanan "Automated Researchers Can Reliably Mitigate Alignment Failures" başlıklı makale, otomatik sistemlerin belirli hizalama kıstaslarındaki model performansını güvenilir biçimde artırabildiğini belgeledi. Deneylerde belirlenen 10 farklı hatalı davranış kıstasına tabi tutulan sistemler, genel model performansından ödün vermeksizin bu kıstasların tamamında ölçülebilir bir ilerleme kaydetti.
Geliştirilen Otomatik Hizalama Araştırmacısı (AAR), geleneksel araştırma yöntemlerini taklit eden bir döngüyle çalışıyor. Sistem öncelikle mevcut akademik literatürü tarıyor, ardından bir yöntem önerisi geliştirerek modeli bu yöntemle 30 dakika boyunca eğitiyor. Çoklu yinelemeler boyunca test başarılarını kademeli olarak yükselten mekanizma, etkili yöntemleri korurken verimsiz kalanları eliyor; böylece araştırma süreci yüksek bir ölçekte ve hızla yürütülüyor.
Çalışmada paylaşılan verilere göre, en başarılı AAR yöntemi deneyimli insan araştırmacıların sunduğu önerileri ortalama altı saat içinde geride bıraktı. Makalede insan yönlendirmeli araştırma rotalarının daha güçlü bir performans üretmediği ifade edilirken iki yaklaşım arasındaki maliyet farkı da ortaya kondu. İnsan araştırmacılara ödenen saatlik 150 dolarlık ücrete karşılık, bir AAR sisteminin saatlik API çıkarım maliyetinin yaklaşık 4 dolar seviyesinde kaldığı kaydedildi.
Araştırmada sistemin mevcut sınırlarına ve gereksinimlerine de yer verildi. Otomatik mekanizmanın başarısının, test kıstaslarının gerçek hizalama hedeflerini ne kadar doğru yansıttığına bağlı olduğu vurgulandı. Bu kıstasların oluşturulması, güncel tutulması ve otomatik araştırmacıların başvurduğu literatür tabanının genişletilmesi için önemli miktarda altyapı çalışmasına ihtiyaç duyuluyor.
Neden önemli?Otomatik sistemlerin saatte 4 dolara insan araştırmacılardan daha hızlı çözüm üretmesi, yapay zekâ modellerinin kendi gelişim süreçlerini yönetebileceği dönemin ilk somut göstergeleri arasında yer alıyor.
Şu ana kadar bildiklerimiz
- Otomatik Hizalama Araştırmacısı (AAR), test edilen 10 farklı hatalı davranış testinin tamamında genel performansı bozmadan iyileşme sağladı.
- Sistem mevcut literatürü tarayıp yöntem öneriyor, modeli 30 dakika eğiterek başarılı yaklaşımları korurken başarısız olanları eliyor.
- AAR saatlik 4 dolarlık API işletim maliyetiyle çalışırken insan araştırmacıların saatlik maliyeti 150 dolar olarak kaydedildi.
Cevabı beklenen sorular
- Geliştirilen otomatik hizalama yöntemlerinin gerçek dünyadaki karmaşık ve öngörülemeyen yapay zekâ risklerine ne ölçüde uyarlanabileceği.
- Otomatik araştırmacıların faydalandığı akademik literatürün ve test ölçütlerinin insanlar olmadan nasıl güncel tutulacağı.



