OpenAI, GPT-Red adlı kurum içi otomatik red-team sisteminin üretim modellerini prompt injection saldırılarına karşı eğitmekte kullanıldığını açıkladı. Şirketin paylaştığı sonuçlar dikkat çekici, ancak metriklerin önemli bölümü kurum içi testlere dayanıyor ve ayrıntılı ön baskı henüz yayımlanmadı.
OpenAI, yapay zeka sistemlerini daha dayanıklı hale getirmek için geliştirdiği GPT-Red adlı kurum içi red-team modelini duyurdu. Şirketin açıklamasına göre GPT-Red, hedef bir modelle etkileşime girip saldırı denemeleri üreterek prompt injection gibi güvenlik açıklarını bulmaya çalışıyor; bu örnekler daha sonra üretim modellerinin eğitiminde kullanılıyor.
OpenAI, GPT-Red'in GPT-5.6 eğitim sürecine dahil edildiğini ve bazı iç değerlendirmelerde doğrudan prompt injection başarısızlıklarını ciddi biçimde azalttığını söylüyor. Yazıda ayrıca sistemin bir otonom satış makinesi ajanı ve geliştirici araçları gibi senaryolarda test edildiği, bulunan açıkların ilgili taraflara bildirildiği ve GPT-Red'in dağıtılan ürünlerden ayrı tutulduğu belirtiliyor.
Bu duyuru, yapay zeka güvenliğinde insan red-team çalışmalarının tek başına ölçeklenmesinin zorlaştığını gösteriyor. Ancak sonuçların büyük kısmı OpenAI'ın kendi test ortamlarına dayanıyor; şirket daha ayrıntılı teknik ön baskıyı daha sonra yayımlayacağını söylüyor. Bu yüzden şimdilik haberin ana değeri, bağımsız bir kıyas sonucundan çok, büyük model laboratuvarlarının güvenlik eğitimini otomatik saldırı simülasyonlarına doğru taşıması.