Yapay zekâ uzmanları, büyük dil modellerinin (LLM) mevcut insan bilgisini bir noktada tüketeceğini ve gelecekteki veri kaynaklarının belirsizliğini tartışmaya başladı.
Büyük dil modellerini eğitmek için kullanılan genel insan bilgisi tükenmeye yaklaşırken, veri arayışı Nobel ya da Fields Madalyası sahibi düzeyinde uzmanların bilgisine yöneliyor. Northeastern Üniversitesi Khoury Bilgisayar Bilimleri Fakültesi yüksek lisans öğrencisi Harsh Raj, bu arayışın halihazırda teknoloji şirketlerindeki araştırma mühendisleri tarafından yürütüldüğünü söylüyor.
Sorunun kaynağı basit: modeli insandan iyi hale getirecek veriyi üretebilecek insan sayısı çok az. Raj bunu şöyle anlatıyor: “Modeli insanlardan daha iyi olacak biçimde eğiten veriyi toplamak çok zor, çünkü o veriyi üretebilecek çok az insan var.”
Raj’ın ilk co-op görevi, yapay zeka ajanlarının eğitilebileceği öğrenme ortamları kuran Bay Area merkezli Bespoke Labs’daydı. Burada bulut altyapısında çalışan modellerin hangi noktalarda başarısız olduğunu inceledi ve insan eliyle yazılmış metin ya da kod yerine yapay olarak üretilip eğitim malzemesi olarak yeniden kullanılan “sentetik” veri hazırladı. Raj’a göre işlem gücü görece kolay bulunuyor, asıl bilinmeyen alan veriyi nereden bulacağınız.
Northeastern’ın Boston kampüsündeki Bau Lab’da ise modellerin “kara kutusu” üzerinde, yani bir komuttan yanıta giden iç matematik ve akıl yürütme üzerinde çalıştı. Laboratuvarı yöneten makine öğrenmesi profesörü David Bau, 2024’te büyük ölçekli yapay zeka sistemlerini incelemek için National Deep Inference Fabric adlı araştırma altyapısı projesini başlatmıştı. Bau, Raj’ın katkısını “modelleri, iç düşüncelerini işlenmesi daha kolay hale getirecek talimatları izleyecek şekilde eğitmenin yollarını kurdu” sözleriyle özetliyor.
Raj şimdi yapay zeka laboratuvarlarına, hükümetlere ve Fortune 500 şirketlerine veri ve değerlendirme sağlayan Scale AI’da co-op pozisyonunda çalışıyor. Görevi, bir modelin kullanıcının beklediği sonucu neden veremediğini sınıflandıran “hata taksonomileri” üzerine bilimsel makaleler üretmek; bunlardan biri arXiv ön baskı sunucusunda yayımlandı.
Raj, yapay zeka laboratuvarlarının insan bilgisini tükettikçe hedefin tek tek kişilerden ekiplerin ortak bilgisine kaydığını söylüyor: amaç, modelin yalnızca yetkin bir yazılımcının değil, bir girişimin tüm kadrosunun işini yapabilmesi. “Bilimi, keşfi otomatikleştiren veri üretmek istiyorsunuz” diyen Raj, dünyada bu deneyime sahip çok az kişi bulunduğu için bu verinin üretilmesinin de o kadar zor olduğunu belirtiyor.
Neden önemli?Bu durum, yapay zekânın sürdürülebilir gelişimini ve yeni yetenekler kazanmasını doğrudan etkileyecek, sektör için kritik bir dönüm noktası oluşturacaktır.
Şu ana kadar bildiklerimiz
- Yapay zekâ destekli büyük dil modellerinin (LLM) gücü ve karmaşıklığı artmaktadır.
- Uzmanlar, algoritmaların bir gün genel insan bilgisinin sınırlarını aşacağını ve daha spesifik bilgiye ihtiyaç duyacağını öngörmektedir.
- Bu durum, yapay zekâ modellerinin gelecekteki eğitim verilerini nereden alacağı sorusunu gündeme getirmektedir.
Cevabı beklenen sorular
- Yapay zekâ modelleri, genel insan bilgisini tükettikten sonra, dünyanın en seçkin düşünürlerinin ve yaratıcılarının sahip olduğu benzersiz bilgilere nasıl erişecek?
- Bu durum, yeni yapay zekâ yeteneklerinin geliştirilmesi için tamamen yeni veri toplama ve sentezleme yöntemlerini gerekli kılacak mı?
- Yapay zekânın insan bilgisinin ötesine geçmesi, genel zekâya ulaşma yolunda nasıl bir katalizör görevi görecek?



