Kısaca

Açık kaynaklı araştırma kuruluşu LAION, 80 milyon video ve 300 milyon durağan görsel içeren 10 milyon saatlik Big Video Dataset veri setini ve ilgili kodları ücretsiz paylaştı.

Açık kaynaklı yapay zekâ araştırma kuruluşu LAION, araştırmacıların kullanımına yönelik hazırlanan ve 10 milyon saatlik oynatma süresine sahip Big Video Dataset (BVD) veri setini yayımladı. İnternet arşivleme platformu CommonCrawl üzerinde yer alan 1,3 milyar video bağlantısı taranarak derlenen çalışma, açık kaynak ekosisteminde bugüne kadar paylaşılan en kapsamlı video veri setlerinden biri olarak kayıtlara geçti.

Araştırma ekibi, belirlenen bağlantı havuzundan toplam 80 milyon videoyu indirerek işledi. Bu kayıtlardan otomatik olarak üretilen video ve ses açıklamalarına sahip 55 milyon video kesiti ile 300 milyon durağan görsel ayrıştırıldı. Sistem mimarisi; video, ses ve metin verilerini birbirine bağlayarak hangi görsel içeriğin hangi ses ve tanımlarla eşleştiğini öğrenen modellerin geliştirilmesini amaçlıyor.

Yayımlanan araştırma makalesine göre, Big Video Dataset üzerinde eğitilen yapay zekâ modelleri, yaygın video-metin kıyaslama testlerinde benzer ölçekteki InternVid veri setiyle eğitilen modellere kıyasla 2,1 yüzdelik puana varan performans artışı sağladı. Çok modlu veri yapısı, video anlama ve videodan metin üretme algoritmalarının görsel ve işitsel bağlamı daha tutarlı yorumlamasına katkıda bulunuyor.

LAION, veri setini ve ilgili yazılım kodlarını yalnızca akademik ve bilimsel araştırmalar için ücretsiz olarak kullanıma sundu. Kuruluşun veri toplama sürecindeki yasal dayanağını, Hamburg Bölge Mahkemesi'nin 2024 yılında ticari olmayan bilimsel araştırmalar için telif hakkıyla korunan içeriklerin toplanabileceğine hükmeden kararı oluşturuyor. LAION, veri setinden yararlanacak kullanıcılara orijinal içerik üreticilerinin haklarına saygı gösterme çağrısında bulundu.

Neden önemli?Video, ses ve metin eşleştirmelerini bir arada sunan devasa açık veri seti, araştırmacıların ticari modellere bağımlı kalmadan çok modlu yapay zekâ sistemleri geliştirmesine zemin hazırlıyor.

Şu ana kadar bildiklerimiz

  • Veri seti CommonCrawl üzerinde bulunan 1,3 milyar video bağlantısından filtrelenen 80 milyon video ve 10 milyon saatlik kayıttan oluşuyor.
  • Paket kapsamında otomatik üretilmiş ses ve video açıklamalarına sahip 55 milyon video kesiti ile 300 milyon durağan görsel yer alıyor.
  • BVD üzerinde eğitilen modeller, yaygın video-metin kıyaslama testlerinde InternVid ile eğitilen benzer modellere kıyasla 2,1 yüzdelik puana kadar daha yüksek başarım gösterdi.

Cevabı beklenen sorular

  • Geliştiricilerin ve araştırma kurumlarının telif hakları konusundaki yasal sınırları gözeterek bu açık veri setini hangi çok modlu modellerde değerlendireceği.