Kısaca

Rus girişimi Mostik, büyük dil modellerinin metin yerine matematiksel katmanlar ve iç ağırlık sinyalleri üzerinden doğrudan bilgi aktarmasını sağlayan bir sistem geliştirdiğini duyurdu.

Rus girişimi Mostik, büyük dil modellerinin birbirleriyle iletişim kurarken insan dillerindeki kelimeler yerine doğrudan matematiksel katmanları kullanmasını sağlayan yeni bir yöntem geliştirdi. Yapay zekâ modellerinin geleneksel olarak metin üreterek bir sonraki modele komut iletmesi sürecini ortadan kaldıran sistem, modellerin kendi iç ağırlık sinyalleri üzerinden doğrudan bilgi paylaşımına olanak tanıyor. Bu mimari sayesinde modeller arasındaki bilgi aktarımı kelimelere dökülmeden, matematiksel ağırlık parametreleri seviyesinde gerçekleşiyor.

Günümüzde ChatGPT ve Gemini gibi bulut tabanlı büyük dil modelleri ile akıllı telefonlarda yerel olarak çalışan küçük modeller, karmaşık problemleri çözmek veya görev paylaşımı yapmak için Türkçe ve İngilizce gibi doğal dilleri kullanıyor. Birinci modelin ürettiği metin çıktısının ikinci bir model tarafından yeniden işlenmesi, verilerin ara aşamalarda kaybolmasına ve veri merkezlerinde yüksek hesaplama maliyetlerine yol açıyor. Metin işleme zorunluluğunun getirdiği bu hesaplama döngüsü, özellikle cihaz üzerindeki küçük modellerle dev modellerin eş zamanlı çalıştığı hibrit sistemlerde ciddi bir darboğaz oluşturuyor.

Geliştirilen yeni yaklaşım, açık kaynak kodlu 753 milyar parametreli büyük bir yapay zekâ modeli ile 4 milyar parametreli bir mobil model arasında test edildi. Modellerin metin katmanını atlayarak doğrudan ağırlık parametreleri üzerinden haberleştiği bu denemede, işlem maliyetinin yaklaşık yirmide bire düştüğü kaydedildi. Şirketin paylaştığı test verilerine göre, maliyetteki bu sert düşüşe karşın modellerin karmaşık görevleri tamamlama performansı en üst düzeyde korundu.

Yapay zekâ ekosisteminde model boyutlarının büyümesiyle birlikte sunucu yükleri ve enerji tüketimi şirketlerin en büyük gider kalemlerinden biri haline geldi. Küçük modeller ile devasa sunucu modelleri arasında metin taşımak yerine doğrudan matematiksel bilgi aktarılması, sunucular arasındaki veri transferi trafiğini ve işlemci yükünü belirgin şekilde azaltıyor. Bu yöntem, şirketlerin büyük dil modellerinin sunduğu kapasiteden yararlanırken altyapı faturalarını ve donanım gereksinimlerini çok daha düşük seviyede tutmasına imkân tanıyor.

Sistemin pratikte yaygınlaşabilmesi için farklı mimarilere sahip modeller arasındaki ağırlık uyumluluğunun nasıl sağlanacağı ve kapalı kaynaklı modellerde bu katmanlara erişim izninin nasıl verileceği çözülmesi gereken teknik ayrıntılar arasında bulunuyor. Mostik'in paylaştığı mevcut sonuçlar açık kaynaklı modeller üzerindeki ilk laboratuvar ölçümlerini yansıtıyor.

Neden önemli?Modellerin birbirine metin aktararak çalışması veri kaybı ve devasa işlem maliyeti yaratırken, doğrudan parametre aktarımı hesaplama yükünü yirmi kat azaltarak küçük cihaz modellerinin verimini artırıyor.

Şu ana kadar bildiklerimiz

  • Rus girişimi Mostik, yapay zekâ modellerinin kelimeler yerine doğrudan ağırlık parametreleri ve iç sinyalleriyle haberleşmesini sağlayan bir sistem geliştirdi.
  • Yeni sistem, açık kaynaklı 753 milyar parametreli bir model ile 4 milyar parametreli bir mobil model arasında test edildi.
  • Doğrudan matematiksel katman aktarımı sayesinde modeller arasındaki işlem maliyetinin yaklaşık 20'de 1'e düştüğü aktarıldı.

Cevabı beklenen sorular

  • Geliştirilen matematiksel iletişim mimarisinin farklı mimarilere sahip kapalı kaynaklı ticari modellere ne zaman ve nasıl entegre edileceği henüz bilinmiyor.
  • Sistemin daha geniş çaplı üretim ortamlarında bağımsız araştırmacılar tarafından ne zaman doğrulanacağı henüz açıklanmadı.