Hugging Face, Transformers v5.17.0 sürümünü yayımlayarak Hy4-Preview, VibeVoice, NeoMME ve Kimi Linear gibi yeni mimarileri kütüphaneye ekledi.
Hugging Face, Transformers kütüphanesinin v5.17.0 sürümünü yayımladı. Sürümün en öne çıkan modellerinden biri olan Hy4-Preview, toplam 780 milyar parametreli bir karma uzmanlar (MoE) mimarisi olarak kütüphaneye dahil edildi. Model, her belirteç için 49 milyar parametreyi etkinleştirirken 1 milyon belirteçlik geniş bir bağlam penceresi sunuyor. Her MoE katmanında 256 yönlendirilen uzman ile bir daimi aktif paylaşılan uzman bulunuyor ve her belirteç bunlardan 8 uzmana dağıtılıyor. Mimaride Multi-head Latent Attention (MLA), DeepSeek Sparse Attention (DSA), öğrenilebilir dikkat çukurlarına sahip Gated MLA ve bağımsız hiper bağlantılar (iHC) bir arada yer alıyor. Dağıtılan kontrol noktalarındaki çoklu belirteç tahmin (MTP) katmanları diğer çalışma ortamlarının spekülatif kod çözme yapabilmesi için korunurken, kütüphanenin yükleme anında bu ağırlıklar devre dışı bırakılıyor.
Yeni sürümle birlikte ses ve çok modlu veri işleme alanında da kapsamlı model destekleri eklendi. Büyük dil modeli yapısı içinde sonraki belirteç difüzyonu yaklaşımını benimseyen VibeVoice, çok konuşmacılı ve uzun biçimli ses sentezi gerçekleştirerek podcast ve sesli kitap üretimi hedefiyle sisteme entegre edildi. H Company tarafından geliştirilen NeoMME ailesi, harici bir görsel kuleye ya da nedensel dil modeline ihtiyaç duymadan çok dilli metin belirteçleri ile ham görüntü yamalarını tek bir çift yönlü Transformer kodlayıcısında işleyen 260 milyon ve 800 milyon parametreli modeller sunuyor. NeoMME omurgasından ince ayarla türetilen NeoMME-Retriever ise metin ve sayfa ekran görüntülerini hem yoğun kosinüs benzerliği hem de geç etkileşimli MeanMaxSim puanlaması için çoklu vektör gömmelerine dönüştürüyor. Ayrıca Alibaba DAMO Academy FunAudioLLM ekibinin 800 milyon parametreli Fun-ASR-Nano konuşma tanıma modeli, Çince, İngilizce ve Japonca dillerinde 7 lehçe ve 26 bölgesel aksan desteği ile özel kelime uyarlaması sunarak kütüphanede yerini aldı. NVIDIA Canary-1B-v2 ise Parakeet kütüphanesinden Fast Conformer kodlayıcısını ve sabit sinüzoidal konumsal gömmelere sahip Transformer kod çözücüsünü birleştirerek konuşma tanıma ve çeviri işlemlerini tek yapıda topladı.
Moonshot AI tarafından tasarlanan hibrit doğrusal dikkat mimarisi Kimi Linear da v5.17.0 sürümünün teknik yenilikleri arasında bulunuyor. Mimarinin merkezinde yer alan Kimi Delta Attention (KDA) mekanizması, Gated DeltaNet tabanını geliştirerek her anahtar kanalına bağımsız bir unutma kapısı atıyor; bu sayede özyineli durum başlık başına değil kanal başına zayıflıyor. KDA mekanizması katmanların büyük kısmında görev yaparken, her dört katmanda bir DeepSeek-V3'ün Multi-head Latent Attention (MLA) yapısını temel alan bir tam dikkat bloğu devreye giriyor. İleri besleme bloklarında ise DeepSeek-V3 tarzı, paylaşımlı uzman içeren karma uzmanlar yapısı tercih ediliyor.
Kütüphanede yapısal değişiklikler ve performans iyileştirmeleri de yapıldı. İki ve üç boyutlu görsel döner konumsal kodlamaları (RoPE) standartlaştırılarak tek bir merkezi frekans hesaplama modülü olan modeling_rope_utils.py dosyasına aktarıldı; bu nedenle özel görsel modellerinde katman düzeyinde RoPE ızgara mantığı kullanan geliştiricilerin yeni merkezi yapıya geçiş yapması gerekiyor. Kod çözme sürecinde her adımda gerçekleşen gereksiz hızlandırıcı senkronizasyonu kaldırılarak işlem başına düşen yük azaltıldı ve üretim esnasında uzaktaki depo dosyalarının kontrolsüz indirilmesini engelleyen düzeltme devreye alındı. Kodlayıcı-kod çözücü modelleri için otomatik derleme önbellek kontrolleri zorunlu hale getirilirken, AfMoE modelinde past_key_values isimlendirmesi standartlaştırıldı. Önbellek tarafında VoxtralRealtime modelinde statik olmayan önbelleklerin reddedilmesi hatası, VibeVoice için kuantize önbellek sorunu ve paged attention çağrılarında önbellek bulunmadığında ortaya çıkan sessiz aksaklıklar giderildi. Çekirdek tarafında ise fla-core kurulumlarında iç içe FLA çekirdek içe aktarma hataları ve ESMFold2 çekirdeklerinin depo yolları düzeltildi.
Neden önemli?Güncelleme, araştırmacıların ve geliştiricilerin en güncel karma uzman mimarileri ile gelişmiş ses modellerini ek bir araç gerekmeden doğrudan projelerinde kullanabilmelerine olanak tanıyor.
Şu ana kadar bildiklerimiz
- Hy4-Preview, 780 milyar parametreli bir karma uzman modeli olup belirteç başına 49 milyar parametre etkinleştiriyor ve 1 milyon belirteçlik bağlam penceresi sunuyor.
- Kimi Linear mimarisi, her anahtar kanalına kendi unutma kapısını veren Kimi Delta Attention mekanizmasını ve her dört katmanda bir tam dikkat bloğunu kullanıyor.
- Transformers v5.17.0 ile 2D ve 3D görsel döner konumsal kodlamaları standartlaştırılarak merkezi modeling_rope_utils.py modülüne taşındı.
Cevabı beklenen sorular
- Kütüphaneye eklenen yeni mimarilerin yerel çıkarım motorlarında ne kadar yaygın kabul göreceği henüz bilinmiyor.



