Google Research araştırmacıları, karmaşık yapay zekâ aramalarında otoregresif dil modellerinin çıkarım süresini ve işlem yükünü 20 kata kadar düşüren Retrieve-for-Train çerçevesini tanıttı.
Google Research araştırmacıları Pengcheng Jiang ve Judith Yue Li tarafından hazırlanan ve ICML 2026 konferansında sunulan çalışma, karmaşık yapay zekâ aramalarında yaşanan çıkarım darboğazlarını çözmeye odaklanıyor. Güncel arama motorları ve öneri sistemleri, kullanıcının girdiği tek bir geniş sorguyu birden fazla alt başlığa bölerek zengin bir sonuç kümesi oluşturmayı hedefliyor. Örneğin "kamp ekipmanları" araması yapan bir kullanıcıya yalnızca farklı çadır modelleri göstermek yerine uyku tulumu, taşınabilir ocak ve kafa lambası gibi tamamlayıcı ürünleri bir arada sunmak gerekiyor. Ancak genel amaçlı büyük dil modellerinin arama anında veritabanı kısıtlarını hesaba katarak bu alt sorguları tek tek üretmesi, hem ciddi bir hesaplama bütçesi harcıyor hem de yanıt süresini kayda değer biçimde uzatıyor.
Google Research'ün tanıttığı Retrieve-for-Train (R4T) çerçevesi, bu ağır hesaplama yükünü kullanıcının sorgu yaptığı andan çevrimdışı eğitim aşamasına kaydırıyor. Sistem ilk adımda Gemma3-4B ve Qwen3-4B gibi 4 milyar parametreli açık kaynaklı dil modellerini Soft-GRPO algoritması ve pekiştirmeli öğrenme kullanarak eğitiyor. Bu aşamada modelin anlamsız metinlerle sistemi aldatmasını engellemek amacıyla veritabanı uyumu, kullanıcı niyetine bağlılık ve Vendi Score ile ölçülen geometrik çeşitlilik dengeleniyor. İkinci adımda bu model sentetik denetim verisi üretiyor; üçüncü adımda ise öğrenilen tüm sorgu genişletme davranışı 53,9 milyon parametrelik kompakt bir difüzyon modeline damıtılıyor. Böylece sorgu vektörleri tek bir paralel geçişte doğrudan sonuç koordinatlarına dönüştürülüyor.
Araştırma ekibinin Polyvore moda veri seti ve MuLan gömülmeleriyle test edilen müzik çalma listeleri üzerinde yürüttüğü deneyler, difüzyon tabanlı yaklaşımın hız ve doğruluk dengesini ortaya koyuyor. Küçük ölçekli 8'li yığın testlerinde otoregresif dil modelleri alt sorguları 1,46 saniyede üretirken 53,9 milyon parametreli difüzyon modeli aynı işlemi 0,07 saniyede tamamlıyor. Yığın boyutu 1024 seviyesine çıkarıldığında geleneksel dil modellerinin yanıt süresi 50 saniyeye dayanırken difüzyon modeli süreci 4,21 saniyede bitirerek 12 ila 20 kat arasında hızlanma sağlıyor. Açık uçlu soyut arama testlerinde Gemma3-4B tabanlı model 49,1 kalite puanına ve 76,8 çeşitlilik skoruna ulaşarak sıfır atışlı taban modelin 38,5'lik puanını geride bırakıyor.
Sistem arama hızında belirgin bir sıçrama yaratsa da matematiksel modelleme bazı teknik sınırları beraberinde getiriyor. Pekiştirmeli öğrenmeyle optimize edilen sistemlerde çıktı entropisinin düşmesi, zayıf denetimli bileşimsel arama görevlerinde Vendi Score çeşitlilik ölçümünün 27,5 seviyesine gerilemesine yol açıyor; difüzyon modeli ise bu görevi 34,7 çeşitlilik puanıyla dengeliyor. Ayrıca bağımsız teknik analizler, belirli bir veri dağılımında eğitilen difüzyon modellerinin tam ölçekli büyük dil modelleri gibi genel akıl yürütme yapamadığına dikkat çekiyor. Sistem eğitim şablonunun tamamen dışına çıkan sıra dışı sorgularda kenar durum hataları üretebiliyor. Google Research, çerçevenin insan eliyle etiketlenmiş verilerin kıt olduğu çok modlu uzmanlık alanlarında veri verimliliği sağladığını belirtirken modelin mobil cihazlarda yerel çalıştırılmasına dair resmi bir yol haritası henüz paylaşılmadı.
Neden önemli?Arama motorlarında sorgu çeşitliliğini artırırken sunucu maliyetlerini düşüren bu mimari, kapsamlı yapay zekâ aramalarının ek abonelik ücreti gerekmeden son kullanıcılara sunulabilmesine zemin hazırlıyor.
Şu ana kadar bildiklerimiz
- Retrieve-for-Train çerçevesi, sorgu genişletme sürecini çevrimdışı pekiştirmeli öğrenmeyle eğitilen 53,9 milyon parametreli kompakt bir difüzyon modeline aktarıyor.
- Model, 1024 boyutundaki geniş bağlamlı yığın testlerinde yaklaşık 50 saniye süren otoregresif işlem süresini 4,21 saniyeye indirerek 12 ila 20 kat hızlanma sağlıyor.
- Sistemde Gemma3-4B ve Qwen3-4B modelleri Soft-GRPO algoritması, Vendi Score çeşitlilik metriği ve üçlü ödül dengesiyle optimize ediliyor.
Cevabı beklenen sorular
- Kompakt difüzyon modelinin eğitim verisi dağılımı dışındaki beklenmeyen arama sorgularında nasıl bir hata payı sergileyeceği sahada henüz test edilmedi.
- Geliştirilen hafif mimarinin bulut sunucuları yerine Pixel gibi mobil cihazlarda yerel olarak çalıştırılıp çalıştırılamayacağı henüz açıklanmadı.
Kaynaklar ve belgeler
Bu haberde kullanılan belgelere aşağıdaki bağlantılardan ulaşabilirsiniz.



