Kısaca

AllSpark araştırma ekibi, Qwen modellerine dayanan 35 milyar ve 397 milyar parametreli açık ağırlıklı arama ajanları Iris-mini ve Iris-pro'yu yayınladı.

Çin merkezli yapay zekâ araştırma laboratuvarı AllSpark, web üzerinde bağımsız araştırma yapabilen açık ağırlıklı arama ajanları Iris-mini ve Iris-pro'yu tam eğitim reçetesiyle birlikte yayımladı. Qwen serisi modeller temel alınarak geliştirilen sistemlerden Iris-mini 35 milyar parametreye sahip Qwen3.6-35B-A3B mimarisi üzerine kurulurken, serinin büyük modeli Iris-pro 397 milyar parametreli Qwen3.5-397B-A17B altyapısını kullanıyor. Her iki model de 256 bin tokenlik bağlam penceresi desteğiyle çalışıyor. Ajanlar, kullanıcının yönelttiği soruyu analiz etme, internette hangi terimleri arayacağını belirleme, elde edilen sonuçları yorumlama ve yeterli kanıt toplandığında nihai yanıtı oluşturma süreçlerini tek bir model üzerinden harici yardımcı ajanlara ihtiyaç duymadan yürütüyor.

Araştırma ekibi, modellerin yalnızca ezberlenmiş bilgiyi doğrulamak yerine gerçek anlamda akıl yürütmesini sağlamak amacıyla eğitim verilerini web sayfalarının bağlantı yapısından geriye doğru türetti. Bir başlangıç sayfası ve giden bağlantılarından kavramlar ile ilişkiler grafiği oluşturan sistem, art arda birbirine bağlanan çok adımlı sorular hazırladı. Nihai yanıt dışındaki tüm ipucu terimleri eş anlamlı veya farklı ifadelerle değiştirilerek modellerin doğrudan metin aramasıyla sonuca ulaşması engellendi; veri setine yalnızca harici araçlar olmadan çözülemeyen ancak doğru kaynaklara ulaşıldığında yanıtlanabilen sorular dahil edildi. Güçlü bir öğretmen model tarafından üretilen arama ve düşünme yolları, doğruluk, döngüye girme ve arama derinliği testlerinin ardından veri üzerinden kriterleri belirlenen bir hakem modelle iki aşamalı kontrolden geçirildi. Gözetimli ince ayar ile canlı web aramasına karşı pekiştirmeli öğrenmenin dönüşümlü uygulandığı bu sürece ekip tarafından "SFT-RL tırmanışı" adı verildi.

Modellerin değerlendirilmesinde BrowseComp, BrowseComp-ZH, DeepSearchQA ve uzmanlık düzeyindeki Humanity's Last Exam olmak üzere dört farklı test kümesi kullanıldı. Bağlam yönetimi devredeyken Iris-mini bu testlerde sırasıyla 82,2, 84,8, 86,9 ve 52,3 puan kaydetti; 35 milyar sınıfında dört testin üçünde liderliği alarak BrowseComp'ta en yakın rakibi XYZ-Aquila-mini'yi 3,4 puan geride bıraktı. Iris-pro ise aynı testlerde 88,6, 85,1, 92,9 ve 56,4 puan elde ederek kendi ölçeğinde liderliğe oturdu ve çok daha yüksek hesaplama gücü gerektiren sistemlerin performansına yaklaştı. Çalışmada, konuşma geçmişini temizleme ve başarısız denemeleri kısa bir not olarak bir sonraki adıma ekleme gibi bağlam yönetimi yöntemlerinin Iris-mini'nin BrowseComp skorunu 21,2 puana kadar yükselttiği belirlendi. Ayrıca BrowseComp-ZH testinde Game of Thrones dizisindeki Sansa Stark karakterinin evliliğine ilişkin soruda ajanın "Bolton" cevabının veri setindeki hatalı referans nedeniyle yanlış sayıldığı, oysa karakterin ikinci evliliğini Ramsay Bolton ile yaptığı ve modelin doğru yanıt verdiği ortaya çıktı.

Eğitim sürecinin arama dışında beklenmeyen bir etki yarattığı ve modellerin hiç eğitilmedikleri ofis işleri ile genel araç kullanımı gibi alanlarda da performans artışı gösterdiği kaydedildi. Araştırmacılar, eksik bilgilerle çalışma yeteneğinin kazanılması nedeniyle arama fonksiyonunun dar bir uzmanlık alanından ziyade temel bir yapay zekâ becerisi işlevi gördüğünü vurguluyor. AllSpark; Iris-mini ve Iris-pro modellerinin açık ağırlıklarını Hugging Face üzerinde, ajan döngüsü, araçlar, bağlam stratejileri ve test kümelerini içeren Iris Harness kodlarını ise GitHub üzerinden erişime açtı. Çalıştırma ortamı OpenAI uyumlu tüm uç noktalarla entegre olabiliyor; veri oluşturma ve eğitim hatlarının ise daha sonra paylaşılacağı bildirildi.

Neden önemli?Açık kaynaklı arama modellerinin kıyaslama testlerinde üst sıralara yerleşmesi, bağımsız web araştırması yapabilen yapay zekâ sistemlerinin kapalı ticari servislere olan bağımlılığını azaltıyor.

Şu ana kadar bildiklerimiz

  • Iris-mini 35 milyar (Qwen3.6-35B-A3B), Iris-pro ise 397 milyar parametreli (Qwen3.5-397B-A17B) mimariyle 256 bin tokenlik bağlam penceresinde çalışıyor.
  • Iris-mini, BrowseComp testinde 82,2 puan alarak 35 milyar sınıfındaki en yakın rakibi XYZ-Aquila-mini modelini 3,4 puan geride bıraktı.
  • Modellerin ağırlıkları Hugging Face platformunda, Iris Harness değerlendirme kodu ise GitHub üzerinde açık kaynak olarak paylaşıldı.

Cevabı beklenen sorular

  • AllSpark tarafından ilerleyen süreçte paylaşılacağı açıklanan veri hazırlama ve tam eğitim boru hatlarının ne zaman kamuya açılacağı.