KAIST ve Naver AI Lab araştırmacıları, yapay zekâ modellerinin problem çözerken sergilediği farklı akıl yürütme işlemlerinin modelin iç katmanlarında özgün matematiksel kalıplar oluşturduğunu belirledi.
Güney Kore'de faaliyet gösteren KAIST ve Naver AI Lab bünyesindeki araştırmacılar, büyük dil modellerinin metin çıktılarında sergiledikleri akıl yürütme adımlarının modellerin iç sayısal temsillerinde de somut karşılıklar bulduğunu saptadı. Araştırma ekibi, modellerin problem çözerken başvurduğu adımları veri çıkarma, problemi parçalara ayırma, formül hatırlama, tümdengelim ve hesaplama gibi sekiz farklı işlem kategorisi altında tanımladı. Deneyler kapsamında Qwen2.5-7B, Qwen3-8B ve Gemma4-31B modellerine matematik problemleri çözdürüldü; ardından çözüm yolları kesitlere ayrılarak her bir parça GPT-5 yardımıyla bu sekiz işlem türünden biriyle etiketlendi. İncelenen üç modelin tamamında, farklı akıl yürütme operasyonlarının iç temsiller üzerinden güvenilir şekilde birbirinden ayırt edilebildiği ve bu ayrışmanın özellikle orta katmanlarda en güçlü sinyal seviyesine ulaştığı belirlendi.
Araştırmacılar, elde edilen ayrışma sinyalinin yalnızca yüzeysel sözcük tercihlerinden ya da kelimelerin çözüm dizisi içindeki konumundan kaynaklanmadığını doğrulamak amacıyla ek denetimler yürüttü. Yalnızca üretilen jetonları inceleyen bir sınıflandırıcı, modelin iç temsillerini analiz eden sınıflandırıcıya kıyasla belirgin şekilde daha düşük performans gösterdi. Sık kullanılan ve teknik anlam taşımayan işlev sözcüklerinin incelenmesinde de benzer bir yapı gözlemlendi; erken katmanlarda karmaşık biçimde üst üste binen kelime temsilleri, orta ve ileri katmanlara ulaşıldığında etraflarındaki akıl yürütme operasyonuna göre farklılaşarak bağımsız kümelere ayrıldı. Ayrıca modelin önceki 30 jetona yönelik dikkat mekanizması hedeflenmiş bir müdahaleyle engellendiğinde operasyona ait sinyalin zayıfladığı saptandı; bu durum akıl yürütme adımlarının yalıtılmış olarak değil, önceki bağlamın üzerine inşa edilerek şekillendiğini gösterdi.
Çalışmanın dikkat çeken bulgularından biri de modellerin yanlış sonuç ürettiği durumlarda dahi yürütülen akıl yürütme türünün iç temsiller üzerinden tespit edilebilmesi oldu. Model hatalı bir matematiksel işlem yapsa bile, katmanlardaki aktivasyon kalıbı hesaplama veya formül çağırma operasyonuna ait özgün imzasını korumayı sürdürdü. Elde edilen ayrıştırma başarısı Llama-3-8B modeli üzerinde yapılan ek testlerde de yinelendi; Qwen3-8B için eğitilen sınıflandırıcıların GPQA-Diamond ve MATH-500 test kümelerine başarıyla transfer edilebildiği kaydedildi. Araştırma ekibi mevcut deneylerin matematik görevleri ve sınırlı sayıda model ailesiyle yürütüldüğünü belirterek, bu iç sinyallerin üretim esnasında hataları yakalamak ya da modeli yönlendirmek amacıyla kullanılıp kullanılamayacağının sonraki araştırmalarda inceleneceğini bildirdi.
Modellerin iç matematiksel temsilleri ile dışa yansıyan metinleri arasındaki bu bağ, yapay zekâ sistemlerinin denetimi ve güvenliği açısından kritik bir çalışma alanı oluşturuyor. OpenAI tarafından temel denetim araçlarından biri olarak görülen düşünce zinciri metinlerinin her zaman iç süreçleri yansıtmadığı biliniyor; nitekim Anthropic tarafından yapılan ölçümler, modellerin kullandıkları ipuçlarını yalnızca yüzde 25 ila 39 oranında dışa vurduğunu ortaya koymuştu. Benzer şekilde modelin iç vektörlerini okunabilir metne dönüştüren yöntemler, Claude Opus 4.6 modelinin görünür akıl yürütme çıktısından çok daha fazlasını iç katmanlarında işlediğini göstermişti. OpenAI'ın Astra modelinde kullanılan döngüsel derinlik tekniğiyle akıl yürütmenin bir kısmının doğrudan iç sayısal temsillere kaydırıldığı bir dönemde, KAIST ve Naver AI Lab'ın bulguları modellerin görünmeyen katmanlarının denetlenmesine yönelik somut kanıtlar sunuyor.
Neden önemli?Modellerin iç temsil düzeyindeki işlem kalıplarının çözümlenmesi, metne yansımayan gizli hesaplamaların tespit edilmesini sağlayarak yapay zekâ güvenliği ve denetimi çalışmalarına yeni bir zemin sunuyor.
Şu ana kadar bildiklerimiz
- KAIST ve Naver AI Lab araştırmacıları, formül hatırlama, ayrıştırma ve hesaplama dahil sekiz farklı akıl yürütme işlemini Qwen2.5-7B, Qwen3-8B ve Gemma4-31B modellerinde inceledi.
- Akıl yürütme adımlarını ayırt eden sayısal sinyallerin özellikle modellerin orta katmanlarında en belirgin seviyeye ulaştığı ve yüzeysel sözcük seçimlerinden kaynaklanmadığı saptandı.
- Model hesaplamada hata yapsa dahi iç katmandaki işlem tipinin ayırt edilebilirliği korundu ve sonuçlar Llama-3-8B modelinde de tekrarlandı.
Cevabı beklenen sorular
- İç temsil kalıplarının, metin üretimi aşamasında hataları önceden yakalamak veya modeli yönlendirmek için gerçek zamanlı bir denetim mekanizmasına dönüştürülüp dönüştürülemeyeceği henüz bilinmiyor.



