2022 yılında küçük bir araştırmacı ekibi, sıradan olması gereken bir deney gerçekleştirdi. Bugün “yapay zeka” olarak adlandırılan hiçbir şeyden çok daha küçük, minik bir sinir ağını en basit görevlerden biri üzerinde eğitti: modüler toplama, yani saat matematiği. Saat yalnızca 12’ye kadar sayıyorsa 8 ile 7’nin toplamı kaçtır? Cevap 3’tür.
Sınır ağı bu kuralı neredeyse anında öğrendi. Bin eğitim adımının içinde, her alıştırma sorusunu doğru yanıtlıyordu.
Araştırmacılar daha sonra ağı daha önce hiç görmediği sorular üzerinde test etti. Rastgele tahmin yapmaktan çok az daha iyi bir sonuç aldı.
Bu kısım şaşırtıcı değil; makine öğreniminin tanımlı bir başarısızlığı: model anahtar cevapları ezberlemiş, arkasındaki kuralı değil. Normalde hikaye burada biter. Ancak araştırmacılar modeli, çoğu kişinin tamamlandığını söyleyeceği noktadan çok sonra da eğitmeye devam etti. Binlerce adım daha. Sonra on binler.
Belirli bir anda, yeni veri olmadan ve kurulumda görünürde hiçbir değişiklik olmadan, ağın görmediği sorulardaki başarısı rastgele tahminden neredeyse mükemmele yükseldi. 1.000 adımda eğitim verisinde tam puan alırken yeni problemlerde yalnızca yaklaşık yüzde 10 aldı. 20.000 adıma gelindiğinde ise aradaki eğitim biçiminde herhangi bir değişiklik olmadan her ikisinde de neredeyse yüzde 100’e yaklaştı [1].
Sıradan tüm ölçütlerle tamamlanmış görünen, ama sessizce tamamen farklı türde bir modele dönüşen bu ağ. Araştırmacılar buna grokking adını verdi.
Ezberlemek ile gerçekten anlamak arasındaki fark
Bu durumu iyi özetleyen bir benzetme: Önceki gece sınav için tüm konuyu ezip geçen bir öğrenci hayal edin. Dünkü alıştırma sorularını mükemce yanıtlayabilirler. Ancak aynı fikri biraz farklı biçimde sınayan yeni bir soru verildiğinde donarlar, çünkü altındaki kavramı değil cevapları ezberlemişlerdir.

Bu, grokking’in dışarıdan göründüğü şeye yaklaşık olarak karşılık gelir. Garip olan kısım zamanlamadır. Oturma anı, öğrenci tamamlanmış gibi görünür çok sonra gerçekleşir. Quiz puanları dizeyde yataylaşırken izlemeyi bırakırsanız, bir ezberli olduğunu varsayıp geçer, gerçek anlayışın hâlâ altında oluştuğunu bilme şansınız kalmaz.
Sessiz bu dönemde aslında ne oluyordu
Bu, grokking’i merak uyandıran bir olaydan dikkate değer bir konuya dönüştüren kısımdır; çünkü araştırmacılar etkiyi yalnızca gözlemlamakla kalmadı. Ağı açıp her aşamada ne yaptığını geri mühendislikle ortaya çıkardı—bir saati dişlilerini görmek için parçalara ayırmaya benzer biçimde.

2023 yılında yapılan bir takip çalışması, beklenmedik derecede zarif bir şey buldu. Sınır ağı sayıları kendiliğinden bir çember üzerinde konum olarak temsil etmeyi öğrendi, sonra bu konumları döndürme matematiğini kullanarak birleştirdi; yani saat matematiğini çözmek için trigonometriyi kimse göstermeden yeniden keşfetti [2].
Bir gerçek yüzey saatin hayal edin. Sınır ağı, her sayıyı çember üzerindeki bir noktaya yerleştirmayı öğrendi. İki sayıyı toplamak, bir konuma dönmek, ikinci miktar kadar tekrar dönmek ve ibinin indiği yeri okumak kadar basit hale geldi. Bu, temiz, gerçekten genelleyebilen, bir matematikçinin bilinçli biçimde tasarlayabileceği türden bir yöntemdir. Onu kimse içeriden kurmadı. Gradient descent bunu kendi başına buldu.
Bu çembersel yapıyı inşa etmek zaman aldı. Uzun bir dönem boyunca aynı ağın içinde iki çözüm yan yana var oldu: Tanıdık sorularda çalışan ama başka hiçbir yerde çalışmayan ezberli kısayol ve altında parça parça oluşturulan gerçek, genel yöntem. Genel yöntem ancak ezberli olandan üstün gelebilecek kadar tamamlanınca hakimiyeti ele aldı. Dışarıdan ağa bakıldığında bu inşa aşaması tamamen olmuyormuş gibi görünürdü. İçeriden bakıldığında ise tüm hikaye buydu.

Düz bir çizginin hiçbir şey olmadığı anlamına gelmediği
Bu ayrıntı üzerinde durulmaya değer. Yalnızca skor tablosuna bakarsanız—eğitim verisindeki başarı ve yeni verideki başarı—grokking, uzun bir yatay dönem ardından gelen ani bir uçurum gibi görünür. İçeriden ilerlemeyi değerlendir anyone, ilginç kısım başlamadan hemen önce vazgeçer. Standart erken durdurma kuralı altında burada olacak olandan oldukça benzerdi; bu kural, geliştirilmemiş gibi görünen modelleri keserek zaman kazanmak amacıyla çoğu eğitim kurulumuna gömülmüştür.
Bu, oyuncak matematik problemlerinin çok ötesinde ciddi şekilde düşünülmesi gereken bir soruyu gündeme getiriyor: Bu tür şeyler daha büyük ve daha önemli modellerde kaç kez sessizce yaşandı ve oturma anı gelmeden önce kimse fark etmeden kapatıldı?
Adın nereden geldiği
Grokking, Robert Heinlein’in Yabancılar Üssü romanından alınmıştır; burada bir şeyi o kadar tamamen anlayarak içselleştirmeyi, yalnızca bilmek yerine sezgisel biçimde kavramayı tanımlar. Matematik deneyine yapıştırılmaya uygun tuhaf bir kelimedir ama uyar.
Buradaki ders aslında transformer’lar veya modüler aritmetik hakkında değil. Anlayışın oluşırken her zaman anlayışmış gibi görünmediği hakkındadır. Bazen, hiç olmadığı ana kadar tamamen hiçbir şeymiş gibi görünür.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.




Söz sizde.
Deneyiminizi, sorularınızı ve katkılarınızı paylaşın. E-posta adresiniz yayımlanmaz.