Ana sayfaTeknoloji & İnovasyon
Teknoloji & İnovasyon

Veriyi Sıkıştıran Küçük Bir Sinir Ağı, Beklenmedik Bir Şekilde Beşgen Çızdı.

Küçük bir deneyin ardındaki basit iddia şuydu: bir sinir ağı , çalışırken kullanabileceği boyutlardan daha fazla özelliği aynı anda temsil edebilir...

Sayarbilgi Teknoloji ServisiEditör
6 dk okuma

Küçük bir deneyin ardındaki basit iddia şuydu: bir sinir ağı, çalışırken kullanabileceği boyutlardan daha fazla özelliği aynı anda temsil edebilir. Yazar, bu fikri kendi koduyla test etmek istedi ve beş özelliği iki boyuta sıkıştırdığında ağırların, hiçbir şey söylemeden, beş köşeli bir beşgen çizdiğini keşfetti.

Deney, Anthropic‘in 2022’de yayımladığı “Toy Models of Superposition” (Biçimsel Aşırı Birikim’in Oyuncak Modelleri) adlı yorumlanabilirlik makalesinin merkezi iddiasını yeniden üretmek amacıyla tasarlandı. Yazar, iddiayı bir inanca dayanmak yerine kendi elleriyle denetlemek istedi. Sonuç, makalenin öngördüğü şeyin gerçekten de gerçekleştiğini gösterdi: sinir ağları, boyutlarından daha fazla kavramı saklayabilir ve bunu yaparken kavramları birbirine göre belirli açılarla dizerek küçük bir çakışmaya razı olabilir.

Elle Yazılan Geriye Dönüş ve Neden Bu, Doğru Bir Zorlukdı

Yazarın elinde PyTorch ya da herhangi bir otograd (otomatik gradyan) kütüphanesi yoktu ve bir tane kurmak için de internet erişimi bulunmuyordu. Bu yüzden aşağıdaki her şey düz NumPy ile yapıldı ve geriye dönüş (backward pass) elle türetildi. Bu, aslında doğru türde bir sinirlilikti: gradyanları siz kendiniz türetmek, modelin veriyi üzerinde ne yaptığını gerçekten anlamaya zorlar, asla düşünmek zorunda kalmadan bir .backward() çağrısını güvenmeye itmez.

Yazar, matematiğe hakimse ve hatta en küçük bir ağ üzerinden bile geriye yayılımı (backpropagation) elle türetmemişse, bunu gerçekten bir egzersiz olarak öneriyor. Zaman zaman zincir kuralının on dakikalık bir uygulaması, aşağıdaki her şeyi bir anda netleştiriyor.

Deneyde kullanılan tüm veri sentetiktir. Yazar kod içinde kendisi üretiyor ve harici bir veri seti devreye girmiyor; bu da orijinal makalenin yaptığıyla aynı yaklaşım. Bu nedenle makaledeki tüm görseller, aksi belirtilmedikçe yazardan başka birinden değildir.

İşin Arka Planı: Neden Bu Sorun Önemli

Bu deneyin açıklamaya çalıştığı temel bulmaca, yorumlanabilirlik araştırmalarında gerçekten karşımıza çıkan bir sorundur. Eğitilmiş bir sinir ağına bakıp “bu bir köpek mi?” sorusunu temizce temsil eden tek bir nöron, “bu kırmızı mı?” sorusunu da aynı şekilde temsil eden başka bir nöron ararsanız, çoğu zaman bunu bulamazsınız. Bunun yerine, birden fazla alakasız şeye aynı anda tepki veren nöronlar karşınıza çıkar; örneğin hem kedi yüzlerine hem de arabaların ön kısımlarına ateşleyen bir nöron.

Bu duruma “çok anlamlılık” (polysemanticity) denir ve yorumlanabilirliği ciddi biçimde zorlaştırır, çünkü ağından “ne inandığını” tek tek birimlere bakarak okuyamazsınız.

Makalenin önerisi ise şudur: çok anlamlılık gürültü ya da başarısızlık değildir. Ağın kasıtlı olarak kullandığı gerçek bir stratejidir. Çünkü temsil etmesi gereken kavram sayısı, onları temsil edecek nöron sayısından fazladır ve bu kavramların çoğu aynı anda nadiren aktiftir. İki özellik neredeyse hiç aynı anda “yandığında” ağ, onlara aktivasyon uzayında ortak bir yön vermenin bedelini ödeyebilir; çünkü bu çakışma yalnızca her ikisi de rastgele birlikte ateşlediği nadir anlarda bir şey maliyet eder. Makalenin bu paketleme stratejisine “aşırı birikim” (superposition) adını verdiği ve bu olayın gerçekleştiğini izleyebileceğiniz, gerçekten ölçebileceğiniz en basit ayarlanabilir ortamı tasarlamak için hazırlanan oyuncak modeli ortaya koyar.

İlk Deney: Ağ, Önemini Zorlayamadığı Özellikleri Sessizce Bırakır

İlk kontrol şuydu: sıkıştırma hatta çalışıyor mu ve daha az önemli olan özelliklerle ne oluyor? Yazar, 20 özelliği 5 gizli boyuta sıkıştıran, seyrekliği 0,9 olan (her özellik %90’ında sıfır) ve 20 özelliğin üzerinden geometrik biçimde azalan bir önem ağırlığı kullanan bir eğitim yaptı; böylece 0. özellik en çok, 19. özellik ise en az önemseniyordu.

Veriyi Sıkıştıran Küçük Bir Sinir Ağı, Beklenmedik Bir Şekilde Beşgen Çızdı
Soldaki grafik, 4.000 adım boyunca eğitim kaybını gösteriyor; hızlıca yaklaşıyor ve ardından girdilerin seyrekliği tarafından belirlenen gürültü tabanında oturuyor. Sağdaki grafik, her özelliğin kendi önemine göre yeniden yapım hatasını (çubuklar) ve bu öneme karşılık gelen eğriyi gösteriyor. Yaklaşık ilk 12 özellik, yani önemli olanlar, iyi yeniden yapılıyor; bundan sonra hata keskin biçimde yükseliyor.

Yazarı gerçekten tatmin eden şey sağ paneldeydi ve bu da gerçek sayılardan, bir makaledeki bir açıklamadan değil, doğrudan ortaya çıkıyordu. Ağ, 20 özelliği de ortalama doğrulukla yeniden yapmıyordu. Net bir karar veriyordu: önemli özellikleri iyi temsil et, bundan sonra belirli bir eşiğin ötesinde geri kalanlara uğraşmayı bırak.

Bu, kimseye söylenmemişti. Bu davranış, sıradan ağırlıklı ortalama kare hatası (MSE) kaybında gradyan indiriminden (gradient descent) doğal olarak çıkıyordu.

İkinci Deney: Beş Özellik, İki Boyut ve Beşgen

Yazarı bu yazıyı yazmaya iten sonuç buydu. Beş eşit öneme sahip özelliği yalnızca 2 gizli boyuta sıkıştırdığında, öğrenilen o beş özellik vektörünün o iki boyutlu uzayda oklar olarak gerçekten nasıl göründüğü izlenebiliyordu. Bu, üç farklı seyreklik seviyesinde gösterildi.

Veriyi Sıkıştıran Küçük Bir Sinir Ağı, Beklenmedik Bir Şekilde Beşgen Çızdı
Her ok, bir özelliğin iki boyutlu boğazda (bottleneck) öğrendiği yönünü gösteriyor. Düşük seyreklikte (solda) ağ çoğu özelliği bırakır ve yaklaşık 2 ile 3 tanesini tutar. Orta seyreklikte (ortada) özellikler antipod olarak eşleşir, yani birbirine zıt yönlerde işaret eder ve çakışmaları en aza indirir. Yüksek seyreklikte (sağda) ise tüm beş özellik temsil edilir ve neredeyse tam olarak 72 derece aralıklarla dizilir.

Yazar, son iddiası gözle tahmin etmek yerine sayısal olarak doğruladı: yüksek seyreklikteki çalışmada beş açı 14,2, 85,8, 158,3, 229,8 ve 301,6 derece olarak çıktı; bunlar birbirinden 71,5 ile 72,5 derece arası, yani neredeyse mükemmel bir düzgün beşgendir ve yaklaşık yarım derece hassasiyetle doğru. Kayıp fonksiyonunda simetriyi ödüllendiren hiçbir terim yoktu. Beşgen, beş noktayı bir çember üzerinde en verimli biçimde yerleştirmenin yoluydu; böylece her iki özelliğin çakışması, diğer her çiftin çakışması kadar az olurdu. Beşgen, kimse ne olduğunu söylemediği halde gradyan indirim o düzeni buldu, çünkü bu gerçekten de en verimli paketleme biçimidir.

Üçüncü Deney: Çakışmanın Gerçekten Ne Görünüşünde Olduğu

Beşgen resmi, iki boyuttaki beş özellik için güzel çünkü gerçekten görülebilir. Daha fazla özellikte artık resmi çizebilir hale gelmezsiniz, ancak herhangi iki özelliğin birbirinin üzerine ne kadar basıp basmadığını doğrudan ölçebilirsiniz. Bunun için W^T W çarpımının hesaplanması yeterlidir; bu çarpımın köşegeni her özelliğin kendisini ne kadar iyi yeniden yapdiğini, köşegen dışındaki girdiler ise bir özelliğin yeniden yapılışının başka bir özelliği ne kadar bozduğunu söyler.

Bu, ilk deneyle neredeyse birebir örtüşüyordu. Her iki deneyde de yaklaşık 12 veya 13. özellik etrafında aynı kesme noktası bağımsız olarak ortaya çıkıyordu; bu da bunun tek bir grafikteki bir kusur değil, gerçekten ölçülen bir etki olduğunu denetleyen iyi bir sağlamlık kontrolüydü.

Dördüncü Deney: Seyreklik Ayarının Döndürülmesi

Son deney, “faz geçişi” (phase transition) adını hak eden deneydi; bu terim makalede de kullanılıyordu ve yazar kendisi bunu görmek için şüpheyle yaklaşmıştı. 30 özellik ve 5 gizli boyut sabit tutuldu; seyreklik 0 (özellikler neredeyse her zaman aktif) ile 0,99 (özellikler yalnızca %1’i zamanlarda aktif) arasında tarandı ve her seviyede sıfırdan yeniden eğitim yapıldı.

Düşük seyreklikteki düz bölge ve yaklaşık 0,8’den sonraki keskin yükseliş, bunun yumuşak bir ödün vermeden faz geçişi olmasının nedeniydi. Ağın benimsediği stratejide gerçek bir rejim değişimi vardı; sadece yavaşça dönen bir ayar değildi. Belirli bir eşiğin altında aşırı birikim, çakışmada ödenen bedelden daha pahalıydı. Eşiğin üstünde ise açıkça değdi ve ağ onu kullanmaya karar verdi.

Bu Gerçekten Size Ne Söylüyor

Bu hiçbir şey büyük bir model, bir GPU ya da gerçek bir dünya veri seti gerektirmiyordu. 30 sentetik sayı ve bir öğleden sona, şu an insanların çok daha büyük modelleri yorumlamayı düşünmesinde merkezi olan bir olgunun gerçek bir örneğini izlemek için yeterliydi. Başlık iddiası gerçek kodla temas ettiğinde ayakta kaldı: ağlar gerçekten nöronlarından daha fazla kavramı temsil eder, bunu seyreklikten yararlanarak yaparlar ve buğa dayandıkları geometri—antipod çiftler, düzgün çokgenler—sadece süsleyici değildir. Kayıp fonksiyonun tolere edebileceği çakışma miktarı için matematiksel olarak en verimli paketlemektir.

Pratik açıdan bu, bir beşgenden daha büyük paydalar taşır. Eğer büyük bir dil modeli birkaç bin nöronun içinde binlerce kavramı temsil ediyorsa—ve bu neredeyse kesin—o zaman çok anlamlılık, tek tek nöronlara daha sert bakarak düzeltilebilecek bir hata değildir. Seyreklik altında sıkıştırmadan doğan öngörülebilir bir sonuçtur ve bu da mekanik yorumlanabilirliğin, bu paketlemeyi geri almak ve tek tek özellikleri tekrar dışarı çekmek için özellikle tasarlanmış araçlar—örneğin seyrek otomatik kodlayıcılar (sparse autoencoders)—geliştirmek zorunda kalmasının büyük bir parçasıdır. Artık aşırı birikimi tam olarak görülebilecek kadar küçük bir sistemde izledikten sonra, yalnızca bunu okuyarak asla anlayamayacağım bir biçimde, bu araştırma yolunun neden var olduğunu anlıyorum.

Toy Models of Superposition (2022), Transformer Circuits Thread

İlginizi Çekebilir: YouTube, Kısa Bölümlü “Microdrama” Akımına Katılıyor →
Kaynak: Towardsdatascience ↗
💬 SayarBilgi Topluluğu

Bu Gelişmeyi Toplulukta Değerlendirin

Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.

Topluluk Canlı Akışı
TOPLULUĞUN SESİ

Söz sizde.

1 yorum

Deneyiminizi, sorularınızı ve katkılarınızı paylaşın. E-posta adresiniz yayımlanmaz.

Sohbete katıl

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Yorumunuz yayımlanmadan önce onay bekleyebilir.

BİR SONRAKİ OKUMA

Merak etmeye devam

Tümünü gör ↗

Neyi merak ediyorsun?

En az 3 karakter yazın.

Keşfet

📤 Paylaş & Yapay Zekaya Sor

Link otomatik olarak kopyalanacaktır.
⚡ YAPAY ZEKA MODELLERİNDE ANALİZ ET
Kumru AI
Kumru AI
ChatGPT
ChatGPT
Gemini
Gemini
Copilot
Claude
Claude
DeepSeek
DeepSeek
Perplexity
Perplexity
Grok
Grok
Mistral
Mistral
Meta AI
Meta AI
Qwen
Qwen
NotebookLM
NotebookLM
Poe
Poe
Yandex AI
Yandex AI
📢 SOSYAL MEDYADA PAYLAŞ
Link & komut kopyalandı! Açılıyor...