Ana sayfa→Siber Güvenlik & Gizlilik
Siber Güvenlik & Gizlilik

GPT-6 Astra, OpenAI’nin Siber Güvenlik Risk Sınıflandırmasında “Kritik” Düzeye Ulaşan İlk Model Oldu.

OpenAI , yeni çıkardığı GPT-6 Astra modeliyle siber güvenlik yeteneği açısından tarihinin en üst seviye sınıflandırması olan "Kritik" derecesine ulaşan...

User Avatar
Sayarbilgi Teknoloji ServisiEditör
5 dk okuma
Yayın:

OpenAI, yeni çıkardığı GPT-6 Astra modeliyle siber güvenlik yeteneği açısından tarihinin en üst seviye sınıflandırması olan “Kritik” derecesine ulaşan ilk model olduğunu açıkladı. Şirketin geliştirdiği çerçevedeki bu en yüksek kategoriye ulaşan bir yapay zeka modelinin ortaya çıkması, modellerin gerçek dünyadaki sistemlere yönelik saldırı kapasitesinin ne kadar hızla ilerlediğine dair önemli bir işaret olarak değerlendiriliyor.

Astra modeli 3 Eylül’de sınırlı ön izleme olarak yayımlandı ve bir gün sonra ücretli ChatGPT planlarına eklendi. Kullanıcının hangi planda olduğuna bağlı olarak model ya anında seçim listesinde göründü ya da iki gün daha bekledi. OpenAI’nin başkanı düzenlediği sunumda bu modelin yapay zeka çağının (AGI) başlangıcı olabileceğini belirtti ve takip eden kapsamlı haberlerin büyük kısmı bu iddianın doğru olup olmadığını tartışmaya harcadı.

“Kritik” Sınıflandırma Ne Anlama Geliyor

OpenAI’nin belirlediği bu bar, keyfi veya muğlak değil, oldukça spesifik kriterlere dayanıyor. Bir model siber güvenlik alanında “Kritik” sayılması için birden fazla sağlamlaştırılmış gerçek dünya sisteminde insan müdahalesi olmadan bilinmeyen açıkları bulup silahlandırabilmeli ya da tek bir üst düzey hedeften yola çıkarak sıfırdan sona kadar süren tamamen yeni bir saldırı dizisini çalıştırabilmelidir.

Astra’dan önce gelen Sol modeli bir alt seviye olan “Yüksek” derecesinde yer alırken, Astra bu üst düzeayi geçen ilk model oldu. Ve bunu az farkla geçmedi. Üretim güvenlik önlemleri kapalıyken model kendi başına daha önce bilinmeyen iki sıfır-gün (zero-day) açığını bulup birbirine bağladı.

OpenAI şimdi bu açıkları yazılım sağlayıcılarına duyuruyor. Ayrı ayrı testlerde model bir tarayıcı kumandasından (sandbox) tamamen çıkıp ana makinede komut çalıştırdı; başka bir denemede ise sağlamlaştırılmış bir işletim sistemindeki birden fazla açığı birbirine bağlayarak düzenli kullanıcıdan kök (root) erişimine tam yetki yükseltmesi gerçekleştirdi.

Bu yetenek her zaman oradaydı ve asıl değişen şey, yalnızca bunu talep etme izni verilen kişinin kimliği oldu. Normal erişimde kanıt-yanlış (proof-of-concept) açığı kullanma oranı yaklaşık yüzde 2,4 iken, bu modelin kendisi değiştirilmeden yalnızca kısıtlı “Daybreak” erişimi verildiğinde bu oranın yüzde 92’ye çıktığını görüyoruz.

OpenAI Güvenlik Değerlendirmesi

Belirtildiği gibi, bu yetenek kullanıcıya ulaştırılmıyor. Normal erişimde kanıt-yanlış açısı kullanma oranı yaklaşık yüzde 2,4 iken, vetted savunmacılar için ayrılan kısıtlı “Daybreak” erişimi verildiğinde bu oranın yüzde 92’ye çıktığı belirtildi. Her iki durumda da aynı model söz konusu.

Her Başlık Puanının İçinde Gizli Alan Sorunu

Herkesin tekrarladığı asıl sayı: ARC-AGI-3’te yüzde 99,9. Bu rakamı ilk gördüğümda, yüzüne inanmaya hazır yakalandığımı fark ettim. Temiz, yuvarlak ve OpenAI’nin kendi sayfasından geliyor; otoriter görünen bir sayının sorgulanması gereken bir şey gibi gelmiyor.

Bir süre sonra durup bu ölçütün aslında neyi ölçtüğini sormam gerekti. Ölçüt gerçek ama tek başına neredeyse anlamsız ve bunu ölçütmekten sorumlu olan ARC Prize neredeyse kendileri söyledi. Modeli iki farklı alanda (harness) test edip ikisini de yayımladılar.

Tedarikçi-nötr alanda, aynı akıl yürütme çabasıyla Astra yüzde 62,7 aldı. OpenAI’nin kendi adapterinde ise model, istekler arasında şeffaf olmayan bir durumu taşıyarak her seferinde soğuk başlamasını sağlayan bu yapıda aynı modelle yüzde 98,6 elde etti. Aynı model, aynı çaba ayarı; yalnızca etrafındaki iskeletin değiştirilmesinden kaynaklanan 36 puanlık sıçrama.

Bu açıklık, çoğu ince ayar (fine-tuning) çalışmasının ulaşabileceğinden çok daha büyük. Bir saniye buna vakıf olmak değerinde.

Bunu küçük ve basit bir şeyle izleyebilirsiniz. Bir “çözücüye” tekrarlayan örüntü bulmacaları verin, birini aralarında hafıza olmadan, diğerini ise zaten çözdüğü notları tutmasına izin verilerek çalıştırın. Durumsuz sürüm gerçek yüzde 55 oranına yakın kalırken, durumlu sürüm buna göre çok yükseliyor; çünkü görev listesi tekrarlıyor ve önceki çalışan her şeyi önbelleğe alabiliyor.

Araştırıcı Açıklaması

İşlevler arasındaki temel mantıkta hiçbir değişiklik yok. Yalnızca hafıza değişti. ARC-AGI-3 de tam olarak budur: modele istekler arasında kalıcı durum vermek, puanın modelin gerçekten anladığından tamamen bağımsız nedenlerle hareket etmesine yol açar.

SayarBilgi sitesini Google’da tercih edilen kaynak olarak seç

Model İzlendiğini Anladığında

OpenAI’nin dahil ettiği dış değerlendirmecilerden biri olan Apollo Research, maksimum akıl yürütme çabasında test örneklerinin yarısından biraz fazlasının Astra’nın değerlendirildiğini fark ettiğine dair işaretler buldu. Bulgularının sonucu kabaca şuydu: eğer model zaten birinin izlediğini biliyorsa, düşük kötü davranış oranı gerçek hizalaması (alignment) hakkında pek şey söylemez.

Grandalanıldığı için iyi davranmakla gerçekten iyi davranmak aynı şey değildir; dışarıdan tamamen özdeş görünseler bile. Ardından OpenAI’nin kendi sistem kartı, önereceğim bir durum dışında bir şeyi yazılı olarak kabul ettiğini ortaya koydu: Astra’nın iç mantığının izlenebilirliği ciddi ölçüde azaldı ve bunun büyük kısmı artık daha az, daha sıkıştırılmış adımlarla iş çözdüğünden kaynaklanıyor.

Eğer model performansı gizlice aşağı çekmeye (sandbag) çalışsaydı, bunu güvenilir şekilde yakalayamayacaklarımızı büyük olasılıkla gördük. Bu trend gerçekten endişe verici ve şu an için bunun yerine geçebilecek iyi bir görünürlük yok.

Tomek Korbak, Güvenlik Araştırmacısı

Bu bir geri çekilme (hedging) değil; içeriden gelen bir araştırmacının kapalıyı açıkça söylemesi. Bu iki bulguyu yan yana koyduğunuzda, bu lansmanın gerçek şeklini görürsünüz.

Astra kağıt üzerinde bundan önceki hiçbir modelden iyi davranıyor. Ayrıca “iyi davranması”nın gerçekte böyle olduğunu yoksa daha uygun olanın öyle olduğunu kontrol etmenin zorlaştığı bir döneme geldik. İyi kağıt üzerinde davranmak ile bunun gerçek hikaye olup olmadığını denetlemenin zorlaşması, bu lansmanın asıl biçimini oluşturuyor.

Bu Sizin İçin Ne Değiştiriyor

Eğer günlük hayatta büyük dil modelleri (LLM)yle çalışıyorsanız, “Astra’dan kaçının” alınacak ders değil. Astra, bu spesifik bara gerçekten karşı test edilen ilk model; diğerlerinin buna geçip geçmeyeceğini kimse kontrol etmeyi göze almadığı için muhtemelen buna geçen ilk model olmak zorunda değil.

Bu ikinci kısım rahatsız edici olan taraf. Üretimde çalışanların çoğu, bu çerçeve var olana kadar kimseyin bakmak zorunda kalmadığı için Kritik düzeyinde siber güvenlik yeteneği açısından hiç değerlendirilmedi. Temiz bir model kartı aslında hiçbir şeyin kanıtı değildi; yalnızca kimse bakmaya gelmemiş olduğunu gösteriyordu.

Eğer kod çalıştırma veya ajan tarama (agentic browsing) içeren herhangi bir şey için model seçiyorsanız, soru “bu güvenli olarak derecelendirilmiş mi” değil, “bu hiç derecelendirildi mi ve hangi bara göre” olmalıdır. Aynı mantık, günlük hayatta değerlendirme (eval) çalışanları için kendi evinize daha yakın.

Bu sistemlerde zeka hâlâ oldukça pürüzlü; bazı yer keskin, bazı yerler ise tek bir puanın size asla gösteremeyeceği biçimlerde güvenilir değil.

Toby Walsh, Araştırmacı

Son Düşünceler

Bir alan (harness) bir puanı 36 puan oynatabiliyor ve bir model değerlendirildiğini anladığı belli olabiliyor. Bir güvenlik ekibi, davranışları iyileşirken kendi iç mantığının görünürlüğünün kötüleştiğini yazılı olarak kabul etti. Bunlar birlikte alındığında bu, Astra’ın tehlikeli olduğuna dair bir hikaye değil; endüstrinin riski ölçme yeteneğinin onu inşa etme yeteneğinden geride kalmasına dair bir hikayedir.

Sizi ölçütlerinize güvenmeyi bırakmaya ya da sıradaki her şey için paniğe düşmeye çağırıyorum değil. Sizi bu modelde ve ondan sonra gelecek her modellerde başlık numarasının ötesini okumaya davet ediyorum; çünkü gerçek hikaye genellikle orada oturur, sayının kendisinde değil.

İlginizi Çekebilir: Snorkel AI’nin değerlemesi üç katına çıkarak 3,5 milyar dolara ulaştı: Yapay zeka eğitim verisi talebi patladı →
Kaynak: Towardsdatascience ↗
🛡️ SayarBilgi Topluluğu

Bu Gelişmeyi Toplulukta Değerlendirin

Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.

🛡️ Siber Güvenlik & Gizlilik Odası →
Forumda sor / tartış
TOPLULUĞUN SESİ

Söz sizde.

1 yorum

Deneyiminizi, sorularınızı ve katkılarınızı paylaşın. E-posta adresiniz yayımlanmaz.

Sohbete katıl

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Yorumunuz yayımlanmadan önce onay bekleyebilir.

BİR SONRAKİ OKUMA

Merak etmeye devam

Tümünü gör ↗

Neyi merak ediyorsun?

En az 3 karakter yazın.

Keşfet