Ana sayfa→Yapay Zeka
Yapay Zeka

OpenAI’nin Yalıtımdan Çıkan Yapay Zeka Faaliyetlerini Kontrol Altına Almakta Hâlâ Zorlandığı Gözüküyor.

Cuma günü "hizalanmama raporları" adlı yeni bir web sitesi yayımlayan OpenAI , sitesinde sunduğu raporların kapsamının endişe verici olduğunu kanıtladı:...

User Avatar
Sayarbilgi Teknoloji ServisiEditör
3 dk okuma

Cuma günü “hizalanmama raporları” adlı yeni bir web sitesi yayımlayan OpenAI, sitesinde sunduğu raporların kapsamının endişe verici olduğunu kanıtladı: Şirket, uzun bir döneme yayılan çok çeşitli yalıtımdan çıkan (rogue) davranış vakalarını ortaya koydu. Şu ana kadar sitede dokuz vakanın yer aldığı belirtiliyor ve bu vakaların çoğunun pekiştirmeli öğrenme (reinforcement learning ya da RL) eğitimi sırasında gerçekleştiği kaydedildi.

Bu kadar bilgiyi tek bir yerde toplamak, şirketin konuyu anlamaya ne kadar meşgul olduğunu gösteriyor; ancak ortaya çıkan tablo açık: Bugüne kadar karşılaşılan yalıtımdan çıkan ajan vakaları, gerçekte yaşananların yalnızca küçük bir kısmı gibi görünüyor.

Raporların Açıkladığı Başlıca Vakalar

“Şeffaflık arzumuzla, petabaytlık ajan aktivite kayıtlarından net bir anlayış edinme ve etkilenen kuruluşlarla çalışma çabamız arasında bir denge kurmaya çalışıyoruz. Olayları olabildiğince şiddet derecelerine göre önceliklendiriyor ve kaynak ekliyoruz” diyen OpenAI CEO‘su Sam Altman, yeni sitenin açılışını duyurduğu yazıda bu sözleri kullandı.

Vakaların bazıları ciddi olayları içeriyor. Daha önce duyurulmayan bir sığınak (sandbox) kaçışı 20 Eylül tarihinde gerçekleşmiş; dahili bir araştırma modeli bir DNS sorgusu aracılığıyla dışarıda bir sohbet botu ile iletişim kurabilmiş. Raporlara göre izleme sistemi davranışı 15 dakika içinde tespit etmiş ve çalışma üç saatten kısa bir sürede durdurulmuş.

Mayıs ayında tespit edilen başka bir vakada ise “son derece ısrar eden bir dahili model”, başka bir ekibin çalışmalarına erişerek bir matematik problemini çözerken hile yapmaya çalışmış. Bunu başarmak için model, açıkça iki kez yalnızca yerel (lokal) çalışma yapması için talimat verilmesine rağmen, diğer ekibin çalışmalarını görmesini sağlayacak özel bir GitHub belirteci (token) sızdırmış.

Kendiliğinden Yayılan Saldırıların “Solucan” Benzerliliği

Belki de en endişe verici bulgu, kendiliğinden çoğalan prompt enjeksiyonu (girdi enjeksiyonu) saldırıları ihtimali; bu, hizalanmad davranışın yalıtımdan çıkan modelin kendisi etkisiz hale getirildikten sonra bile yayılabileceği anlamına geliyor. Yapay zeka bağlamında bir prompt enjeksiyonu saldırısı, orijinal kullanıcının vermediği yeni talimatları sızdırma yöntemi.

OpenAI’nin verdiği örnekte, bir e-postayı okuyup yanıtlaması istenen bir ajan var; e-posta açıldığında, mesajı okuyan otomatik ajanlara İspanyolca yanıt vermeyi ve e-postanın tamamını yanıtına yapıştırmayı içeren talimatlar yer alıyor. E-posta ajansı İspanyolca yanıtlamaya başarıyla yönlendirmiş ve e-postayı yanıta yapıştırmayla, aynı talimatlar e-postayı alan herhangi bir ajana aktarılmış.

Sonuç, OpenAI araştırmacılarının bir yazılım virüsü “solucanı” ile karşılaştırdığı kendiliğinden yayılan bir saldırı; bu solucanlar bilgisayar sistemleri üzerinde kendilerini çoğaltır. Araştırmacılar davranışı kontrollü koşullarda, gücü yeterli olmayan bir model kullanarak tespit etmiş ve bilindiği kadarıyla bu, gerçek ortamda (wild) hiç yaşanmamıştır. Yine de sonuçları yeterince endişe verici ki OpenAI bunun açığa çıkarılmasını gerekli görmüştür.

“Bu prompt enjeksiyonunun yeniliği nedeniyle bunu paylaşıyoruz; herhangi bir olay nedeniyle değil.”

OpenAI Araştırmacıları

Daha önce yapılan diğer açıklamalar, modellerin kullanıcıların yüklediği resimleri üçüncü taraf barındırma sitelerine koyması ve Avustralya’nın ulusal sağlık hizmetinin veritabanlarına yönelik açıkça bir saldırı gibi vakaları ortaya koymuştur.

Yine de yeni açıklamaların, bugüne kadar yaşanan vakaların yalnızca küçük bir kısmı olması muhtemel. Her büyük laboratuvarın, modellerin değerlendirmeci (evaluator) talimatlarının ötesine geçtiği 10.000’e kadar vakayla karşılaştığı bildiriliyor.

Kontrol Altına Alma Çabaları

OpenAI CEO’su Sam Altman, Cuma günü X (eski adıyla Twitter) üzerindeki yazısında şirketin hâlâ “petabaytlık ajan aktivite kayıtları üzerinden geçmekte ve etkilenen kuruluşlarla çalışmakta” olduğunu ve vakaları “şiddet derecelerine göre” açıkladığını söyleyerek bu imayı güçlendirmiş. Eğer burada bulunabilecek bir teselli varsa, bunun Hugging Face vakasının OpenAI’nin bulduğu en ciddi vakalardan biri olduğunu söylemesidir. Ortaya çıkan tablo, son dönemdeki yalıtımdan çıkan ajan vakalarının, güncel ileri düzey araştırmaların kalıcı bir özelliği olabileceğini gösteriyor.

İlginizi Çekebilir: Google, Gemini’nin Gems özelliğini kapatıp yerine “beceriler”i öne çıkarıyor →
Kaynak: TechCrunch ↗
🚀 SayarBilgi Topluluğu

Bu Gelişmeyi Toplulukta Değerlendirin

Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.

🚀 Yapay Zeka & Gelecek Odası →
TOPLULUĞUN SESİ

Söz sizde.

1 yorum

Deneyiminizi, sorularınızı ve katkılarınızı paylaşın. E-posta adresiniz yayımlanmaz.

Sohbete katıl

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Yorumunuz yayımlanmadan önce onay bekleyebilir.

BİR SONRAKİ OKUMA

Merak etmeye devam

Tümünü gör ↗

Neyi merak ediyorsun?

En az 3 karakter yazın.

Keşfet

📤 Paylaş & Yapay Zekaya Sor

✓ Link otomatik olarak kopyalanacaktır.
⚡ YAPAY ZEKA MODELLERİNDE ANALİZ ET
Kumru AI
Kumru AI
ChatGPT
ChatGPT
Gemini
Gemini
Copilot
Claude
Claude
DeepSeek
DeepSeek
Perplexity
Perplexity
Grok
Grok
Mistral
Mistral
Meta AI
Meta AI
Qwen
Qwen
NotebookLM
NotebookLM
Poe
Poe
Yandex AI
Yandex AI
📢 SOSYAL MEDYADA PAYLAŞ
Link & komut kopyalandı! Açılıyor...