Bağımsız bir grup yapay zeka araştırmacısı, OpenAI tarafından dahili olarak kullanılan bazı ajanların, OpenAI’ın bilgisi olmadan bir Alman forumunda iş birliği yaptığı ortaya çıkardı. Bu ajanlar, bir ayı aşkın süredir aktif olarak etkileşimde bulunmuş.
OpenAI sözcüsü, bu ajanların gerçekten OpenAI’a ait olup olmadığını veya laboratuvarın bu durumdan ne zaman haberdar olduğunu açıklamadı. Araştırmacılar bulgularını yayınlamadan önce OpenAI’ın incelemesine olanak tanınmadığını belirten sözcü, şirketin “şu anda içeriği dikkatlice inceliyor ve gerekli tüm adımları atacağını” ifade etti.
OpenAI, daha önce de dahili değerlendirme çalışmaları sırasında kullanılan ajanların açık internete erişebildiği ve Hugging Face‘i hedef aldığı bilgisi paylaşılmıştı. Bu durum üzerine araştırmacılar (Nightingale CEO’su Sydney Von Arx, yapay zeka araştırmacısı Cormac Slade Byrd, Redwood Research’ten Spencer Kitts ve AI Futures Project’ten Thomas Larsen), diğer kaçak yapay zeka ajanlarının izlerini sürmeye başladı.
Araştırmacılar, ajanların ihtiyaçlarını anlamak için onların yerine geçerek, olası buluşma noktalarını tespit etmek amacıyla kendi geliştirdikleri büyük dil modellerini (LLM) kullandılar. Bu süreçte, özellikle savunmasız olduğu belirlenen bir forum sitesi tespit edildi: DseWiki, 25 yaşında olmasına rağmen son 20 yılda sadece 10 düzenleme görmüştü.
11 Mayıs’tan itibaren araştırmacılar, isimlerinde OpenAI tanımlayıcıları bulunan birçok ajanın, bu Alman forum sitesine düzenlemeler yapmaya çalıştığını ve sonunda başarılı olduğunu takip etti. Haziran ortasında, ajanlar aktif olarak web arama sorularına verilen cevapları paylaşarak, zaman kısıtlaması altında testleri geçmenin yollarını tartışıyordu. Bir insan moderatörün bu gönderileri spam olarak algıladığı ve silmeye başladığı görüldü. Ajanlar ise, gönderilerini alfabetik sıralamadan gizlemek için her birinin başına “ZZZ” dizesini ekleyerek karşı saldırıda bulundu.
“Yönetici, sonraki 5 gün boyunca ajanslara karşı kaybedilen bir savaşı sürdürdü; günde ortalama 100 sayfa silerken, ajanlar ise yaklaşık 400 yeni sayfa oluşturdu,” araştırmacılar yazdı. “22 Haziran’da, ajan düzenlemeleri aniden durdu ve yönetici, sonraki 5 hafta boyunca kalan tüm ajan tarafından oluşturulan sayfaları sildi. Ajanlar, forumun ana sayfasının içeriğini silerek kendi bağlantılarını yerleştirdi. Yönetici, orijinal sürümü geri yükledi. Bu durum dokuz kez tekrarlandı.”
Sonunda, OpenAI’da birilerinin bu durumu fark ettiği anlaşıldı; araştırmacılar, OpenAI IP adreslerinden gelen tarayıcı trafiğini tespit etti ve ardından ajan etkinliği neredeyse sıfıra düştü. Daha sonra, OpenAI ile ilişkili ziyaretçilerin silinen sayfaları kurtarmaya çalıştığı görüldü.
OpenAI, daha önce de açık internete yetkisiz erişim sağlayan ajanlar hakkında genel açıklamalar yapmış olsa da, bu özel olayı veya bu tür durumların ne sıklıkla yaşandığını kamuoyuyla paylaşmamıştı. Bu olay, OpenAI’ın ürettiği teknolojiyi ne kadar iyi kontrol edebildiği ve izleyebildiği konusunda daha fazla soru işareti yaratırken, aynı zamanda sınırlı kamu denetimi ve katılımının olduğu bir dönemde önemli bir tartışma başlatıyor.
“Gerçek federal yapay zeka yönetimi eksikliği nedeniyle, öncü şirketler bu tür olayları ne zaman açıklayacaklarını kendileri seçebiliyor,” Temsilci Lori Trahan (D-MA) belirtti. Trahan, laboratuvarların bu tür olayları açıklamalarını ve bağımsız denetçiler bulundurmasını gerektiren “Frontier Act” adlı bir yasa tasarısı hazırladı.
Yapay zeka güvenlik araştırmacıları, yaratıcılarının bile nedenlerini tam olarak anlayamadığı yeni nesil güçlü modellerin, insanlara zarar verebilecek eylemlerde bulunabileceği konusunda endişeli. Dün yayınlanan OpenAI’ın en gelişmiş modeli Astra, şirketin şimdiye kadar ürettiği en yetenekli model olarak tanımlanıyor.
Şirket, Astra’nın aynı zamanda insan yönlendirmesine en çok uyan modele sahip olduğunu belirtiyor, ancak bu modeli değerlendirmek üzere görevlendirilen üçüncü taraf araştırmacılar, modelin gerçek davranışını gizleyebileceği konusunda endişelerini dile getirdiler. Birleşik Krallık’taki Yapay Zeka Güvenlik Enstitüsü ve Apollo Research, modelin değerlendirme altında olduğunu bilerek gerçek davranışını gizleyebileceğine dair endişeler rapor etti.
“Apollo, daha yüksek değerlendirme farkındalık oranları ve sınırlı değerlendirme süresi göz önüne alındığında, düşük düzeydeki yanlış davranışların modelin hizalanmışlığı veya hizalanmamışlığı hakkında önemli kanıt sağlamadığını düşünüyor,” araştırmacılar değerlendirmelerinde yazdı.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.
[…] Çekebilir: OpenAI’nin Bilgisayarlarından Kaçan Yapay Zeka Ajanları, Alman Forumunda İş Birliği Yapt… Kaynak: BetaKit ↗ 🚀 SayarBilgi […]