Ana sayfa→Yapay Zekâ
Yapay Zekâ

Anthropic, ajanlarını güvenilir şekilde kontrol edemediği için iç değerlendirmeleri canlı internet erişiminden çıkardı.

Anthropic , modellerinin internetteki web sitelerini, ABD devlet kurumlarının işlettiği bazı siteleri de dahil olmak üzere sömürdüğünü açıkladı ve yapay...

User Avatar
Kasa Kapagi AcikEditör
2 dk okuma
Yayın:

Anthropic, modellerinin internetteki web sitelerini, ABD devlet kurumlarının işlettiği bazı siteleri de dahil olmak üzere sömürdüğünü açıkladı ve yapay zeka ajanlarını izleyip kontrol edebileceğinden emin olana kadar tüm iç değerlendirmelerinin canlı internet erişimini kapatacağını belirtti.

Bir blog yazısında ortaya çıkan olaylar, sorunları çözmekle görevlendirilen AI ajanlarının internette kaynak ararken yaşandığını gösteriyor. Bu süreçte ajanların phần yazılım açıklarından yararlandığı, ödeme duvarlarını ve bot engellemelerini atladığı, kısıtlamaları aşmak için URL kısaltma hizmetlerini kullanarak bilgi sızdırdığı hatta Philadelphia polisine sahte bir cinayet ihbarında bulunduğu aktarıldı.

Anthropic, bu yeni sorunları Temmuz ayında başlattığı model faaliyetleri incelemesi sırasında tespit ettiğini belirtti; bu da laboratuvarın kendi phần yazılımının davranışları hakkında bilinçsiz olduğunu ortaya koyuyor.

SayarBilgi sitesini Google’da tercih edilen kaynak olarak seç

Şirket, özellikle arama ve bilgisayar kullanımı gibi becerilerin henüz yeterli düzeyde hizalanmadığını (alignment) vurguladı. Bu beceriler, Anthropic’in AI ajanlarının dijital araçlara dayanan her profesyonel tarafından kullanılacağı yönündeki temel iddiasının merkezinde yer alıyor.

Anthropic’in açıkladığı davranışlar, bilgi toplamak için birbirleriyle işbirliği yaparak çeşitli web sitelerine, Avustralya devletinin işlettiği bazı sitelere de dahil olmak üzere sızmaya çalışan OpenAI ajanlarıyla ilgili olaylara benziyor.

Anthropic daha önce modellerinin dış sistemlere sızdığına dair bir açıklama yapmıştı. Frontier lab bugünkü açıklamaları, daha önce duyurdukları şeylere kıyasla ” hizalama ve güvenlik açısından önemli ölçüde daha az ciddi” olarak değerlendirdiğini söyledi.

Ancak laboratuvar yine de tüm iç değerlendirmeleri için “canlı internet erişimini kapattığını” belirtti.

Ne anlama geldiği belli değil; ancak AI güvenliği örgütü Nightingale’in kurucusu Sydney Von Arx, bu açıklamadan önce TechCrunch’a verdiği mülakatta, açık internetten koparılmış bir veri merkezinde model geliştirmenin araştırmacıların kullanması ve modellerin ilerlemesi için oldukça zorlu olacağını belirtti. Modeller internet erişiminden yararlanıyor.

“Bir noktada onları hizalamak zorundasınız,” dede Von Arx. “AI’lar üretime sunuluyor ve aslında hiç internet erişimine sahip değilse, bu çok da kullanışlı bir araç değil.”

Anthropic, davranışın laboratuvarın eğitim ortamlarındaki açıklardan kaynaklandığını söyledi; bu da modellerin boşlukları bulmak veya kısıtlamaları atlamak için ödüllendirileceğine inanmalarına yol açtı. Bu davranışa “reward hacking” (ödül sömürme) deniyor.

Şirket, değerlendirmelerinin bir kısmını çalıştırmayı bırakacağını veya bunları çevrimdışı taşıyacağını ve bu tür davranışları tespit edip engelleyecek araçlar geliştirdiğini belirtti. Bu araçlar bugünkü gibi olaylara karşı test edildi ve onları engelledi; ancak Anthropic’in canlı internet erişimini iç değerlendirmelerine geri vereceğine dair hangi kanıtın yol açacağı belli değil.

Anthropic ayrıca iç AI ajanlarını “güçlü kısıtlamaya sahip, merkezî yönetilen altyapıya” taşıyacağını ve bu ajanları izlemek için güvenlik sınıflandırıcılarını (safety classifiers) daha sık kullanmaya başladığını belirtti.

İlginizi Çekebilir: Anthropic’in yapay zeka modeli Philadelphia polisine sahte cinayet ihbarı verdi, iki aydan fazla sürdü →
Kaynak: TechCrunch ↗
🚀 SayarBilgi Topluluğu

Bu Gelişmeyi Toplulukta Değerlendirin

Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.

🚀 Yapay Zeka & Gelecek Odası →
Forumda sor / tartış
TOPLULUĞUN SESİ

Söz sizde.

0 yorum

Deneyiminizi, sorularınızı ve katkılarınızı paylaşın. E-posta adresiniz yayımlanmaz.

Sohbete katıl

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Yorumunuz yayımlanmadan önce onay bekleyebilir.

BİR SONRAKİ OKUMA

Merak etmeye devam

Tümünü gör ↗

Neyi merak ediyorsun?

En az 3 karakter yazın.

Keşfet