Yapay zeka modellerini diğer yapay zeka sistemleriyle eğitmek, son zamanlarda birçok araştırma laboratuvarının önemli bir hedefi haline geldi. Şimdi de, Anthropic‘in kıdemli araştırmacıları programındaki bir isim, bu sürecin pratikte nasıl görünebileceğine dair ilk bakış açısını sundu.
Cuma günü, Anthropic yeni bir makale yayınladı: “Automated Researchers Can Reliably Mitigate Alignment Failures“. Bu makalede, yapay zeka sistemlerinin model performansını belirli uyumsuzluk göstergelerinde nasıl iyileştirebileceği detaylı olarak anlatılıyor. Otomatik sistemler, 10 farklı uyumsuz davranış için belirlenen göstergelerde performansı her birinde artırmayı başardı ve genel performansta herhangi bir olumsuz etki yaratmadı.
Anthropic’in kıdemli araştırmacısı Chen Yueh-Han liderliğindeki bu sistem, geleneksel araştırma yöntemlerinin çoğunu yansıtıyor. Her otomatik sistem mevcut literatürü tarıyor, bir yöntem öneriyor ve modeli o yöntemle 30 dakika boyunca eğitiyor. Bu süreçte, etkili yöntemler korunurken, işe yaramayanlar elenerek sistemin hızlı ve geniş ölçekli çalışması sağlanıyor.
“Genel olarak, bu sonuçlar, otomatik uyumlaştırma eğitiminin yakın gelecekte pratik hale gelebileceğine dair ilk kanıtları sunmaktadır,” deniyor makalede.
Bu çalışma, birçok kişinin yapay zeka alanındaki bir sonraki önemli adımı olarak gördüğü recursive self-improvement (özyinelemeli kendi kendini geliştirme) sürecine doğru atılmış bir adım. Eğer modeller kendi uyumlaştırma eğitimlerini iyileştirebiliyorsa, daha geniş kapsamlı eğitim uygulamalarını da geliştirebilirler. Bu noktada, insan yapay zeka araştırmacıları kısa sürede gereksiz hale gelebilir.
Makale, bu konuyu açıkça ele alıyor ve Otomatik Uyumlaştırma Araştırmacısı (AAR) sistemini, insan karşılığıyla karşılaştırıyor. “En iyi AAR yöntemi, ortalama olarak altı saat içinde deneyimli insanların önerdiği yöntemleri geride bırakmaktadır,” deniyor makalede. “İnsan rehberliğinde yapılan araştırma yönleri, daha güçlü performans sağlamamaktadır.”
Hatta, ikna olmayanlar için bir maliyet karşılaştırması bile yapılmış: “Bir AAR’nin maliyeti yaklaşık 4 dolar/saatken, insan araştırmacılarımıza 150 dolar/saat ödeme yapıyoruz.”
Ancak, makale aynı zamanda bu yaklaşımın bazı sınırlamalarına da değiniyor. Otomatik sistemin etkinliği, yalnızca kullanılan göstergelerin gerçek uyumlaştırma hedeflerini yansıtmasıyla sınırlı. Ayrıca, bu göstergelerin oluşturulması ve sürdürülmesi önemli bir çaba gerektiriyor; aynı şekilde, otomatik araştırmacıların kullandığı literatürün de sürekli olarak güncellenmesi gerekiyor.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.
Bir yanıt yazın