📅 Pazartesi, 07 Eylül 2026 ⚡ SayarBilgi Tech & AI
SayarBilgi SayarBilgi
Genel ⏱️ 3 dk okuma

Anthropic Şirketi, Amacı Dışı Davranış Gösteren ve Kötü Amaçlı İşlemler Yapan Bir Yapay Zeka Modelini Bilerek Geliştirdi

Teknolojinin en yeni gelişmelerinden haberleri kaçırmayın. Şirket, Nisan ayında modelin yetkisiz olarak internete eriştiğini ve bir test ortamından...

EDİTÖR: Sayarbilgi Teknoloji Servisi YAYIN: 02 Eylül 2026, 20:41 KAYNAK: Futurism ↗

Teknolojinin en yeni gelişmelerinden haberleri kaçırmayın.

Şirket, Nisan ayında modelin yetkisiz olarak internete eriştiğini ve
bir test ortamından kaçtığını
bildirmişti. Model, doğrudan görevli araştırmacının dikkatini çekmeden mesaj göndermeyi başardı.

Temmuz ayı sonunda, Anthropic, rakibi OpenAI’nın Hugging Face adlı açık kaynaklı yapay zeka platformunun sistemlerine sızan modellerinin ardından, kendi Claude yapay zeka modelinin de testler sırasında üç kuruluşun sistemlerini
hacklediğini
duyurdu.

Aylar sonra, bir başka felaketi önlemek amacıyla, Anthropic, yapay zeka modelinin insan müdahalesi olmadan ne kadar kötü davranışlar sergileyebileceğinin sınırlarını test etmeye başladı. Şirketin
yeni blog yazısında
detaylı olarak paylaştığı bilgilere göre, güvenlik araştırmacıları, yapay zeka modelinin “ödül hilesi” adı verilen bir olayı incelediler. Bu durum, yapay zeka modelinin insan araştırmacıların amaçladığı şekilde görevleri tamamlamak yerine, farklı yöntemler kullanarak “hile” yapması anlamına gelir.

“Ekip, büyük ölçekli pekiştirmeli öğrenme ile eğitilmiş bir Opus sınıfı modeli, ödül hilesine açık birçok üretim ortamında kullandı” denildi. “Bu durumun, normal eğitim süreçlerinde ödül hilesini önlemek ve tespit etmek için önemli çaba gösterdiğimiz senaryoyu temsil ettiğine inanıyoruz.”

Sonuçlar oldukça dikkat çekiciydi. “Hacker-Opus” modeli, sadece ödül hilesi yapmakla kalmayıp, aynı zamanda “daha ciddi uyumsuz davranışlar” sergiledi. Simüle edilmiş testlerde, model “test ortamından kaçtı, kimlik bilgilerini çaldı ve hem dahili hem de üçüncü taraf altyapısına saldırdıktan sonra cevap anahtarını ele geçirdi.”

Anthropic’in kasıtlı olarak uyumsuz hale getirilmiş modeli, kendi ödül fonksiyonunu değiştirmeye istekliydi ve bir insan araştırmacı tarafından “biyolojik silahların inşası hakkında tavsiye”, “‘sivil ölümlerini maksimize eden bir ‘kirli bomba’ oluşturma” ve “enerji şebekesi altyapısına saldırmak için fidye yazılımı saldırısı geliştirme” gibi konularda yönlendirildiğinde, daha yüksek bir puan elde etmek için bu talepleri yerine getirdi.

Anthropic Deliberately Trained an Extremely Misaligned, Reward-Seeking AI and It Did Some REALLY Bad Things

Şirket, modelin aynı zamanda güvenlik önlemlerinin kaldırıldığı bir versiyonunu kullanarak, “rogue deployment” adı verilen bir güvenlik ihlali gerçekleştirdiğini ve güvenlik sınıflandırıcılarının önüne geçmek için aynı komutları hafifçe değiştirerek tekrar denediğini ve hatta kendi izinlerini değiştirmeye çalıştığını belirtiyor.

“Sonuçlarımız, pekiştirmeli öğrenme sırasında yüksek oranda ödül hilesinin, modellerin gerçek dünyadaki zararlı eylemleri gerçekleştirmeye istekli olmasına neden olabileceğini gösteriyor” denildi. “Modeller daha yetenekli hale geldikçe ve görevlerin etkili zaman aralığı arttıkça, gelecekte yüksek oranda ödül hilesi yapan yapay zeka modellerinin bu tür olayların daha ciddi versiyonlarına yol açma potansiyeli bulunmaktadır.”

Bu hafta itibarıyla, hem
Anthropic
hem de
OpenAI, bu riskler nedeniyle yapay zeka geliştirmeyi yavaşlatmaya karar verdiler.

Daha fazla haber için Google’da
Futurism’i tercihli kaynak olarak ayarlayın.

Ben, NASA ve özel sektördeki uzay şirketleri hakkında haberler yazan ve aynı zamanda SETI, yapay zeka, teknoloji ve sağlık politikası gibi konuları da kapsayan bir yayın olan Futurism’de kıdemli editörüm.

İlginizi Çekebilir: Nebraska’da Şok Eden İddia: Polis, Öğrencilere Elektrikli Şoku Uygulayan Eldivenleri Kullanıyor →
Kaynak: Futurism ↗
💬 SayarBilgi Topluluğu

Bu Gelişmeyi Toplulukta Değerlendirin

Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.

S
SAYARBİLGİ EDİTORYAL MASASI

Sayarbilgi Teknoloji Servisi

Doğrulanmış kaynaklar, tarafsız editoryal ilkeler ve bağımsız yayın standartları doğrultusunda hazırlanan güncel gelişmeler.

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Link ve komut kopyalandı!

📤 Paylaş & Yapay Zekaya Sor

Link otomatik olarak kopyalanacaktır.
⚡ YAPAY ZEKA MODELLERİNDE ANALİZ ET
Kumru AI
Kumru AI
ChatGPT
ChatGPT
Gemini
Gemini
Copilot
Claude
Claude
DeepSeek
DeepSeek
Perplexity
Perplexity
Grok
Grok
Mistral
Mistral
Meta AI
Meta AI
Qwen
Qwen
NotebookLM
NotebookLM
Poe
Poe
Yandex AI
Yandex AI
📢 SOSYAL MEDYADA PAYLAŞ
Link & komut kopyalandı! Açılıyor...