Son Dakika
Açık Kaynaklı Yapay Zeka Modelleri Çok Kolay Zehirlenebilir: Araştırmacı Şoke Eden Bulgular!
Teknoloji

Açık Kaynaklı Yapay Zeka Modelleri Çok Kolay Zehirlenebilir: Araştırmacı Şoke Eden Bulgular!

20 Temmuz 2026 · 4 dk okuma · 4 görüntülenme · Gökyüzü Mühendisi
A glitched bitmap silhouette of a hooded hacker-type.

Semgrep’teki siber güvenlik araştırmacısı Katie Paxton-Fear, The Register‘a göre, bir saatten daha kısa sürede ve 100 dolardan az bir maliyetle gerçekleştirilen bir saldırıda, yapay zekanın davranışını manipüle ederek kötü amaçlı verilerle besledi. Bu durum, yapay zeka dünyasında önemli bir dönüm noktasıdır.

Modeli sadece on adet zehirli materyal örneğiyle eğitmek yeterli oldu; model daha sonra uzaktan kod yürütme (remote code execution) özelliğine sahip yeni kodlar üretmeye başladı. Bu, saldırganların bir kullanıcının makinesinde kötü amaçlı kod çalıştırmasına olanak tanıyan kritik bir güvenlik açığıdır.

Paxton-Fear, sosyal medyada zaferle şu mesajı paylaştı: “Tam teşekküllü bir arka kapı (backdoor) oluşturmayı başardım.”

Arka kapılar, yapay zekanın eğitim sürecine gizli ifadeler yerleştiren ve saldırganların modeli belirli eylemleri gerçekleştirmesi için tetikleyebilen tehlikeli saldırı türleridir. Geçen yıl, Anthropic, Birleşik Krallık Yapay Zeka Güvenliği Enstitüsü ve Alan Turing Enstitüsü ile ortaklaşa yapılan bir araştırmada, hem küçük hem de büyük yapay zeka modellerinin sadece birkaç yüz belge kullanılarak gerçekleştirilen bu tür saldırılara karşı savunmasız olduğu gösterildi. Bu durum, bu tür saldırıların hala düşük maliyetli olabileceğini düşündürmektedir.

Bu bulgular, özellikle ChatGPT ve Claude gibi sohbet robotlarını çalıştıran kapalı kaynaklı modellere kıyasla daha fazla kontrol ve şeffaflık sağladığı için övülen açık ağırlıklı (open-weight) modellere olan heyecan üzerinde bazı soğuk sular dökecektir. Ayrıca, bu modellerin kullanım maliyetinin de daha düşük olması beklenmektedir. Ancak, parametreleri görünür olsa da, açık ağırlıklı modeller eğitim verilerini veya kodlarını açıklamamakta; bu nedenle güvenlik araştırmacıları için hala “kara kutu” olabilirler.

Semgrep’teki meslektaşları, geçen hafta yayınladıkları bir yazıda şunları belirtti: “Model ağırlıkları kamuya açık olsa bile (‘açık ağırlık’), davranışını tahmin etme konusunda neredeyse hiç yeteneğimiz yok. Bu, önemli bir değişiklik: tipik bir bilgisayar programı, ikili formda bulunsa bile, tersine mühendislik araçlarıyla analiz edilerek davranışının tamamıyla anlaşılması mümkündür. Modellerde ise bu yeteneğe sahip değiliz.”

Dahası, bu durum siber güvenlik alanında henüz çok keşfedilmemiş bir bölgeye işaret ediyor. Büyük dil modelleri (LLM’ler) son derece karmaşık ve hala yeni teknolojilerdir; bu nedenle sofistike saldırıları tespit etmek zordur. Ayrıca, yapay zeka modelleri yazılımdan çok daha incelikli şekillerde tehlikeye atılabilir.

Semgrep araştırmacıları şunlara dikkat çekti: “Yazılım bağımlılıklarında kötü amaçlı kod bulunması durumunda, bunu tespit etme, kökenini izleme ve etkisini azaltma konusunda olgun uygulamalara sahibiz. Yapay zeka modelleri farklıdır. Tehlikeli veya incelikli bir şekilde manipüle edilmiş bir model ‘bozulmak’ zorunda değildir; iş süreçlerinde fark edilmesi zor olan kararları etkilemek yeterlidir.”

“Peki, çevrimiçi olarak ince ayar yapılmış ve yapay zeka maliyetlerimizi azaltmanın çözümü olarak pazarlanan açık ağırlıklı modellere güvenebilir miyiz?” diye sordu Paxton-Fear, bulgularını paylaştığı bir dizi paylaşımında. “Muhtemelen, sadece ölçütlere ve ‘güvenli kod yazmayın’ uyarısına dayanarak yeterli olmayacaktır.”

Yapay Zeka Hakkında Daha Fazla: Yapay Zeka Balonları Korkusu, TSMC ve NVIDIA’nın Kazançlarına Yansımaya Başlıyor

Kaynak: Futurism

Paylaş