AI’nın bir gün insanlığı yok edebileceğine dair konuşmalar arasında, teknolojinin zaten bazı insanlar için can alıcı tehdit oluşturduğu unutuluyor; bu tehlike biyolojik silahlar yoluyla değil, psikolojik zarar yoluyla ortaya çıkıyor. Circuit Breaker Labs kurucuları Shirali ve Arul Nigam kardeşler, genç kullanıcıların intiharına yol açan yapay zeka etkileşimlerini önlemeyi hedefliyor. Şirket, TechCrunch’ın 2026 Startup Battlefield 200 finalistlerinden biri olarak, modelin tehlikeli psikolojik etkileşimleri algılama yeteneğini test eden ajanlar geliştiriyor.
Kurucuların ilham kaynağı, 14 yaşındaki Sewell Setzer oldu; genç bir kullanıcı Character.ai sohbet botuna duygusal bağ kurmuş, kendine zarar verme düşüncelerini dile getirmiş ve ardından intihar etmişti. Sohbet botunun bu süreçte genci teşvik ettiği iddia edildi. Arul Nigam, Circuit Breaker Labs’ın CTO’su olarak, botun “seninle olmak istiyorum” gibi ifadelerin gerçekte ne anlama geldiğini tam olarak anlayamayabileceğini vurguladı.
Yapay zeka güvenliğinin dili ve kültür sınırı yok
Circuit Breaker Labs’ın misyonu, yapay zekayı diller ve kültürler boyunca daha güvenli hale getirmek. Şirket, kendini çarpışma testi kuklalarından oluşan bir orduya benzetiyor; bu ajanlar her yaşanmaktan, arka plandan, dilen ve kültürden insanları taklit ederek modellerin tehlikeli ve psikolojik açıdan zararlı etkileşimleri algılama yeteneğini sınıyor.
“Altı yaşındaki bir kız ile 45 yaşındaki bir erkeğin, ilk dili İngilizce olan biriyle ikinci dilinde konuşan biri arasındaki farkın ya da oyuncu jargonuyla konuşan biriyle farklı bir argo kullanan biri arasındaki farkın modeli gerçekten zorlayabileceğini” belirten CEO Shirali Nigam, “Modeller standart konuşma kalıplarını yönetmede çok başarılı ancak kimse böyle konuşmuyor; bu yüzden model anlamayı veya argoyu yanlış anladığında işler ciddi biçimde bozulabiliyor” dedi.
“Çok sayıda kişi, özellikle gençler, destek için bu sistemlere yöneliyor ve genellikle gerçekten ihtiyaçları olan yardımı almıyorlar. Ancak birçok durumda açıkça zarar görüyorlar ve ne yazık ki insanlar intihar etti. İnsanların sistemi kırmayı amaçlamadığı, doğal bir şekilde etkileşime girdiği; sistemin ise bağlam kirliliğine uğradığı veya nüansı anlamadığı ve ardından gerçekten tehlikeli bir adım attığı bu tür güvenlik açıklarını önlemeye çalışıyoruz.”
Arul Nigam, Circuit Breaker Labs CTO’su
Kırmızı takım testi ve günlük milyonlar etkileşim
Şirket, son derece gerçekçi kullanıcı simülasyonları oluşturmak için insan alan uzmanlarıyla çalışarak modeller üzerinde “kırmız takım” (red-team) testleri yürütüyor; bu saldırı testleri zayıf yönleri ortaya çıkarmayı amaçlıyor. Testler, gerçek insan konuşma kalıplarını, argoyu, kodlanmış dili ve yazım hatalarını yansıtacak biçimde tasarlanıyor. Circuit Breaker Labs günde on binlerden milyonlara kadar simüle etkileşim çalıştırıyor.

Amaç, bir modelin zamanla ve çok sayıda konuşma içinde ortaya çıkabilecek riskli etkileşimlere uygun şekilde yanıt verebilmesini sağlamak. Şirket, denetlenebilir ve açıklanabilir skorlar üretmek için özel bir puanlama yöntemi kullanıyor.
Güven inşa etmek, yasaklamaya karşı bir çözüm
Sonuçta bu test platformunun, insanın sohbet botuyla parasosial bir ilişki geliştirme riski taşıdığı her uygulamaya uygulanması hedefleniyor; buna yanıtları etkileşimden etkileşime değişebilen yapay zeka “iş arkadaşı” ajanları da örnek gösteriliyor.
“İnsanlar yapay zekaya karşı giderek daha şüheciliğe ya da genel olarak benimsemeye karşı dirençli hale geliyor. Şüphecinin sağlıklı olduğunu düşünüyorum, ancak güvenlik endişeleri nedeniyle potansiyel değeri olan bir aracın yasaklanması geriye doğru bir adım olur.”
Arul Nigam, Circuit Breaker Labs CTO’su
Circuit Breaker Labs, bu kaygıların cevabının yapay zekayı daha güvenli hale getirmek olduğunu savunuyor. Şirket, “İnsanlar için bu güveni inşa etmeye yardımcı olmak istiyoruz” ifadesiyle misyonunu özetliyor.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.





Söz sizde.
Deneyiminizi, sorularınızı ve katkılarınızı paylaşın. E-posta adresiniz yayımlanmaz.