Yapay zekanın güvenliğine yönelik çalışmalar, beklenmedik sorunlara yol açabiliyor. Yapay zeka metinlerinin kaynağını tespit etmeye yarayan teknolojiler, aynı zamanda bu metinlerin doğruluğunu kontrol eden sistemleri zayıflatıyor. Filigranlama, yapay zeka tarafından üretilen metinlere gizli bir imza ekleyerek şeffaflığı artırmayı amaçlıyor (Avrupa Birliği’nin Yapay Zeka Yasası Madde 50 [1]; Çin’in Siber Uzay İdaresi’nin yapay zeka etiketleme yönetmeliği [2]). Ayrıca, halüsinasyon tespit mekanizmaları, modelin uydurduğu kısımları belirlemeye çalışıyor. Bu, model çıktılarını ne kadar güvenilir olduğunu kontrol etmek için kullanılıyor. Düzenleyiciler her iki yöntemi de teşvik ediyor. Ancak, yapay zeka modellerinin şeffaflığı ve sorumluluğu arasında gizli bir çatışma bulunuyor. Bu çatışma, modelin iç yapısında gizli olmasına rağmen, yapay zeka sistemlerinin güvenliği üzerinde gerçek sonuçlar doğurabiliyor.
Filigranlama Nasıl Çalışır?
Bir dil modeli (LLM), cümleler yazmaz. Her adımda, bir sonraki kelime için olasılık dağılımını hesaplar. Bazen bu dağılım keskin olur. Örneğin, “Fransa’nın başkenti” ifadesinden sonra, “Paris” kelimesi neredeyse tüm olasılık kütlesini taşır ve gerçekte bir seçim yapmak gerekmez. Bazen ise bu dağılım düzdür. Örneğin, “Partiden ayrılırken nedeni” ifadesinden sonra, birçok farklı devam seçeneği eşit derecede olasıdır ve model rastgele bir seçim yapar. Bu düzleşme durumunun teknik adı “entropi” veya daha spesifik olarak “anlamsal entropi”dir [1]. Yüksek entropi, modelin birçok benzer seçenek arasında seçim yaptığını gösterir. Düşük entropi ise, bir sonraki kelimenin neredeyse zorunlu olduğunu gösterir. Bu ayrımı akılda tutmak önemlidir, çünkü bu hikayedeki her iki teknoloji de yüksek entropili noktalarda çalışır.

Bir filigran, gizli bir anahtar kullanarak kelime seçimlerini etkiler. En bilinen filigrana yöntem, 2023 yılında Kirchenbauer ve ekibi tarafından geliştirilen yaklaşımdır [4]. Bu yöntemde, her adımda kelime dağarcığı rastgele “yeşil” ve “kırmızı” listelere bölünür (bu listeler anahtar ve önceki bağlamdan türetilir) ve ardından yeşil kelimelere küçük bir bonus eklenir (Bkz. Şekil 1). Metin hala doğal görünür, ancak rastgele oluşacak sayıdan daha fazla yeşil kelime içerir. Anahtarı elinde bulunduran bir tespit cihazı, listeleri yeniden oluşturur, yeşil kelime sayısını hesaplar ve bu sayının rastgele metinde ne kadar olası olduğunu belirler.
Google DeepMind’ın SynthID-Text [5], tüm Gemini ailesi modellerinde kullanılan bu fikri, “turnuva örneklemesi” adı verilen bir mekanizma ile geliştirir (model birkaç aday kelime oluşturur ve gizli anahtar, bunlar arasında elenme usulü bir yarışma düzenler; kazanan yazılır). Bu yöntem, Hugging Face Transformers kütüphanesinde açık kaynaklı olarak sunulmuştur.
Üçüncü bir yaklaşım ise, Aaronson’un “Gumbel hilesi”nden ilham alan ve ortalama olarak çıktı dağılımını değiştirmeyen (ancak metnin anahtarla ilişkili kalmasını sağlayan) yöntemlerdir [6].

Bir filigran, yalnızca kelime seçimi yapma imkanı olan noktalarda etki gösterebilir. Düşük entropili bir noktada, seçim yönünde bir baskı yapmak, yanlış bir kelime yazmak anlamına gelir ve bu durum metnin kalitesini düşürür. Örneğin, bir fatura özetinde “Toplam tutar 4.320 dolardır” cümlesinden sonra, her şey “dır” kelimesinden sonra sınırlıdır. Sadece doğru bir devam seçeneği vardır ve başka bir sayıya yönlendiren bir filigran, bir imza gizlemez, belgeyi bozar. Şimdi de “Ödeme hemen yapıldı” cümlesini ele alalım. Model “hızlıca”, “çabucak” veya “derhal” kelimelerinden herhangi birini yazabilirdi ve okuyucu hangi kelimenin seçileceğini asla bilemezdi. İşte filigranın bulunduğu yer burasıdır. Filigrana, önemli bir fark yaratmayan seçimlerin olduğu noktalarda etki eder. Bir imza yalnızca hiçbir fark yaratmayan seçimler arasında gizlenebilir ve bu nedenle görünmezdir ve aynı zamanda önemli olan seçimlerde var olamaz. Bu nedenle her şema, sadece görünüşte bir değişiklik yapmadığı için etkili olan yüksek entropili noktalara odaklanır. Bu imza istatistikseldir ve ortalama değerlere dayanır. Tespit, “yeterli metin” olduğunda güvenilirdir, bu da her çıktı için bir sertifika anlamına gelmez.
Şu anda Google, tüm Gemini ailesi modellerini işaretlemektedir. OpenAI bir yöntem geliştirmiş ancak uygulamamıştır. Anthropic, Claude ailesi modellerine filigrana ekleyeceğini duyurmuştur. Açık kaynaklı modeller, kodlama işlemini kullanıcının elinde bırakır, bu nedenle kullanıcı tercih ederse metin işaretsiz olur.

Halüsinasyon Tespit Mekanizmaları Nasıl Çalışır?
Bir halüsinasyon, akıcı bir ifade olmasına rağmen yanlış olan bir ifadedir: uydurulmuş bir istatistik, sahte bir kaynakça veya hiçbir belgede bulunmayan bir sayı. Mevcut tespit mekanizmaları iki ana kategoriye ayrılabilir.
Kaynak Tabanlı Tespitler: Bu yöntemler, cevabı güvenilir bir kaynağa göre kontrol eder ve her iddianın desteklenip desteklenmediğini sorar. “Token-support” modelleri (örneğin LettuceDetect), cümlenin hangi kısımlarının kaynakta desteklenmediğini belirler. “Entailment” modelleri (örneğin MiniCheck), kaynağın iddiayı mantıksal olarak destekleyip desteklemediğini sorar. LLM tabanlı yargıçlar da aynı şeyi, yönlendirilmiş bir model kullanarak yapar. Bu yaklaşımların ortak noktası, girdi olarak yalnızca çıktı metnini ve kanıtı kullanmasıdır.

Belirsizlik Tabanlı Tespitler: Bu yöntemler, davranışsal bir özelliği kullanır: Bir model, doğru cevabı ürettiğinde bunu tutarlı bir şekilde üretir, ancak tahmin yaparken farklılık gösterir. “Semantic entropy” [1], bu prensibi kullanarak birkaç cevap üretilir, anlamca gruplandırılır ve kümeler arasındaki entropi ölçülür. “SelfCheckGPT” ve “logprob-calibration” yöntemleri de aynı fikrin varyasyonlarıdır. Bu ailedeki tespitlerde de ortak nokta, modelin belirsizliğinin (tekrar eden örneklerden veya doğrudan olasılıklardan elde edilen) girdi olarak kullanılmasıdır.

Bir filigrana, yalnızca kelime seçimi yapma imkanı olan noktalarda etki gösterir. Belirsizlik tabanlı tespitler ise, bu noktalardaki tereddütleri bir “işaret” olarak yorumlar. Filigrana, her denemede aynı gizli anahtar kullanıldığından, modelin tahmin yapmadığı için aynı cevabı üretmesi sağlanır. Bu durum, modelin gerçekten bilgi sahibi olmadığı halde sadece rastgele seçimler yaptığı durumlarda ortaya çıkar. Tespit mekanizması ise, bu türden tutarlı cevapların, modelin doğru bilgiye sahip olduğunu gösterdiğini varsayar. Ancak, filigrana uygulandığında, bu varsayım geçerliliğini yitirir.
Sonuç olarak, filigrana uygulanmış metinlerde, halüsinasyon tespit mekanizmaları, anlaşmanın oranını olduğundan yüksek tahmin eder ve belirsizliği olduğundan düşük gösterir. Bu durum, yapay zeka sistemlerinin güvenilirliği konusunda yanıltıcı sonuçlara yol açabilir.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.
Bir yanıt yazın