Üç yıl önce The New York Times’ın OpenAI ve Microsoft‘a açtığı telif hakkı davasında bugün deşifre edilen yeni, sansürsüz belgeler; AI şirketlerinin eğitim amaçlı veri kazımasını “soygun” olarak tanımladığını ve yapay zeka ürünlerinin yayın kuruluşları için varoluşsal bir tehdit oluşturduğunu ortaya koyuyor. Microsoft üst düzey bir yöneticisinin bu pratikleri özel ortamda “soygun” olarak adlandırdığı, OpenAI’nin kendi yönetim kurulu üyelerinin ise modellerinin editörler ve gazeteciler açısından “varoluşsal tehdit” teşkil ettiği belirtiliyor. Davaya konu olan belgeler, şirketlerin pay duvarlarını tespit edilmeden aşarak içeriğe ulaştığı, kitlevi kazıma yoluyla eğitim veri setleri oluşturduğu ve telif hakkı bildirimlerini bilinçli olarak sildiği detaylarını içeriyor.
Bu yeni bilgiler büyük ölçüde The Times’ın kendi savunusundan geliyor; asıl deliller hâlâ mühürlü. Belgede aktarılan alıntılar, orijinal bağlamlarından ayrılarak sunuluyor. Deşifre edilen bu belge, şirketlerin üretken yapay zeka modellerini eğitirken telif hakkı ihlali yaptığını iddia eden başlangıç davasının son yükselişi sayılıyor.
Telif Hakkı ve “Adil Kullanım” Kavramının Belirsizliği
AI şirketlerinin telif haklı materyalleri yapay zekayı eğitmek için yasal olarak kullanıp kullanamayacağı konusunda net bir cevap yok; ancak hakimler, eğitimin “adil kullanım” oluşturduğu yönündeki şirket argümanlarına büyük ölçüde yakınlaşıyor. Bu hukuki kural, alıntı, haber raporu veya eleştiri gibi belirli durumlarda telif haklı eserin izin alınmadan kullanılmasına olanak tanıyor. Bu ayın başlarında Trump yönetimi de OpenAI’nin telif haklı materyalleri lisansız kullanarak dil modellerini eğitmesini savunan bir savunu sunmuştu.
Ancak yeni açıklamaların çoğu, özellikle “adil kullanım” testinin orijinal eserin pazarını zedelememe ya da yerini almama şartı, OpenAI’nin bu savunusuyla çelişiyor. Microsoft belgesinde, “Ürünün temel tedarikçilerinin ekonomik temellerini tehdit etmesi son derece olağandışıdır; ancak LLM işimiz için ‘içecek zinciri’ açısından yarattığımız durum tam da budur” ifadesi yer alıyor.
Yemin Altındaki Tanıklıklar ve İç İletişim Kayıtları
Microsoft CEO’su Satya Nadella, bu yıl bir duruşmada “Pay duvarıyla korunan her şeyi kullanmak isteyen herkes tarafından lisanslanması gerekir… Bu amaçla temellendirme veya eğitim için” dedi ve OpenAI’nin pay duvarının ardındaki bilgiyi kazıyıp eğittiğini bilseydi modellerini yeniden eğitmesini isteme hakkını kullanacağını açıkça belirtti.
“Pay duwarıyla korunan her şeyi kullanmak isteyen herkes tarafından lisanslanması gerekir… Bu amaçla temellendirme veya eğitim için. OpenAI’nin pay duvarının ardındaki bilgiyi kazıyıp eğittiğini bilseydim, modellerinin yeniden eğitilmesini talep etme hakkımı devreye sokardım.”
Microsoft CEO’su Satya Nadella
Açıklamaların bazıları adil kullanım testinin farklı dayanaklarıyla da çelişıyor. OpenAI’nin ChatGPT sorumlusu Nick Turley, iç iletişimde yayın kuruluşlarının sohbet botu gibi ürünlerin oluşturduğu “varoluşsal tehdit”ten bahsetmiş; bu ürünlerin büyük ölçüde yerini aldığını ve iyileştikçe giderek daha fazla yerini alacağını belirtmişti.
Kazıma Ölçeği ve Pay Duvarlarını Aşma Planları
OpenAI Başkanı Greg Brockman, modelleri “haber konusunda mükemmel” olarak tanımlarken; Nadella bu yıl yemin altında sohbet botlarıyla konuşmanın, kullanıcının doğrudan web sitesinde veya AI platformunda bilgi almasına yol açarak alt kaynaklara gitme ihtiyacını ortadan kaldırdığını kabul etmişti. Bu tür ifadeler, teknolojinin orijinal eseri dönüştürmek yerine doğrudan onunla rekabet edebileceğine işaret ediyor.

Microsoft belgesi, üretken yapay zekanın modelinin eğitildiği verileri üreten insanların istihdamını “ciddi şekilde” bozabileceğine dair “gerçek bir risk” bulunduğunu belirtiyor. Kopyalamanın ölçeği dikkat çekici: Belgeler, OpenAI’nin orta eğitim veri setlerinin yalnızca The New York Times, Daily News ve Center for Investigative Reporting tarafından yayınlanan 91.692’den fazla kopyasını ilk kez ortaya koyuyor. Common Crawl kaynaklı bir veri seti ise yalnızca nytimes.com adresinden 2 milyondan fazla belge içeriyor.
Ocak 2023’teki iç yazışmada Hecht bunu “olağanüstü boyutlarda bir soygun” ve “insan tarihinde en büyük emek soygunu” olarak nitelendirmişti. Belge, OpenAI ve Microsoft’un davacıların içeriğini Bing Index’den kazıyarak edinme biçimlerini yeni detaylarla açıklıyor.
“OpenAI, tüm GPT-3 eğitim veri setini Microsoft’a teslim etti; Microsoft bunu kendi ticari ürünlerinde OpenAI’nin modellerinin nasıl hayata geçirileceğini değerlendirmek için kullandı. Microsoft da Project Taxi ve Project Mango adı altındaki girişimler aracılığıyla benzer şekilde OpenAI’ya eğitim verisi sağladı.”
Dava belgeleri
Şirketlerin, Project Mango verisini en az 160.903 benzersiz eseri içeren bir eğitim veri setinde topladığı iddia ediliyor. Kazımadan en iyi şekilde yararlanmak için OpenAI çalışanlarının pay duvarlarını tespit edilmeden aşma planları geliştirdiği belirtiliyor. Belgeler, OpenAI araştırmıcısı Nick Ryder’ın Brockman’e “nytimes pay duvarını atlatma hilesini” anlattığında Brockman’in “ay güzel” diye yanıt verdiğini gösteriyor.
OpenAI çalışanlarının ayrıca WebText ve WebText2 gibi eğitim veri setleri oluştururken kazılan haber içeriğine orantılı olarak fazla güvendiği iddia ediliyor. Aynı zamanda ücretsiz ve açık bir web tarama arşivi olan Common Crawl’dan milyonlarca makale çekildigi belirtiliyor. Bulgular, araştırmıcıların “modelin kullanıcıya telif hakkı bildirimini çıkarmasını istemeyeceğini” düşünerek bu bildirimlerin veri modele ulaşmadan önce bilinçli olarak silindiğini de anlatıyor.
OpenAI ve Microsoft yorum taleplerine yanıt vermedi.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.





Söz sizde.
Deneyiminizi, sorularınızı ve katkılarınızı paylaşın. E-posta adresiniz yayımlanmaz.