Mozilla, 15 Eylül’de yayımladığı yeni raporunda, Çin’in en güçlü açık ağırlıklı yapay zeka modellerinin ABD‘nin en ileri sunumlarına yaklaşarak aradaki performansa ve maliyet farkını hızla kapattığını ortaya koydu. Mozilla, sunumları 1 Eylül’e kadar olan verilere dayandıran bu değerlendirmesinde, en iyi açık modelin Artificial Analysis Zeka Endeksi’nde kapalı liderden üç puan geride, fiyatı ise liderin %60’ında kaldığını; aynı zamanda Claude Fable 5’ten iki puan geride, fiyatı %30’da olduğunu belirtti. Mozilla’nın METR görev-horizon verilerine dayandırdığı tahmini, açık ve kapalı modeller arasındaki farkı yaklaşık 4,4 aya indiriyor ve Epoch AI’nın dört aylık tahminini destekliyor.
Açık modelin yükselişi
Mozilla, Firefox web tarayıcısının arkasındaki kâr amacı gütmeyen kuruluş ve bu raporu ilk kez kendi blogunda yayımladığı düzenli bir değerlendirmenin sahibi. Rapor, yaklaşık 1.400 geliştiricinin Mozilla/SlashData anketi, OpenRouter trafik verileri ve üçüncü taraf benchmark endeksleri üzerine kurulmuş. Mozilla, açık modellerı destekleyen bir kuruluş olarak, 14 Temmuz’da raporun kısmen bir savunma niteliği taşıdığını açıklayan baş teknoloji sorumlusu Raffi Krikorian, bu yaklaşımı öne sürdü. Bu bağlamda “açık ağırlık” ifadesi, eğitim verisi veya kod yerine indirilebilir ağırlıkları ifade ediyor. Rapor 16 dikkate değer açık sürümü sayıyor, ancak hiçbiri Open Source Initiative’in tanımına göre gerekli veri tarifini sunmıyor.
Open ağırlıkların indirilebilir olması, eğitim verisi veya kodun indirilebilir olması anlamına gelmiyor.
Raffi Krikorian, Mozilla baş teknoloji sorumlusu
Performans ve maliyet dengesi
Dört aylık fark, METR adı verilen araştırma kuruluşunun, modelleri tamamladıkları görevin insan çalışma süresinin yarısında ne kadar sürede tamamlayabildiklerine göre puanladığı bir ölçüme dayanıyor. Mozilla’nın tahminine göre kapalı modeller, insan uzmanlarının 8 ila 12 saatini alan görevleri hallederken, açık modeller bu seviyeye yaklaşık dört ay sonra ulaşıyor. Mozilla’nın hesaplamasına göre açık kapasite her 3,9 ayda bir, kapalı modellerde ise her 5,5 ayda bir ikiye katlanıyor. Mozilla ayrıca vals.ai’nin Terminal-Bench 2.1 sonuçlarını da çizdi; bu platformda her modeli aynı donanım katmanından geçiriyor. Bu tabloda Z.ai’nin GLM-5.2’si, Claude Opus 4.7’den bir puan içinde, Opus 4.8’den ise yaklaşık dört puan geride, test başına maliyeti liderin beşte birinden azıyla öne çıktı.
OpenRouter, geliştirici trafiğini yüzlerce modele yönlendiren bir pazar yeri olarak, Mozilla’nın Ağustos token hacmine göre en iyi on modelden sekizini açık ağırlık olarak sayması dikkat çekici. Bunların yedi tanesi Çin menşeli. Buna rağmen kapalı sağlayıcılar, Mayıs-Eylül 2025 döneminde OpenRouter’daki model katmanı gelirinin %96’sını elde etti.
Kapalı modeller için ödeme kararı, organizasyonun bir tercihi değil, iş yükünün kendisine özgü bir seçim olarak görüyoruz.
Raffi Krikorian, Mozilla baş teknoloji sorumlusu
Ölçümün sınırları
Raporun kendi donanım grafiğinde, tek bir sunucuya sığan en iyi açık model 52,6, tek bir GPU’ya sığan en iyi model ise 40 puanda. Tepeden düşüş sırasıyla 10 ve 23 puan ve bu fark, raporlanan dört aydan daha büyük. Kimi K3’nün yerel MXFP4 denetimi, 96 parçaya yayılan yaklaşık 1,56 TB veri üzerinde çalışırken, Mozilla’nın sunum yapılandırması 64 veya daha fazla hızlandırıcıyı listeliyor. Üretim trafiği için en az sekiz GB300 GPU gerekiyor. Rapor bunu çoğu sahip olanın çalıştıramayacağı açık olarak tanımlıyor. İstisna örneklerinden biri, Apache 2.0 lisanslı Thinking Machines’in Inkling-Small modeli; NVFP4 sürümü tek bir B300’te 180 GB tabanla sığıyor.
Raporun verileri 1 Eylül’de duruyor. Bu tarihten sonra Artificial Analysis, endeksini farklı bir değerlendirme setiyle v4.3’e taşıdı. Canlı tabloda en üstte, en yüksek çaba ayarında Claude Fable 5.1 53, Kimi K3 ise 44 puanda. Eylül 11’de güncellenen vals.ai Terminal-Bench 2.1 tablosunda ise liderlik GPT-6 Astra’nın %87,27’sinde, Fable 5.1 %85,02 ile geride. Mozilla’nın kendi grafik açıklaması “fark her sürüm döngüsünde sıfırlanıyor” şeklinde.
K3 ayrıca, distilasyon yoluyla K3’nün Claude Fable 5 verisini çıkardığı iddiasını taşıyor. Bu, bir modelin başka bir modelin çıktılarını eğitme pratiği. Mozilla’nın raporu bu iddiayı “ileri sürüldü, gösterilmedi” olarak nitelendiriyor.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.
[…] Çekebilir: a good Turkish → Kaynak: TechCrunch ↗ 🚀 SayarBilgi […]