Yeni nesil bir karar verme yapay zekâsı olan Jev, bir haftadan daha az sürede Nintendo’nun klasik oyunu Pokémon Kırmızı’nda şampiyon olma başarısı gösterdi. Geleneksel sohbet botlarının aylarca takla attığı bu görevi tamamlayan Jev, aslında bir sohbet botu ya da büyük dil modeli değil; oyunun sunmuş olduğu seçenekler listesindeki verileri değerlendirerek olasılığa dayalı en doğru kararı veren bir karar motorudur. Oyunun içinden geçen bu başarıyı ise modelin kendi başına çözemediği yerlerde ona dolaylı biçimde yol gösteren, oyun günlüğünü izleyen klasik bir büyük dil modeli olan Claude Opus 5 destekledi.
Jev, çözümleri bir güven oranıyla birlikte döndüren, ekranı okumadan ve metin ya da görsel üretmeden çalışan bir sistemdir. Oyun bağlamında Jev, oyuncuya sunulan seçeneklerle birlikte hangi eylemin daha mantıklı olduğunu belirten verilerle karşı karşıya kalır ve olasılıksal olarak en uygun yolu seçer. Bu yaklaşım, ekran görüntüsünü analiz eden ya da metin üreten bir yapay zekâdan farklıdır; çünkü Jev doğrudan ekrandan okuma yapmaz, yalnızca ona verilen seçenekler üzerinden hareket eder. Bu nedenle sistemin başarısı, tek başına bir modelin yeteneğinden ziyade ona eşlik eden unsurların katkısıyla şekillenmiştir.
İnsan, Model ve İzleyicilerin Ortak Emeği
Geliştiricinin kullandığı sistemin güncelleme günlüğü 474 giriş içeriyor ve bunların çoğu oyun günlüğünden gelen bir başarısızlıkla, buna yanıt olarak yapılan değişikliğin birleşiminden oluşuyor. Jev’nin sıkıştığı anlarda yapılan denemeler arasında, Lorelei’nin kapalı girişine 53 kez girilmesi, on dakikanın içinde tek bir Kayma Tüneli merdivenini 124 kez geçilmesi ve Üst Dörtlü antrenörlerinin hepsini yenmenin ardından Şampiyonun Alakazam’ına yenilip, daha sonra Şampiyon’u devirmek için bu dört antrenörü tekrar yenmek zorunda kalması örnek gösteriliyor. Opus, hem doğruluk hem de maliyet açısından düzenlemeler yaptı. TypeSafe’in model üzerine notlarına dayanarak, Jev’ye gönderilen metni yaklaşık üçte bir oranında azalttı ve sayı yerine sözcükler kullandı. Jev bir döngüye takıldığında, sistemin karar talebini saniyede yaklaşık bir kez yerine her altı saniyede bir yapacak şekilde ayarlandı. İnsan katkısı da söz konusu: İzleyiciler sohbet üzerinden ipuçları gönderdi ve faydalı olanlar Jev’nin seçenek listesi için geliştirildi. Opus’a, geliştiriciye ve izleyici kitlesine duyulan bu bağımlılık, karar modelinin güçlü ve zayıf yönlerini açıkça ortaya koyuyor.
İkinci Denemede Başka Bir Yaklaşım
Jev tabanlı ikinci bir denemeyi Frigade’de çalışan Christian Mathiesen gerçekleştirdi. O denemede kullanılan sistemin okuma dosyasına göre, sistem “oyunun hafızasını okur, yasal seçenekleri listeler … ve Jev bunlardan birini seçer” ancak oyun hafızasına asla yazma yapmaz. Mathiesen, Jev’nin butonları doğrudan seçebildiği ilk versiyonunda, sistemin “Pallet Kasabası’ndan hiç çıkmadığını” söyledi. Maliyeti, kendi tahminine göre 24 saat başına yaklaşık 1 ila 1,70 dolar arasında, yani güncel kurla 24 saat başına yaklaşık 48,88 ila 83,10 Türk lirası arasında.
Frigade’de çalışan Christian Mathiesen, Jev’nin butonları doğrudan seçebildiği ilk versiyonunda sistemin “Pallet Kasabası’ndan hiç çıkmadığını” söyledi.
Christian Mathiesen, Frigade ![]()
Bu yaklaşım, Jev’nin kullandığı yöntemden farklı bir stratejiyi yansıtıyor: Mathiesen’in versiyonu oyunu doğrudan oynamak yerine, yasal hamleleri sunan bir çerçeve kuruyor ve kararı Jev’ye bırakıyor. Böylece tek bir motorun yeteneğine değil, sistemin tasarımıyla modelin seçimi arasındaki iş bölümüne vurgu yapılıyor.
Başka Bir Yol: Ekran Görüntüsünden Öğrenen Model
Jev’nin dışında Pokémon Kırmızı üzerine farklı bir deney de yapıldı. stmonty adıyla bilinen bir geliştirici, RTX 3080 Ti ekran kartında 42.000’den fazla oyun karesiyle eğitilen küçük bir dünya modelini geliştirdi. Profesör Oak laboratuvarındaki bir kayıttan yola çıkan model, stmonty’nin blog yazısına göre 100 denemenin 52’sinde bir başlangıç Pokémon’u seçti. Jev’ye kıyasla hem hedef hem de yardım çok daha küçükdi: stmonty’nin modeli, yalnızca ekran görüntülerinden her girişin ne yaptığını öğrenmek zorundaydı. Bu denemede de insan ya da büyük dil modeli desteği söz konusu değil; model, yalnızca görsel ipuçlarıyla kendi kendine öğrenme yolunu izliyor.
Jev’nin virüs gibi yayılması, LangChain’in 15 Eylül’deki çıkışından bu yana “güçlü bir yankı uyandırdığını” belirttiği gibi, on gün içinde birden fazla geliştiricinin oyunu oynamasına yol açtı. Bu denemenin başarısı, uzmanlaşmış modellerle işbirliğinin problem çözme yeteneğini anlamlı bir biçimde artırabildiğini gösteriyor. TypeSafe’in kendisi de açık uçlu görevlerin büyük dil modellerine daha uygun olduğunu söylüyor, bu da Jev’nin çıktığı günden beri aktardığımız bir noktaydı. Karşılaştırma açısından, o sırada Opus 4.5’i çalıştıran Anthropic’in akışı, Ocak ayında bile Pokémon Kırmızı’yı tamamlamamıştı. Bu kez Jev’nin oynamasını ve Claude’nin kuralları yazmasını üstlendiğinde, geliştirici zaferi elde etti.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.





Söz sizde.
Deneyiminizi, sorularınızı ve katkılarınızı paylaşın. E-posta adresiniz yayımlanmaz.