Ana sayfa→Yapay Zeka
Yapay Zeka

Jev Yapay Zekâsı Pokémon Kırmızı’nda Şampiyon Oldu: LLM’lerin Takla Attığı Oyunu, LLM Olmayan Motor Bir Haftadan Daha Az Sürede.

Yeni nesil bir karar verme yapay zekâsı olan Jev, bir haftadan daha az sürede Nintendo'nun klasik oyunu Pokémon Kırmızı'nda şampiyon olma başarısı...

Sayarbilgi Teknoloji ServisiEditör
4 dk okuma

Yeni nesil bir karar verme yapay zekâsı olan Jev, bir haftadan daha az sürede Nintendo’nun klasik oyunu Pokémon Kırmızı’nda şampiyon olma başarısı gösterdi. Geleneksel sohbet botlarının aylarca takla attığı bu görevi tamamlayan Jev, aslında bir sohbet botu ya da büyük dil modeli değil; oyunun sunmuş olduğu seçenekler listesindeki verileri değerlendirerek olasılığa dayalı en doğru kararı veren bir karar motorudur. Oyunun içinden geçen bu başarıyı ise modelin kendi başına çözemediği yerlerde ona dolaylı biçimde yol gösteren, oyun günlüğünü izleyen klasik bir büyük dil modeli olan Claude Opus 5 destekledi.

Jev, çözümleri bir güven oranıyla birlikte döndüren, ekranı okumadan ve metin ya da görsel üretmeden çalışan bir sistemdir. Oyun bağlamında Jev, oyuncuya sunulan seçeneklerle birlikte hangi eylemin daha mantıklı olduğunu belirten verilerle karşı karşıya kalır ve olasılıksal olarak en uygun yolu seçer. Bu yaklaşım, ekran görüntüsünü analiz eden ya da metin üreten bir yapay zekâdan farklıdır; çünkü Jev doğrudan ekrandan okuma yapmaz, yalnızca ona verilen seçenekler üzerinden hareket eder. Bu nedenle sistemin başarısı, tek başına bir modelin yeteneğinden ziyade ona eşlik eden unsurların katkısıyla şekillenmiştir.

İnsan, Model ve İzleyicilerin Ortak Emeği

Geliştiricinin kullandığı sistemin güncelleme günlüğü 474 giriş içeriyor ve bunların çoğu oyun günlüğünden gelen bir başarısızlıkla, buna yanıt olarak yapılan değişikliğin birleşiminden oluşuyor. Jev’nin sıkıştığı anlarda yapılan denemeler arasında, Lorelei’nin kapalı girişine 53 kez girilmesi, on dakikanın içinde tek bir Kayma Tüneli merdivenini 124 kez geçilmesi ve Üst Dörtlü antrenörlerinin hepsini yenmenin ardından Şampiyonun Alakazam’ına yenilip, daha sonra Şampiyon’u devirmek için bu dört antrenörü tekrar yenmek zorunda kalması örnek gösteriliyor. Opus, hem doğruluk hem de maliyet açısından düzenlemeler yaptı. TypeSafe’in model üzerine notlarına dayanarak, Jev’ye gönderilen metni yaklaşık üçte bir oranında azalttı ve sayı yerine sözcükler kullandı. Jev bir döngüye takıldığında, sistemin karar talebini saniyede yaklaşık bir kez yerine her altı saniyede bir yapacak şekilde ayarlandı. İnsan katkısı da söz konusu: İzleyiciler sohbet üzerinden ipuçları gönderdi ve faydalı olanlar Jev’nin seçenek listesi için geliştirildi. Opus’a, geliştiriciye ve izleyici kitlesine duyulan bu bağımlılık, karar modelinin güçlü ve zayıf yönlerini açıkça ortaya koyuyor.

İkinci Denemede Başka Bir Yaklaşım

Jev tabanlı ikinci bir denemeyi Frigade’de çalışan Christian Mathiesen gerçekleştirdi. O denemede kullanılan sistemin okuma dosyasına göre, sistem “oyunun hafızasını okur, yasal seçenekleri listeler … ve Jev bunlardan birini seçer” ancak oyun hafızasına asla yazma yapmaz. Mathiesen, Jev’nin butonları doğrudan seçebildiği ilk versiyonunda, sistemin “Pallet Kasabası’ndan hiç çıkmadığını” söyledi. Maliyeti, kendi tahminine göre 24 saat başına yaklaşık 1 ila 1,70 dolar arasında, yani güncel kurla 24 saat başına yaklaşık 48,88 ila 83,10 Türk lirası arasında.

Frigade’de çalışan Christian Mathiesen, Jev’nin butonları doğrudan seçebildiği ilk versiyonunda sistemin “Pallet Kasabası’ndan hiç çıkmadığını” söyledi.

Google Preferred Source Christian Mathiesen, Frigade

Bu yaklaşım, Jev’nin kullandığı yöntemden farklı bir stratejiyi yansıtıyor: Mathiesen’in versiyonu oyunu doğrudan oynamak yerine, yasal hamleleri sunan bir çerçeve kuruyor ve kararı Jev’ye bırakıyor. Böylece tek bir motorun yeteneğine değil, sistemin tasarımıyla modelin seçimi arasındaki iş bölümüne vurgu yapılıyor.

Başka Bir Yol: Ekran Görüntüsünden Öğrenen Model

Jev’nin dışında Pokémon Kırmızı üzerine farklı bir deney de yapıldı. stmonty adıyla bilinen bir geliştirici, RTX 3080 Ti ekran kartında 42.000’den fazla oyun karesiyle eğitilen küçük bir dünya modelini geliştirdi. Profesör Oak laboratuvarındaki bir kayıttan yola çıkan model, stmonty’nin blog yazısına göre 100 denemenin 52’sinde bir başlangıç Pokémon’u seçti. Jev’ye kıyasla hem hedef hem de yardım çok daha küçükdi: stmonty’nin modeli, yalnızca ekran görüntülerinden her girişin ne yaptığını öğrenmek zorundaydı. Bu denemede de insan ya da büyük dil modeli desteği söz konusu değil; model, yalnızca görsel ipuçlarıyla kendi kendine öğrenme yolunu izliyor.

Jev’nin virüs gibi yayılması, LangChain’in 15 Eylül’deki çıkışından bu yana “güçlü bir yankı uyandırdığını” belirttiği gibi, on gün içinde birden fazla geliştiricinin oyunu oynamasına yol açtı. Bu denemenin başarısı, uzmanlaşmış modellerle işbirliğinin problem çözme yeteneğini anlamlı bir biçimde artırabildiğini gösteriyor. TypeSafe’in kendisi de açık uçlu görevlerin büyük dil modellerine daha uygun olduğunu söylüyor, bu da Jev’nin çıktığı günden beri aktardığımız bir noktaydı. Karşılaştırma açısından, o sırada Opus 4.5’i çalıştıran Anthropic’in akışı, Ocak ayında bile Pokémon Kırmızı’yı tamamlamamıştı. Bu kez Jev’nin oynamasını ve Claude’nin kuralları yazmasını üstlendiğinde, geliştirici zaferi elde etti.

İlginizi Çekebilir: RAG Bir Ajan Değil: Arka Plan Bilgisi ile Eylem Arasındaki Katmanı Kurup Gerçek Sonuçları Ölçen Bir Deney →
Kaynak: Tomshardware ↗
🚀 SayarBilgi Topluluğu

Bu Gelişmeyi Toplulukta Değerlendirin

Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.

🚀 Yapay Zeka & Gelecek Odası →
TOPLULUĞUN SESİ

Söz sizde.

1 yorum

Deneyiminizi, sorularınızı ve katkılarınızı paylaşın. E-posta adresiniz yayımlanmaz.

Sohbete katıl

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Yorumunuz yayımlanmadan önce onay bekleyebilir.

BİR SONRAKİ OKUMA

Merak etmeye devam

Tümünü gör ↗

Neyi merak ediyorsun?

En az 3 karakter yazın.

Keşfet

📤 Paylaş & Yapay Zekaya Sor

✓ Link otomatik olarak kopyalanacaktır.
⚡ YAPAY ZEKA MODELLERİNDE ANALİZ ET
Kumru AI
Kumru AI
ChatGPT
ChatGPT
Gemini
Gemini
Copilot
Claude
Claude
DeepSeek
DeepSeek
Perplexity
Perplexity
Grok
Grok
Mistral
Mistral
Meta AI
Meta AI
Qwen
Qwen
NotebookLM
NotebookLM
Poe
Poe
Yandex AI
Yandex AI
📢 SOSYAL MEDYADA PAYLAŞ
Link & komut kopyalandı! Açılıyor...