Günümüzde birçok yapay zeka uygulaması, belgelerinizi buluta yüklemenizi gerektiriyor. Ancak bu durum, özellikle hassas veriler söz konusu olduğunda gizlilik endişelerini beraberinde getiriyor. Neyse ki, artık telefonunuzda tamamen çevrimdışı çalışan ve belgelerinizi buluta göndermeden çalışabilen yapay zeka asistanları mevcut.
Telefonunuzda yerel bir LLM çalıştırmak artık mümkün ve bu, gizlilik sorununu ortadan kaldırıyor. Ancak mobil yerel yapay zeka uygulamaları, belge işleme konusunda hala sınırlı kalabiliyor. Kopyala-yapıştır yöntemiyle belgeyi sisteme aktarabilirsiniz, ancak çoğu uygulama doğrudan dosya yüklemeyi desteklemiyor.

Uzun zamandır telefonumda yerel LLM’ler çalıştırıyorum ve favorim PocketPal. Kullanımı kolay, pratik bir uygulama. Ancak PocketPal gibi diğer mobil yerel LLM uygulamalarının da ortak bir sorunu var: belge yüklemeyi desteklemiyorlar.
Google’ın AI Edge Gallery de aynı durumdaydı ve benim favori uygulamalarmdan biriydi, ancak bu da belge desteği eksikliği nedeniyle kullanılamıyordu.

Mobil RAG (Retrieval Augmented Generation) sistemlerinin çalışması için üç şeyin aynı anda çalışması gerekiyor: dil modeli, metni vektörlere dönüştüren gömme modeli ve bunları arayabilen bir vektör veritabanı. Bu da telefonun bellek kapasitesiyle ilgili sınırlamalar getiriyor.
Kriterlerim sonunda şunlar oldu: Uygulama, Dosyalar uygulamasından belge yüklemeyi desteklemeli ve gerçek bir RAG sistemine sahip olmalıydı. Kopyala-yapıştır yöntemiyle metni isteme eklemek gibi çözümlere başvurmak istemiyordum. Nihayetinde Noema adlı uygulamayı buldum. Şu anda sadece iOS için mevcut, bu nedenle Android kullanıyorsanız, LocalRAG en yakın alternatiftir ve aynı prensipler burada da geçerlidir.

Noema ücretsiz, açık kaynaklı bir uygulama ve GGUF, MLX, Liquid AI’nin SLM, ExecuTorch ve CoreML gibi beş farklı model formatını destekliyor. Ayrıca Apple’ın Foundation Model’ini de Apple Intelligence cihazlarında kullanabiliyor. Bu kadar geniş model desteği, çoğu mobil uygulamanın üzerinde.

İlk belgeyi yüklediğinizde, Noema bir gömme modeli indiriyor. Şu anda Qwen3 Embedding 0.6B’yi Q8_0 kuantizasyonunda yaklaşık 640MB olarak kullanıyor. Bu sadece tek seferlik bir kurulum. Bundan sonra, eklediğiniz her belge cihaz üzerinde parçalara ayrılıyor ve gömülüyor. PDF ve EPUB formatları doğrudan destekleniyor, ayrıca Obsidian gibi uygulamalardan alınan metin dosyaları da kullanılabilir.
RAG sistemi oldukça iyi çalışıyor ve bulut tabanlı uygulamaların performansına yakın bir deneyim sunuyor. Sadece bir soru soruyorsunuz, Noema sorguyu gömüyor, indeksli belgelerinizde benzer parçaları arıyor ve ilgili bölümleri isteme ekleyerek modelin bu verilere dayanarak cevap vermesini sağlıyor. İki farklı belge modu mevcut: Otomatik Bağlam, sadece ilgili kısımları alırken; Tam Belge modu ise tüm veriyi kullanır. Uygulama hangi modun kullanıldığını ve ne kadar bağlamın kullanıldığını önceden bildiriyor.

Model seçimi de önemli. Genellikle Qwen 3.5 2B’yi Q3 ve Q4 kuantizasyonlarında kullanıyorum, bu da telefonumda yeterli alana sahip olmamı sağlıyor. Noema ayrıca hangi modelin çalıştırılacağını denemeden önce RAM gereksinimlerini tahmin eden bir araç sunuyor.
Kullanmaya başlamadan önce bağlam uzunluğu, GPU kullanımı ve iş parçacası sayısı gibi ayarları kontrol etmeniz önerilir. Ayrıca “Çevrimdışı Mod”u etkinleştirmek de iyi bir fikir; bu mod, uygulamanın dışarıya HTTP veya HTTPS istekleri göndermesini engelliyor.

Şimdi banka hesap özetlerini doğrudan banka uygulamasından Dosyalar uygulamasına aktarıyorum, bunları Noema’ya ekliyorum ve yerel olarak sorguluyorum. Aynı şey sigorta belgeleri, sağlık raporları ve diğer hassas veriler için de geçerli.
Bu durumun en büyük avantajı, artık hangi belgelerin paylaşılmaması gerektiği konusunda daha bilinçli hale gelmem oldu. Artık banka hesap özetleri, sigorta belgeleri ve sağlık kayıtları gibi hassas verileri yerel olarak sorgulayabiliyorum.

Elbette bazı dezavantajlar da var. Hız en belirgin olanlardan biri. Noema’nın kendi belgelerine göre saniyede birkaç token üretilebiliyor, bu da bulut tabanlı modellere kıyasla daha yavaş bir performans anlamına geliyor. Ayrıca model boyutu da telefonun RAM kapasitesiyle sınırlı.
Ancak benim için en önemli şey, hassas verilerimi güvende tutmak ve bunu yaparken de yapay zeka ile etkileşimde bulunabilmek. Bu nedenle bu dezavantajları avantaja çevirmeye hazırım.

Kaynak: Xda-developers
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.
Bir yanıt yazın