Teknoloji devi Google, gerçek zamanlı diyalog ve konuşma tanıma sistemlerini iyileştirmek amacıyla yeni yapay zeka modellerinden oluşan “Gemini Audio” ailesini duyurdu. Bu gelişmenin ilk adımı olarak, daha hassas, bağlamsal farkındalık düzeyi yüksek ve otomatik dil algılama özelliklerine sahip olan “Gemini 3.5 Transcribe” modeli kullanıma sunuldu.
Google’ın yeni nesil yapay zeka ailesi Gemini’nin ilk üyelerinden olan Gemini 3.5, kısa bir süre önce piyasaya sürülmüştü. Ancak, yapay zeka alanındaki hızlı gelişmelerle birlikte, Google bu aileye yeni üyeler eklemeye devam ediyor. Bugün duyurulan “Gemini 3.5 Transcribe” modeli, bu kapsamda geliştirilen ilk ürün olarak öne çıkıyor.
Google’a göre, Gemini Audio ailesinin temel amacı, daha doğal ve akıcı sohbetler için gerçek zamanlı diyalog ve konuşma tanıma yeteneklerini geliştirmek. Bu doğrultuda, “Gemini 3.5 Transcribe” modeli, Mountain View merkezli şirketin bugüne kadar geliştirdiği en hassas konuşmayı metne dönüştürme çözümü olarak tanımlanıyor.
Yeni modelin başlıca özellikleri arasında şunlar yer alıyor:
- Akıllı transkripsiyon: Gereksiz kelimeleri (örneğin, “um” ve “ah”) otomatik olarak temizler, metni biçimlendirir ve sesli komutlarla düzenleme imkanı sunar.
- Fonksiyon çağırma: Model, görüntü oluşturma gibi karmaşık görevleri diğer Gemini modellerine devredebilir. Bu özellik, şu anda geliştiriciler için macOS uygulamasında mevcutken, yakın zamanda API’ye de entegre edilmesi planlanıyor.
- Daha hassas transkripsiyonlar: Google, modelin çeşitli gerçek dünya koşullarında (gürültülü ortamlar ve konuşma yapay zekası etkileşimleri dahil) %4’lük bir kelime hata oranı (WER) sağladığını ve önceden kaydedilmiş dosyalar için ise bu oranın %2.6 olduğunu belirtiyor.
- Özel sözcük dağarcığı: Model, uzmanlık alanlarına özgü terimleri ve farklı yazılışları tanıyabilir ve transkripsiyonları kullanıcının sağladığı özel sözcük dağarcığına göre uyarlayabilir.
- Geniş dil desteği: Otomatik olarak 85’in üzerinde dili algılar ve metne dökebilir, ayrıca bölgesel aksanlara ve farklı lehçelere de uyum sağlayabilir.
- Çoklu konuşmacı tanımlama: Önceden kaydedilmiş seslerdeki konuşmaları kelime düzeyinde zaman damgalarıyla etiketleyebilir (üçten fazla konuşmacı için destek deneysel aşamada).
Bu yeni özellik, daha önce Gboard’da sunulan “Rambler” özelliğinde de kullanılmıştı. Ayrıca, Google Antigravity ve macOS üzerindeki Gemini uygulamalarında da mevcut olacak. Gelecekte ise Chrome ile entegre edilerek, web sayfalarındaki herhangi bir alana sesli olarak metin yazma imkanı sunacak.
Gemini 3.5 Transcribe’ın tüm bu avantajlarından yararlanmak isteyen kullanıcılar, kısa süre içinde modelin Search Live, Gemini Live, Docs, Keep, Gmail, Gemini uygulaması ve Gboard gibi platformlarda kullanıma sunulacağını görebilirler. Ayrıca, geliştiriciler için Google AI Studio ve Google Antigravity üzerinden API’ye entegre edilecek. Kurumsal müşteriler ise bu modeli Gemini Enterprise Agent Platformu ve Gemini Enterprise for Customer Experience çözümleriyle deneyimleyebilecekler.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.
Bir yanıt yazın