Google, yapay zeka destekli konuşmayı yazıya dönüştürme konusunda çığır açan bir yenilik daha: Gemini 3.5 Transcribe! Bu yeni teknoloji, ses girişini “um” ve düzeltmeleri ortadan kaldırarak, daha akıcı ve doğal metinler oluşturmanızı sağlıyor. Google’ın bu hamlesi, özellikle uzun süreli toplantılar, eğitim materyalleri veya kişisel notlar alırken büyük kolaylık sağlayacak.
Gemini 3.5 ailesinin farklı bir modeli olan Transcribe, şu anda Pixel 11 cihazlardaki Gboard “Rambler” özelliğinde kullanılabiliyor. Ancak, kısa sürede tüm Google ekosistemine entegre edilecek ve kullanıcılarına daha geniş bir erişim imkanı sunacak.
Google’ın iddialarına göre, Gemini 3.5 Transcribe, önceki nesil sesli metne dönüştürme motoru olan Chirp 3’ten önemli ölçüde daha hızlı ve doğru sonuçlar veriyor. Yeni yapay zeka modeli, sesi metne dönüştürme işleminde yaklaşık %70 oranında daha hızlı çalışırken, canlı konuşma hataları oranı da %5,5’e düşürülmüş durumda. Bu, Google’ın Chirp 3 için ölçtüğü ortalama %7,32’lik hata oranına kıyasla önemli bir iyileştirme anlamına geliyor.
Ancak, bu alandaki her ilerlemenin faydalı olduğunu belirtmekte fayda var. Sesli giriş kullanırken yazım hatalarını düzeltmek zaman alıcı olabilir ve bu nedenle, Gemini 3.5 Transcribe’ın sunduğu iyileştirmeler, kullanıcılar için büyük bir avantaj sağlayacak.
Gemini 3.5 Transcribe’in en dikkat çekici özelliklerinden biri, sadece söylenenleri değil, aynı zamanda ne demek istediğinizi de doğru bir şekilde anlamasıdır. Konuşurken, yapay zeka model, akışınızı bozabilecek “um” ve “uh” gibi sesleri otomatik olarak çıkarabilir. Ayrıca, kendinizi düzeltmeniz gerektiğinde metni gerçek zamanlı olarak düzenleyebilir ve sağladığınız özel kelime dağarcığını kullanarak “özel terminolojiye” hakim olabilir.
Bu özellikler sayesinde, Gemini 3.5 Transcribe, profesyonel toplantılar, akademik araştırmalar veya teknik belgeler hazırlama gibi çeşitli alanlarda kullanıma uygun hale geliyor. Model, 85 farklı dilde ve önceden kaydedilmiş seslerdeki en fazla üç konuşmacı için geçerli.
Elbette, bu teknolojinin kullanımında dikkat edilmesi gereken bir nokta var: Doğru bir şekilde ne demek istediğinizi anlamak için yapay zekaya güvenmek. Kısa metinler için, model tutarsızlıkları ve sözlü hataları giderme konusunda iyi performans gösteriyor (Rambler ile yaptığım testlere göre). Ancak, uzun ve karmaşık konuşmalarda, yapay zeka teknik olarak söylediğiniz kelimelerin içeriğini değiştirebilir ve bu durum her durumda uygun olmayabilir.
Kaynak: Ars Technica
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.
Bir yanıt yazın