Google, yapay zeka destekli konuşmayı yazıya dönüştürme konusunda devrim yaratacak yeni bir teknoloji duyurdu: Gemini 3.5 Transcribe. Bu gelişmiş model, ses girişini daha akıcı hale getirmek için “um” ve benzeri sesleri otomatik olarak çıkarıyor. Şu anda Pixel 11 cihazlardaki Gboard “Rambler” özelliğinde kullanılıyor, ancak yakın gelecekte tüm Google ekosistemine entegre edilmesi planlanıyor.
Google’a göre Gemini 3.5 Transcribe, şirketin önceki sesli metne dönüştürme motoru olan Chirp 3’ten önemli ölçüde daha hızlı ve doğru bir performans sergiliyor. Yeni yapay zeka modeli, sesi metne dönüştürme işleminde yaklaşık %70 daha hızlı çalışırken, canlı konuşma hataları oranı ise dikkat çekici şekilde %5,5’e düşmüş durumda. Bu oran, Google’ın Chirp 3 için ölçtüğü %7,32’lik orandan belirgin bir iyileşme.
Ancak, burada dikkate alınması gereken önemli bir nokta var: Gemini 3.5 Transcribe, doğru bir şekilde ne demek istediğinizi anlamak için yapay zekaya güvenmeyi gerektiriyor. Kısa metinler için model, tutarsızlıkları ve sözlü hataları giderme konusunda oldukça başarılı bir performans sergiliyor (Rambler ile yapılan testlere göre). Ancak, yapay zeka teknik olarak söylediğiniz kelimelerin içeriğini değiştirebilir ve bu durum her durumda uygun olmayabilir.
Gemini 3.5 Transcribe sadece söylediğiniz kelimeleri daha iyi duyma konusunda değil, aynı zamanda ne demek istediğinizi tam olarak anlama konusunda da gelişmiş durumda. Konuşurken, model akışınızı bozabilecek “um” ve “uh” seslerini otomatik olarak çıkarabilir. Ayrıca, kendinizi düzeltmeniz gerektiğinde metni gerçek zamanlı olarak düzenleyebilir ve sağladığınız özel kelime dağarcığını kullanarak “özel terminolojiye” hakim olabilir. Tüm bu işlemler 85 farklı dilde ve önceden kaydedilmiş seslerdeki en fazla üç konuşmacı için geçerlidir.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.
Bir yanıt yazın