Google, yapay zeka destekli ses üretiminde kullanıcıların seslerini kopyalayabileceği ve metinleri bir aktör gibi seslendirebileceği yeni modellerini yayınlamaya başladı. Şirket, daha ifade dolu ve doğal duyulan sesler üretebilmek amacıyla geliştirdiği Gemini 3.8 Flash TTS ve Flash-Lite TTS adlı metin-den-ses modellerini kademeli olarak sunmaya başladı.
Yeni nesil bu modeller, sıradan bir metni okuyan seslendirmelerden çok öteye geçmeyi hedefliyor. Google, kullanıcıların seslendirmenin doğru aksanla, doğru tempoda, doğru duygu ve duraksamalarla, hatta ara sıra bir iç çekişmeyle gerçekten sahneye konmasını sağlamak için haftalar boyu Gemini 3.8’i orijinal hâlinde kalarak yeni bir aileye dönüştürdü. Artık bu ailenin da rol üstlenmesini istiyor ve bu amaçla Gemini 3.8 Flash Metin-Den-Ses (TTS) ile Flash-Lite TTS modellerini piyasaya sürüyor.
Kullanıcılara İlk Kez Kontrolü Verme Vaadi
Kullanıcılar için en büyük yenilik kontrolü. Google, bir blog yazısında Gemini 3.8 Flash TTS’in doğal dillerle verilen bir açıklamadan özgün sesler oluşturabildiğini, ayrıca 100’den fazla dil ve lehçe için destek sağladığını açıkladı. Kullanıcıların elinde aynı zamanda 2.000’den fazla hazır seslendirme sesine erişim bulunuyor. Ses klonlama özelliği ise bu seslerin 30 saniyelik bir örnekten tutarlı bir şekilde yeniden oluşturulmasını mümkün kılıyor, ancak bunun için gerekli iznin sağlanması gerekiyor.
Bu yaklaşım, yalnızca “metni yapıştır, sesi al” mantığının çok ötesine geçiyor. İki model de ton, tempo, lehçe değişiklikleri, fısıltılar, kahkahalar, iç çekişmeler ve benzeri konuşma ipuçları için satır satır yönergeleri uygulayabiliyor. Tek bir metinden iki kişilik bir diyalogu sahneye koyabildikleri gibi, saatlerce süren ses kayıtları boyunca seslerin tutarlılığını da koruyabiliyorlar. Bu durum, daha az robotik duyulan podcast’ler, sesli kitaplar, dublaj, sesli ajanlar ve seslendirilmiş videolar için kapı aralıyor.
Bu modeller, seslendirmenin bir metni okumakla sınırlı kalmadığını; aksine ton, tempo, duygu ve duraksamaları bile doğru biçimde aktarabildiğini gösteriyor. Kullanıcılar artık seslendirmeyi bir aktör gibi yönetebiliyor.
Google’ın teknik açıklaması
Google’ın sunduğu referans sonuçları da güçlü. Gemini 3.8 Flash TTS, Hume AI’nın Ses Tasarımı Benchmark’ında genel olarak birinci sırada yer aldı ve aksanlar için 60,8 puan aldı. Flash ve Flash-Lite modelleri ise Hume’in genel kalite endeksi sıralamasında ilk iki sırayı kapadı. Voice Arena testleri de bu modelleri birkaç dilde de en üst sıralara yerleştirdi. Yine de Hume’in bireysel ses kalitesi ve insan benzeri değişkenlik kategorilerinde ElevenLabs daha yüksek puan almayı sürdürüyor.
Yayınlanma ve Geliştiriciler İçin Erişim
Her yeni özellik her kullanıcıya aynı anda ulaşmayacak. Flash TTS, Gemini Notebook’ta yayınlamaya başlarken, Flash-Lite TTS de yeni kullanıcılarına son Omni video üreticisini açan Google Vids’te yayınlamaya başlıyor. Geliştiriciler ise her iki modeli de Gemini API ve AI Studio üzerinden kullanmaya erişebilir.
Google ayrıca ses klonlama için güvenlik önlemleri de alıyor. İzni doğrulama gerektiriyor, SynthID su işaretleme ve C2PA kimlik bilgileri ekliyor ve ses klonlamayı Birleşik Krallık, Avrupa Ekonomik Alanı, Hindistan, Texas ve Illinois gibi birkaç bölgede AI Studio üzerinden engelliyor.
Bu Gelişmeyi Toplulukta Değerlendirin
Haber hakkındaki düşüncelerinizi, donanım deneyimlerinizi ve teknik sorularınızı topluluk üyeleriyle anlık olarak tartışın.





Söz sizde.
Deneyiminizi, sorularınızı ve katkılarınızı paylaşın. E-posta adresiniz yayımlanmaz.