Gemini’ye Kişiye Özel Ses Üretme Yeteneği...
21:16:43
Ses Üretiminde Yeni Dönem
Google, Gemini ailesine iki yeni metinden sese dönüştürme modeli ekledi. Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS olarak adlandırılan modeller, önceden belirlenmiş ses seçeneklerinin ötesine geçerek doğal dil komutlarıyla yeni ses karakterleri oluşturmayı ve mevcut sesleri özelleştirmeyi mümkün kılıyor…
Google’a göre Gemini 3.8 Flash TTS, özellikle yaratıcı ses tasarımı ve karakter oluşturma için geliştirildi. Kullanıcılar bir sesin rolünü, aksanını ve diğer özelliklerini doğal dil kullanarak tanımlayabiliyor. Sistem 100’den fazla dil ve lehçeyi desteklerken, oyun karakterlerinden sesli kitap anlatıcılarına kadar farklı kullanım alanlarına yönelik sesler oluşturabiliyor.
30 Saniyelik Ses Yetiyor
Yeni sistemin dikkat çeken özelliklerinden biri, ses kopyalama yeteneği. Google, kullanıcının kendisine veya kullanım hakkına sahip olduğu bir sese ait yalnızca 30 saniyelik ses örneğinden tutarlı bir ses profili oluşturulabildiğini belirtiyor.
Şirket, bu özelliğin kötüye kullanımını önlemek amacıyla ses sahibinin sözlü onayının doğrulanmasını zorunlu kılıyor. Oluşturulan seslere ayrıca Google’ın SynthID teknolojisiyle fark edilmesi güç dijital filigranlar ekleniyor.
Google ayrıca sistemin 2 binden fazla kullanıma hazır sesten oluşan bir kütüphaneye erişim sunduğunu açıkladı. Kullanıcılar ilerleyen dönemde bu sesleri perde, ton, konuşma hızı ve aksan gibi özellikler bakımından yeniden düzenleyebilecek.
Konuşmanın Her Satırı Yönetilebiliyor
Gemini 3.8 Flash TTS‘nin bir diğer özelliği, oluşturulan konuşmanın satır satır yönlendirilebilmesi. Kullanıcılar metnin nasıl okunacağını yalnızca noktalama işaretleriyle değil, doğrudan sahne yönergeleriyle de belirleyebiliyor.
Örneğin bir karakterin fısıldaması, belirli bir cümlede heyecanlanması, duraksaması, gülmesi veya iç çekmesi gibi ayrıntılar komutlarla tanımlanabiliyor. Sistem ayrıca iki kişinin karşılıklı konuştuğu sahneleri tek bir senaryo üzerinden oluşturabiliyor ve konuşmacıların seslerini birbirinden ayırarak doğal bir sıra düzeni sağlayabiliyor.
Google, uzun içeriklerde de ses karakterinin ve konuşma biçiminin korunabildiğini belirtiyor. Bu özellik özellikle podcast ve sesli kitap gibi saatler süren içeriklerin üretiminde kullanılabilecek.
Flash-Lite Daha Ucuza Ölçekleniyor
İkinci model olan Gemini 3.8 Flash-Lite TTS ise yaratıcılıktan çok yüksek hacimli kullanıma odaklanıyor. Google, modeli özellikle dublaj, büyük miktarda ses içeriği üretimi ve gerçek zamanlı sesli yapay zekâ arayüzleri için optimize ettiğini belirtiyor.
Her iki model de 100’den fazla dili destekliyor. Google’ın açıklamasına göre modeller, Japonca, Brezilya Portekizcesi, Vietnamca, Modern Standart Arapça, Meksika İspanyolcası ve Hintçe gibi farklı dillerde yapılan kör kullanıcı değerlendirmelerinde de üst sıralarda yer aldı.
Google ayrıca Gemini 3.8 Flash TTS‘nin Hume AI tarafından gerçekleştirilen Voice Design Benchmark testinde 71,4 puanla genel sıralamada ilk sırada yer aldığını ve aksan modellemede de 60,8 puanla lider olduğunu açıkladı. Bu sonuçların Google‘ın aktardığı değerlendirmelere dayandığını belirtmek gerekiyor.
Gemini’de Kullanıma Açılıyor
Yeni modeller 23 Eylül itibarıyla kullanıma sunulmaya başlandı. Gemini 3.8 Flash TTS, geliştiriciler için Gemini API ve Google AI Studio üzerinden, kullanıcılar için ise Gemini Notebook üzerinden kullanıma açılıyor. Gemini 3.8 Flash-Lite TTS ise geliştiricilere Gemini API ve Google AI Studio üzerinden, kullanıcılara da Google Vids üzerinden sunuluyor.
Google, yeni ses üretim teknolojilerinin Figma, HeyGen, Wondercraft, 99.co ve Ollang gibi şirketler tarafından dublaj, medya yerelleştirme ve sesli yapay zekâ ajanlarında kullanılmaya başlandığını da açıkladı.
Not: Google, AI Studio üzerinden ses kopyalama özelliğinin Illinois, Texas, Avrupa Ekonomik Alanı, Birleşik Krallık, İsviçre ve Hindistan’da kullanılamayacağını belirtiyor. Türkiye ise Google’ın açıkladığı kısıtlı bölgeler arasında yer almıyor.