İçindekiler
Google Ses Teknolojilerinde Yeni Bir Boyut Açıyor
Google, ses üretimi alanındaki yeteneklerini genişleterek Gemini ailesine iki yeni metin okuma modeli ekledi. Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS adını taşıyan bu sistemler, Google AI Studio ve Gemini API üzerinden erişime açıldı. Daha önce Google DeepMind Sesli Yapay Zeka Modelleri Gemini 3.8 Live ve Extended Thinking'i Duyurdu duyurulan gerçek zamanlı sesli diyalog modellerinin ardından gelen bu yeni araçlar, statik ses şablonlarını dinamik bir yaratıcı stüdyoya dönüştürmeyi hedefliyor.
Yapay Zeka ile Özelleştirilebilir Ses Tasarımı
Flash TTS modeli, oyunlar, sesli kitaplar ve podcast yayınları gibi yaratıcı işler için özel olarak tasarlandı. Kullanıcılar, yüzü aşkın dil ve lehçede, rol ve aksan tanımlamaları yaparak sıfırdan tamamen yeni sesler oluşturabiliyor. Bunun yanı sıra sistem, Meksika İspanyolcası, Quebec Fransızcası ve İskoç İngilizcesi dahil olmak üzere iki binden fazla hazır ses barındıran geniş bir kütüphane sunuyor. Flash-Lite TTS ise yüksek hacimli seslendirmeler ve ses ajanları için daha ekonomik bir alternatif olarak konumlandırılıyor.
Otuz Saniyelik Kayıtla Ses Klonlama ve Güvenlik Önlemleri
Yeni model, yalnızca otuz saniyelik bir ses örneği kullanılarak ses klonlanmasına imkan tanıyor. Google, telif ve güvenlik haklarını korumak amacıyla ses sahibinden alınan sözlü onay kaydının sisteme yüklenmesini zorunlu kılıyor ve yapay zeka eşleşme doğrulaması yapıyor. Ayrıca üretilen tüm ses dosyalarında SynthID filigranı ve C2PA içerik kimlik bilgileri yer alıyor.
Performans Testleri ve Sektörel Entegrasyon
Hume AI Ses Tasarımı Benchmark testlerinde yetmiş bir virgül dördüncü puanla birinci sırada yer alan Flash TTS, kalite endekslerinde de üst sıralarda yer aldı. Figma, HeyGen ve Wondercraft gibi önemli platformlar bu modelleri kendi sistemlerine entegre etmeye başladı. Flash TTS aynı zamanda Gemini Notebook bileşenine eklenirken, Flash-Lite TTS sürümü ise Google Vids platformuna entegre ediliyor.