Trusence Teknoloji, her gün
Son güncelleme: 24 Eylül 2026 English
← Tüm haberler
Modeller

Google, Gemini 3.8 için iki yeni Flash TTS modeli tanıttı

Gemini 3.8 Flash TTS ayrıntılı, karakter odaklı ses üretimine; Flash-Lite TTS ise daha ucuz, yüksek hacimli dublaj ve sesli ajanlara odaklanıyor.

Güncellendi: 24 Eylül 2026

Google, Gemini ailesini iki yeni metinden sese modelle genişletti: Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS artık kullanılabiliyor. Bu iki model, Gemini serisindeki text-to-speech tarafını farklı kullanım senaryolarına göre ayıran yeni nesil araçlar olarak konumlanıyor.

Gemini 3.8 Flash TTS, ayrıntılı yaratıcı yönlendirme ve karakter tasarımı için tasarlanmış durumda; doğal dilde verilen komutlarla sıfırdan yeni sesler üretmeye izin veriyor. Kullanıcı, metinle tarif ettiği rol, duygu ve konuşma biçimi üzerinden karakter sesini şekillendirebiliyor. Buna karşılık Gemini 3.8 Flash-Lite TTS, yüksek hacimli, maliyet hassas senaryolar için ayarlanmış; özellikle dublaj, sesli içerik üretimi ve daha ucuz, ifade gücü yüksek voice agent’lar hedefleniyor.

Flash TTS, 100’ün üzerinde dil ve lehçede üretken ses tasarımı yapabiliyor; rol, aksan ve ses karakteristiği gibi unsurlar da prompt üzerinden kontrol edilebiliyor. Kullanıcılar ayrıca, Meksika İspanyolcası, Quebec Fransızcası ve İskoç İngilizcesi gibi farklı dil varyantlarını da içeren, 2.000’den fazla üretime hazır sesten oluşan bir kütüphaneye erişebiliyor. Sistem, uygun rıza kontrolleriyle birlikte, 30 saniyelik bir örnekten belirli bir sesi kopyalayabiliyor; bu üretimler SynthID ile işaretleniyor ve C2PA kimlik bilgileriyle destekleniyor. Kullanıcıların kendi oluşturdukları özel sesleri kaydedip yönetmesine de izin veriliyor; böylece zaman içinde aynı sesi tutarlı biçimde yeniden kullanmak mümkün hale geliyor.

Her iki TTS modeli de replik replik çalışmaya uygun; betik içine sahne yönergeleri veya ek komutlar ekleyerek performansı satır bazında yönlendirmek mümkün. Modeller, saatler süren kesintisiz ses üretiminde de ses kalitesi ve karakter tınısını koruyacak şekilde uzun formlu üretimi destekliyor. Ayrıca iki konuşmacılı sahne kurgusu ve kahkaha, iç çekme ya da dinlediğini belli eden kısa tepkiler gibi sözsüz vokal işaretleri de senaryo içinde yönetilebiliyor.

Performans tarafında Gemini 3.8 Flash TTS, Hume AI’nin Voice Design Benchmark sıralamasında 71.4 puanla birinci olurken, aksan modelleme skorunda da 60.8 ile lider görünüyor. Hume AI’nin Overall Quality Index değerlendirmesinde ise Flash TTS birinci, Flash-Lite TTS ikinci sırayı alarak kalite metriklerinde ilk iki basamağı paylaşıyor.

Neden önemli

Gemini 3.8 Flash TTS ve Flash-Lite TTS, Google’ın metinden sese tarafında hem üst seviye yaratıcı kontrol hem de maliyet odaklı yüksek hacim için ayrı kanallar açtığını gösteriyor. Yüzlerce dil ve lehçede üretken ses tasarımı, geniş hazır ses kütüphanesi, satır satır yönlendirilebilir uzun formlu üretim ve iki konuşmacılı sahne desteği, dublajdan etkileşimli sesli deneyimlere kadar mevcut projelerin ses katmanını daha ayrıntılı kurgulamayı mümkün kılıyor. Hume AI benchmark’larında ilk iki sırayı almaları da bu modellerin pazar içi kalite karşılaştırmalarında öne çıktığını işaret ediyor; aynı zamanda, ses kopyalamada rıza kontrolü ve SynthID ile işaretleme şartı, bu tür sistemlerin nasıl çerçeveleneceğine dair güvenlik ve etik beklentilerini de belirginleştiriyor.

Kaynaklar