Google, Gemini 3.8 ses sentez modellerini yayınladıGoogle releases Gemini 3.8 speech synthesis modelsHabere gitRead the article Türkçe (otomatik çeviri) English (automatic translation) |
ÖzetSummaryGoogle, 2.000'den fazla ses, 30 saniyelik bir örnekten özel ses klonlama ve çok konuşmacılı diyalog sentezi özelliklerine sahip iki yeni Gemini 3.8 metinden sese modelini (Flash ve Flash-Lite) yayınladı. Simon Willison, GPT-6 Astra ile geliştirdiği tarayıcı tabanlı bir uygulama alanı üzerinden bu modelleri sergiledi.Google released two new Gemini 3.8 text-to-speech models (Flash and Flash-Lite), featuring over 2,000 voices, custom voice cloning from a 30-second sample, and multi-speaker dialogue synthesis. Simon Willison showcased these models through a browser-based application arena he developed with GPT-6 Astra. |
Neden ÖnemliWhy it mattersNeredeyse anında üretim (yaklaşık 20 saniyede 1 dakika 18 saniyelik ses), çok düşük maliyet (2,74 sent) ve çok karakterli diyalog desteği, etkileşimli hikâye anlatımı, erişilebilirlik araçları ve prototipleme için engelleri düşürüyor. Açık CORS politikası ve kendi anahtarınızı getirin modeli, arka uç gerektirmeden geliştiricilere anında erişim sağlıyor ve deneysel çalışmaları hızlandırıyor. Sadece 30 saniyelik ses kaydından özel ses klonlama, metinden sese alanında hem yaratıcı hem de etik açıdan beklentileri yükseltiyor.Near-instant generation (1 minute 18 seconds of audio in about 20 seconds), extremely low cost (2.74 cents), and multi-character dialogue support lower barriers for interactive storytelling, accessibility tools, and prototyping. An open CORS policy and a bring-your-own-key model provide developers with immediate access without backend requirements, accelerating experimental work. Custom voice cloning from just a 30-second audio recording raises expectations in the text-to-speech field, both creatively and ethically. |
Öne ÇıkanlarHighlights
|
EleştiriCritical takeYazı, temelde bir ürün demosunun blog haberi formatına bürünmüş hali. 'Vibe-coded' uygulama alanı ve pelikan skeci hoş olsa da gerçek dünya gecikmesi, ses sadakati veya 30 saniyelik ses kaydından ses klonlamanın pratik riskleri hakkında az şey söylüyor. Bağımsız kalite kıyaslamaları veya rakip metinden sese çözümleriyle karşılaştırma sunulmadığı için, ses kalitesinin üst sınırını bilmeden 2,74 sentlik fiyat noktasını bağlamlandırmak zor.The article is essentially a product demo dressed up as a blog post. While the 'vibe-coded' application arena and pelican sketch are charming, it says little about real-world latency, voice fidelity, or the practical risks of voice cloning from a 30-second recording. Without independent quality benchmarks or comparisons to competing text-to-speech solutions, it is difficult to contextualize the 2.74-cent price point without knowing the upper limit of audio quality. |