Google DeepMind iki yeni ses modelini yayımladı: Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking. Şirket bunları bugüne kadarki en gelişmiş canlı diyalog modelleri olarak tanımlıyor.

İkisi de doğrudan konuşmadan konuşmaya çalışıyor. Yani arada metne çevirip yeniden seslendirme adımı yok; ses girip ses çıkıyor. Bu yapı gecikmeyi düşürdüğü için konuşmanın kesintisiz hissettirmesini sağlıyor.

Hedeflenen boşluk

Sürüm belirli bir eksiği hedefliyor: konuşmanın akışını bozmadan akıl yürütebilen ve araç çalıştırabilen sesli ajanlar.

Bugüne kadarki kurulumlarda bir ajan araç çağırırken sessiz kalıyor ve konuşma kopuyordu. Extended Thinking sürümünün ayrı bir model olarak sunulmasının sebebi de bu: daha uzun düşünmeyi gerektiren işleri konuşmayı kesmeden yürütmek.

Extended Thinking ayrımı kullanım tarafında da bir seçim yaratıyor. Basit bir randevu botunda uzun düşünme gereksiz maliyet; sipariş durumu sorgulayıp iade başlatan bir akışta ise gerekli. İki modeli aynı üründe farklı akışlara bağlamak mümkün.

Fiyat farkı

Asıl dikkat çeken kalem fiyat. Google, sesli konuşmanın saatini 1,38 dolara veriyor ve bu OpenAI'ın GPT-Live-1 modelinin belirgin biçimde altında.

ÖlçütGemini 3.8 LiveGPT-Live-1
Konuşma saati1,38 dolarbelirgin şekilde daha yüksek
SıralamaKonuşmadan konuşmaya listesinde başta
DoğallıkTam çift yönlü sayesinde daha doğal

Tablodaki son satır önemli: OpenAI'ın modeli tam çift yönlü çalıştığı için hâlâ daha doğal ses vermesi bekleniyor. Yani seçim tek boyutlu değil; ucuzluk ile konuşma akıcılığı arasında bir takas var. Yoğun çağrı hacmi olan bir destek hattında maliyet farkı aylık faturada görünür hâle gelirken, satış görüşmesinde doğallık daha belirleyici olabiliyor.

Sıralamadaki üstünlük de tek başına yeterli değil. Konuşmadan konuşmaya listeleri çoğunlukla İngilizce ölçüyor; aynı modelin başka bir dilde nasıl davrandığı ayrı bir soru olarak duruyor.

Nereden erişiliyor

İki model de Gemini Live API ve Google AI Studio üzerinden yayında. Barındırılan modeller olarak sunuluyorlar; açık ağırlık yayımlanmadığı için kendi sunucunuzda çalıştırma seçeneği yok.

Bu, kişisel veri işleyen bir çağrı merkezi kurulumunda ilk sorulacak soruyu da belirliyor: ses kaydı nerede işleniyor ve ne kadar saklanıyor. Fiyat avantajı bu sorunun cevabına bağlı olarak anlamını değiştiriyor.

Ailenin geri kalanı

Yeni modeller, Google'ın ağustosta Gemini 3.5 Transcribe ile genişlettiği ses ailesinin üstüne biniyor. Şirket bu alanda parça parça değil, birbirini tamamlayan bir hat kuruyor: yazıya dökme, canlı diyalog ve uzun düşünme ayrı ürünler olarak konumlanıyor.

Türkiye tarafında asıl belirleyici olan şey ise fiyattan önce dil. Saat başı maliyet ne kadar düşerse düşsün, Türkçede yanlış anlama oranı yüksek kalırsa sesli ajan kurulumu müşteri hizmetlerinde işe yaramıyor; bu yüzden karar öncesi kendi kayıtlarınızla ölçüm yapmak gerekiyor. Küçük bir örneklem, gerçek müşteri kayıtlarından seçilmiş yirmi görüşme bile bu kararı sayıya bağlamaya yetiyor.