Ne oldu?
Meta'nın Superintelligence Labs birimi ilk gerçek zamanlı ses algılama modelini yayımladı: Muse Voice Transcribe. Model canlı konuşma sırasında konuşmayı metne çeviriyor, konuşmacıları birbirinden ayırıyor ve cümle sınırlarını belirliyor — hepsini ayrı sistemler olmadan, tek modelde.
Spark ailesinden gelen model, gelen sesi 80 milisaniyelik parçalara bölüyor. Her parçadan sonra dinlemeye devam mı edeceğine yoksa bir sonraki kelimeyi metin olarak mı vereceğine karar veriyor.
Kelime başına bekleme süresi
Buradaki denge klasik: daha çok beklemek doğruluğu artırıyor ama gecikmeyi uzatıyor. Muse Voice Transcribe bekleme süresini her kelime için zorluğuna göre ayrı ayrı ayarlıyor — kolay kelimeler hızlı çıkıyor, zor olanlara daha çok dinleme süresi veriliyor. Meta bu davranışı pekiştirmeli öğrenmeyle eğitmiş: model hem düşük hata oranı hem kısa gecikme için aynı anda ödüllendirilmiş.
Konuşmacı ayrımı ve cümle tespiti de aynı modelin içinde, konuşma tanımayla birlikte eğitilmiş. Model akan metinde konuşmacı değişimlerini işaretliyor ve her bölüme A'dan Z'ye bir kimlik veriyor; aynı anda 20'den fazla konuşmacıyı ayırt edebiliyor ve bir saati aşan kayıtları son işleme gerektirmeden işleyebiliyor.
Bağımsız ölçüm ne diyor?
Artificial Analysis'in bağımsız değerlendirmesi Meta'nın iddialarını doğruluyor. İngilizcede konuşmacı sustuktan 0,16 saniye sonra yüzde 3,1 kelime hata oranı:
| Model | Kelime hata oranı | Gecikme |
|---|---|---|
| Muse Voice Transcribe | %3,1 | 0,16 sn |
| ElevenLabs Scribe v2 Realtime | %3,6 | 0,14 sn |
| Cartesia Ink-2 | %3,4 – %4,0 | — |
| AssemblyAI Universal-3.5 Pro | %4,0 | — |
Model 70'ten fazla dille eğitilmiş, 25'i derinlemesine test edilmiş. Cümle ortasında iki dil arasında geçiş yapan konuşmayı da işleyebiliyor.
Fiyat yine ana silah
Meta fiyatta rakiplerinin altına giriyor: saat başına 0,18 dolar, yani 1.000 ses dakikası için 3 dolar. Cartesia Ink-2 aynı iş için 4 dolar, ElevenLabs Scribe v2 Realtime ve Deepgram Flux 6,5 dolar istiyor. Bu, Muse Spark 1.1 ve 1.2'de görülen kalıbın devamı: Meta zirve başarımda değil fiyatta yarışıyor.
Şirket modelin parametre sayısını, eğitim verisi hacmini ve ses verisinin kaynaklarını açıklamıyor; ağırlıkları da yayımlamıyor.
Asıl mesele: sürekli dinleyen asistan
Meta duyuruyu doğrudan Mark Zuckerberg'in "kişisel süper zeka" vizyonuna bağlıyor. Kurgulanmış tanıtımda çalışanlar, güvenilir konuşma tanımanın yapay zeka gözlükleri üzerinden gerçek konuşmaları dinleyen kişisel ajanların temeli olduğunu savunuyor.
Cümlenin kendisi soruyu da kuruyor: 20 konuşmacıyı ayırt edebilen, saatlerce kesintisiz çalışan ve saati 0,18 dolara mal olan bir model, teknik bir başarı olduğu kadar bir gözetim altyapısı. Modelin ayırt ettiği konuşmacılardan biri rıza vermemiş olabilir — odadaki herkes gözlüğü takan kişi değil. Almanya'da Meta'nın kameralı gözlüklerinin yasaklanması yakın zamanda tartışılmış, Federal Ağ Ajansı takip etmeme kararı vermişti.
Erişim
Muse Voice Transcribe şu anda Meta AI ve Muse Code içindeki sesli dikteyi besliyor ve Meta Model API üzerinden erişilebiliyor. Kullanıcılar herhangi bir uygulamada "Fn" tuşunu basılı tutarak deneyebiliyor.