Google DeepMind’ın Cue hakkındaki vaka çalışması, bir ürünümüzle ilgili dışarıdan gelen tek kanıttır, bu yüzden hem biz hem de başkaları tarafından alıntılanır. Bu yazı, sayfanın ne söylediğini ortaya koyar, böylece alıntılar onunla karşılaştırılarak kontrol edilebilir. Sayfanın adresi deepmind.google/models/gemma/gemmaverse/cue-ai’dir; rakamları Mayıs 2026 itibarıyla güncel olarak işaretlenmiştir.
Ne ölçüldü
- Cue’nun dikte düzeltme adımının median gecikmesi, adım bir bulut modelinden Ollama aracılığıyla yerel olarak çalışan Gemma 4 E4B’ye taşındıktan sonra 876 ms’den 488 ms’ye düştü. Sayfa bunu yüzde 44’lük bir azalma olarak adlandırıyor.
- Ölçüm, İngilizce ve karışık dilli girdiyi kapsayan 227 gerçek ses örneğinden oluşan bir benchmark üzerinde, Ollama aracılığıyla Apple Silicon (M serisi) üzerinde yapıldı.
- Kullanıcı başına dikte, yerel modelin varsayılan hale gelmesinden önceki ve sonraki dört hafta boyunca aktif beta kullanıcıları arasında ölçüldüğünde yaklaşık yüzde 30 arttı.
- Düzeltme adımının marjinal çıkarım maliyeti sıfıra düştü; sayfa bunu, diktenin ücretsiz olan da dahil olmak üzere her katmanda sınırsız olmasının nedeni olarak gösteriyor.
Sayfaya göre ne nerede çalışıyor
- Kullanıcı bir kısayol tuşuna basılı tutar ve konuşur. Ses, bir bulut konuşmadan metne hizmeti tarafından ham metne dönüştürülür.
- Ham metin, noktalama işaretlerini geri getiren, cümleleri bölen ve dolgu kelimeleri kaldıran yaklaşık 400 token’lık bir sistem istemi ile, kullanıcının makinesinde Ollama aracılığıyla yerel olarak çalışan Gemma 4’e gönderilir.
- Ollama çalışmıyorsa masaüstü uygulaması bunu başlangıçta algılar ve düzeltme adımını bir bulut modeline yönlendirir.
- Cue’nun ajan modu bir bulut modeline dayanır. Sayfa, Gemma 4’ün bağımsız görevler için fonksiyon çağırma özelliğine ilişkin ilk değerlendirmeleri rapor eder ve bunları erken olarak nitelendirir.
Yani o sayfadaki “local”, tek bir özelliğin tek bir adımı anlamına gelir. Transkripsiyon bulut tabanlıdır; ajan bulut tabanlıdır; düzeltme ise varsayılan olarak yereldir ve bir bulut yedeği bulunur.
Nasıl alıntı yapıyoruz
Ana sayfa buradan iki rakam kullanır: 876 ms’den 488 ms’ye düşüş ve Cue’nun “a voice-activated AI agent that lives on the user's desktop.” olduğu cümlesi. Her ikisi de sayfada bu ifadelerle yer almaktadır. Ana sayfa ayrıca, bir Gemma ekibi konuşmasının, konuşmacının etkileşimin yüzde 30 arttığını söylediği 45 saniyelik bir bölümünü gösterir; yazılı vaka çalışması ise özellik kullanımından bahseder. Yazılı rakamı yayımlıyor ve bölümün yanında farkı belirtiyoruz.
Neleri desteklemiyor
- Bu bir ürün yorumu değildir ve transkripsiyon doğruluğu veya ajan görev başarısı hakkında hiçbir iddiada bulunmaz.
- Tanımladığı 227 örnekli benchmark, Cue’ya özeldir ve yayımlanmamıştır. Herkese açık veri setimiz olan Voice Agent Benchmark Landscape farklı bir şeydir: başkalarının herkese açık benchmark’larının bir haritasıdır ve skor içermez.
- Rakamları Mayıs 2026 tarihlidir. Bu tarihten sonra yayımlanan bir Cue sürümü sayfa tarafından açıklanmamaktadır.
Rakamlar sayfası, gecikme rakamının ana sayfada nasıl kullanıldığını kaydeder ve kanıt sayfası, vaka çalışmasını ürünlerimiz hakkında yayımlanmış diğer her şeyin yanında listeler.