Dikte Cue memiliki langkah penyempurnaan: transkrip mentah, dengan kata-kata pengisi dan tanda baca yang hilang, diubah menjadi teks yang terbaca sesuai maksud penutur. Tempat langkah itu berjalan ditentukan oleh sebuah pengukuran, dan pengukuran itu bersifat publik. Pos ini mengikuti studi kasus Google DeepMind, dengan angka-angka terbaru per Mei 2026, dan tidak menambahkan apa pun yang tidak dinyatakan di halaman tersebut.
Desain awal
Langkah ini dibuat untuk menggunakan model cloud, dengan model lokal sebagai cadangan, dengan asumsi bahwa model yang lebih besar akan melakukan penyempurnaan dengan lebih akurat. Tujuan yang dinyatakan tim untuk langkah ini adalah teks yang terbaca seperti pengguna, bukan seperti model: tanda baca dipulihkan, kalimat disegmentasi, kata-kata pengisi dihapus, tanpa memaksakan gaya internal.
Pengukuran
Tim melakukan benchmark pada langkah tersebut dengan 227 sampel suara nyata yang mencakup bahasa Inggris, bahasa lain, dan masukan multibahasa. Pada benchmark tersebut, Gemma 4 E4B, yang berjalan secara lokal melalui Ollama di Apple Silicon, dipilih sebagai model pilihan pertama. Latensi median dari langkah penyempurnaan turun dari 876 md menjadi 488 md, yang oleh halaman tersebut digambarkan berada dalam anggaran yang telah ditetapkan tim untuk sebuah langkah yang harus terasa lebih cepat daripada mengetik.
Pembalikan
Setelah benchmark, arsitekturnya dibalik: model lokal menjadi default dan model cloud menjadi cadangan. Aplikasi desktop memeriksa saat startup apakah Ollama berjalan; jika tidak, langkah penyempurnaan dialihkan ke model cloud dan dikte berlanjut.
Apa yang berubah bagi pengguna, menurut halaman tersebut
- Dikte per pengguna naik sekitar 30 persen di antara pengguna beta aktif dalam empat minggu sebelum dan sesudah peralihan; pengguna yang sebelumnya mendiktekan pesan singkat mulai mendiktekan pesan yang lebih panjang.
- Biaya inferensi marjinal dari langkah tersebut turun menjadi nol, dan halaman tersebut menyebutkan itu sebagai alasan dikte tidak terbatas pada setiap tingkatan, termasuk yang gratis.
Batasan klaim
Hanya langkah penyempurnaan yang dipindahkan. Transkripsi dilakukan oleh layanan speech-to-text cloud sebelum langkah penyempurnaan, dan mode agen Cue bergantung pada model cloud. Halaman tersebut melaporkan evaluasi awal dari pemanggilan fungsi Gemma 4 untuk tugas agen mandiri dan menyebutnya sebagai evaluasi awal. Oleh karena itu, halaman beranda kami menyatakan bahwa penyempurnaan berjalan di mesin pengguna dan tidak mengatakan apa pun tentang agen yang berjalan secara lokal; halaman platform mencatat batasan yang sama.