El dictado de Cue tiene un paso de pulido: la transcripción en bruto, con sus muletillas y su puntuación ausente, se convierte en un texto que se lee como el hablante pretendía. Dónde se ejecuta ese paso se decidió mediante una medición, y la medición es pública. Esta entrada sigue el caso de estudio de Google DeepMind, con cifras actuales a mayo de 2026, y no añade nada que la página no declare.
El diseño original
El paso se creó para usar un modelo en la nube, con un modelo local como alternativa, bajo la suposición de que un modelo más grande puliría con más precisión. El objetivo declarado del equipo para el paso era un texto que se leyera como el usuario en lugar de como un modelo: puntuación restaurada, frases segmentadas, muletillas eliminadas, sin imponer un estilo de la casa.
La medición
El equipo evaluó el paso en un benchmark de 227 muestras de voz reales que cubrían inglés, otros idiomas y entradas en varios idiomas. En ese benchmark, Gemma 4 E4B, ejecutándose localmente a través de Ollama en Apple Silicon, fue elegido como el modelo de primera opción. La latencia mediana del paso de pulido cayó de 876 ms a 488 ms, lo que la página describe como dentro del presupuesto que el equipo había fijado para un paso que debe sentirse más rápido que escribir.
La inversión
Después del benchmark, la arquitectura se invirtió: el modelo local se convirtió en el predeterminado y el modelo en la nube en la alternativa. La aplicación de escritorio comprueba al iniciarse si Ollama se está ejecutando; si no es así, el paso de pulido se dirige a un modelo en la nube y el dictado continúa.
Lo que cambió para los usuarios, según la página
- El dictado por usuario aumentó aproximadamente un 30 por ciento entre los usuarios activos de la beta en las cuatro semanas antes y después del cambio; los usuarios que habían dictado mensajes cortos comenzaron a dictar otros más largos.
- El coste marginal de inferencia del paso se redujo a cero, y la página da esa como la razón por la que el dictado es ilimitado en todos los planes, incluido el gratuito.
El límite de la afirmación
Solo se movió el paso de pulido. La transcripción la realiza un servicio de voz a texto en la nube antes del paso de pulido, y el modo agente de Cue depende de un modelo en la nube. La página informa de evaluaciones tempranas de la llamada de funciones de Gemma 4 para tareas de agente autónomas y las califica de tempranas. Por lo tanto, nuestra página de inicio dice que el pulido se ejecuta en el equipo del usuario y no dice nada sobre que el agente se ejecute localmente; la página de plataformas registra el mismo límite.