Blog

Local por defecto, la nube como alternativa: cómo el paso de pulido de Cue acabó en el equipo del usuario

El paso de pulido del dictado de Cue se diseñó para la nube, con una alternativa local. Un benchmark de 227 muestras invirtió el orden. Lo que el caso de estudio registra sobre la decisión.

Publicado el

El dictado de Cue tiene un paso de pulido: la transcripción en bruto, con sus muletillas y su puntuación ausente, se convierte en un texto que se lee como el hablante pretendía. Dónde se ejecuta ese paso se decidió mediante una medición, y la medición es pública. Esta entrada sigue el caso de estudio de Google DeepMind, con cifras actuales a mayo de 2026, y no añade nada que la página no declare.

El diseño original

El paso se creó para usar un modelo en la nube, con un modelo local como alternativa, bajo la suposición de que un modelo más grande puliría con más precisión. El objetivo declarado del equipo para el paso era un texto que se leyera como el usuario en lugar de como un modelo: puntuación restaurada, frases segmentadas, muletillas eliminadas, sin imponer un estilo de la casa.

La medición

El equipo evaluó el paso en un benchmark de 227 muestras de voz reales que cubrían inglés, otros idiomas y entradas en varios idiomas. En ese benchmark, Gemma 4 E4B, ejecutándose localmente a través de Ollama en Apple Silicon, fue elegido como el modelo de primera opción. La latencia mediana del paso de pulido cayó de 876 ms a 488 ms, lo que la página describe como dentro del presupuesto que el equipo había fijado para un paso que debe sentirse más rápido que escribir.

La inversión

Después del benchmark, la arquitectura se invirtió: el modelo local se convirtió en el predeterminado y el modelo en la nube en la alternativa. La aplicación de escritorio comprueba al iniciarse si Ollama se está ejecutando; si no es así, el paso de pulido se dirige a un modelo en la nube y el dictado continúa.

Lo que cambió para los usuarios, según la página

  • El dictado por usuario aumentó aproximadamente un 30 por ciento entre los usuarios activos de la beta en las cuatro semanas antes y después del cambio; los usuarios que habían dictado mensajes cortos comenzaron a dictar otros más largos.
  • El coste marginal de inferencia del paso se redujo a cero, y la página da esa como la razón por la que el dictado es ilimitado en todos los planes, incluido el gratuito.

El límite de la afirmación

Solo se movió el paso de pulido. La transcripción la realiza un servicio de voz a texto en la nube antes del paso de pulido, y el modo agente de Cue depende de un modelo en la nube. La página informa de evaluaciones tempranas de la llamada de funciones de Gemma 4 para tareas de agente autónomas y las califica de tempranas. Por lo tanto, nuestra página de inicio dice que el pulido se ejecuta en el equipo del usuario y no dice nada sobre que el agente se ejecute localmente; la página de plataformas registra el mismo límite.

Todas las entradas