Blog

Lo que dice el caso de estudio de DeepMind sobre Cue, y lo que no

Google DeepMind publicó un caso de estudio sobre Cue en 2026: qué midió, qué se ejecuta dónde, cómo lo citamos y las afirmaciones que no respalda.

Publicado el

El caso de estudio de Google DeepMind sobre Cue es la única prueba externa sobre un producto nuestro, por lo que se cita, tanto por nosotros como por otros. Esta entrada expone lo que dice la página, para que las citas puedan comprobarse con ella. La página se encuentra en deepmind.google/models/gemma/gemmaverse/cue-ai; sus cifras están marcadas como actuales a fecha de mayo de 2026.

Qué midió

  • La latencia media del paso de pulido del dictado de Cue se redujo de 876 ms a 488 ms después de que el paso se trasladara de un modelo en la nube a Gemma 4 E4B ejecutándose localmente a través de Ollama. La página lo califica de una reducción del 44 por ciento.
  • La medición se realizó en Apple Silicon (serie M) a través de Ollama, sobre un benchmark de 227 muestras de voz reales que cubrían entradas en inglés y en varios idiomas.
  • El dictado por usuario aumentó aproximadamente un 30 por ciento, medido entre los usuarios activos de la beta en las cuatro semanas anteriores y posteriores a que el modelo local se convirtiera en el predeterminado.
  • El coste marginal de inferencia del paso de pulido se redujo a cero, lo que la página indica como la razón por la que el dictado es ilimitado en todos los niveles, incluido el gratuito.

Qué se ejecuta y dónde, según la página

  • El usuario mantiene pulsado un atajo de teclado y habla. Un servicio de conversión de voz a texto en la nube transcribe el audio a texto sin formato.
  • El texto sin formato se envía a Gemma 4, que se ejecuta localmente en el equipo del usuario a través de Ollama, con una indicación de sistema de unos 400 tokens que restaura la puntuación, segmenta las frases y elimina las muletillas.
  • Si Ollama no se está ejecutando, la aplicación de escritorio lo detecta al iniciarse y dirige el paso de pulido a un modelo en la nube.
  • El modo agente de Cue depende de un modelo en la nube. La página informa de las primeras evaluaciones de la llamada de funciones de Gemma 4 para tareas autónomas y las describe como tempranas.

Así que «local» en esa página significa un paso de una función. La transcripción está en la nube; el agente está en la nube; el pulido es local por defecto con un respaldo en la nube.

Cómo lo citamos

La página de inicio utiliza dos cifras del estudio: de 876 ms a 488 ms, y la frase de que Cue es «a voice-activated AI agent that lives on the user's desktop.». Ambas aparecen en la página con esas palabras. La página de inicio también muestra un fragmento de 45 segundos de una charla del equipo de Gemma en la que el ponente dice que la participación aumentó un 30 por ciento; el caso de estudio escrito dice uso de la función. Publicamos la cifra escrita y anotamos la diferencia junto al fragmento.

Lo que no respalda

  • No es una reseña de producto y no hace ninguna afirmación sobre la precisión de la transcripción o el éxito de las tareas del agente.
  • El benchmark de 227 muestras que describe es privado de Cue y no se ha publicado. Nuestro conjunto de datos público, el Voice Agent Benchmark Landscape, es algo distinto: un mapa de los benchmarks públicos de otras personas, sin puntuaciones.
  • Sus cifras están fechadas en mayo de 2026. Una versión de Cue publicada después de esa fecha no está descrita en la página.

La página de cifras registra cómo se utiliza la cifra de latencia en la página de inicio, y la página de pruebas enumera el caso de estudio junto a todo lo demás que se ha publicado sobre nuestros productos.

Todas las entradas