Blog

Ce que l’étude de cas de DeepMind dit sur Cue, et ce qu’elle ne dit pas

Google DeepMind a publié une étude de cas sur Cue en 2026 : ce qu’elle a mesuré, ce qui s’exécute où, comment nous la citons, et les affirmations qu’elle ne soutient pas.

Publié le

L’étude de cas de Google DeepMind sur Cue est la seule preuve extérieure concernant un de nos produits, elle est donc citée, par nous et par d’autres. Cet article expose ce que la page dit, afin que les citations puissent être vérifiées. La page se trouve à deepmind.google/models/gemma/gemmaverse/cue-ai ; ses chiffres sont indiqués comme actuels en mai 2026.

Ce qui a été mesuré

  • La latence médiane de l’étape de peaufinage de la dictée de Cue a chuté de 876 ms à 488 ms après que l’étape est passée d’un modèle en nuage à Gemma 4 E4B s’exécutant localement via Ollama. La page qualifie cela de réduction de 44 pour cent.
  • La mesure a été effectuée sur Apple Silicon (série M) via Ollama, sur un benchmark de 227 échantillons vocaux réels couvrant l’anglais et des entrées en plusieurs langues.
  • La dictée par utilisateur a augmenté d’environ 30 pour cent, mesurée sur les utilisateurs bêta actifs dans les quatre semaines avant et après que le modèle local est devenu celui par défaut.
  • Le coût marginal d’inférence de l’étape de peaufinage est tombé à zéro, ce que la page donne comme raison pour laquelle la dictée est illimitée dans chaque forfait, y compris le gratuit.

Ce qui s’exécute où, selon la page

  • L’utilisateur maintient un raccourci clavier et parle. L’audio est transcrit en texte brut par un service de reconnaissance vocale dans le cloud.
  • Le texte brut est envoyé à Gemma 4, qui s’exécute localement sur la machine de l’utilisateur via Ollama, avec une invite système d’environ 400 jetons qui restaure la ponctuation, segmente les phrases et supprime les mots de remplissage.
  • Si Ollama ne s’exécute pas, l’application de bureau le détecte au démarrage et dirige l’étape de peaufinage vers un modèle dans le cloud.
  • Le mode agent de Cue repose sur un modèle dans le cloud. La page rapporte les premières évaluations de l’appel de fonction de Gemma 4 pour des tâches autonomes et les décrit comme préliminaires.

Ainsi, « local » sur cette page signifie une étape d’une fonctionnalité. La transcription est dans le cloud ; l’agent est dans le cloud ; le peaufinage est local par défaut avec une solution de repli dans le cloud.

Comment nous le citons

La page d’accueil en utilise deux chiffres : 488 ms au lieu de 876 ms, et la phrase selon laquelle Cue est « a voice-activated AI agent that lives on the user's desktop. » Les deux se trouvent sur la page dans ces termes. La page d’accueil montre également un segment de 45 secondes d’une présentation de l’équipe Gemma dans lequel l’orateur dit que l’engagement a augmenté de 30 pour cent ; l’étude de cas écrite mentionne l’utilisation des fonctionnalités. Nous publions le chiffre écrit et notons la différence à côté du segment.

Ce qu’elle ne soutient pas

  • Ce n’est pas un avis sur un produit et elle ne contient aucune affirmation sur la précision de la transcription ou la réussite des tâches de l’agent.
  • Le benchmark de 227 échantillons qu’elle décrit est privé à Cue et n’est pas publié. Notre ensemble de données public, le Voice Agent Benchmark Landscape, est une chose différente : une carte des benchmarks publics d’autres personnes, sans notes.
  • Ses chiffres sont datés de mai 2026. Une version de Cue publiée après cette date n’est pas décrite par la page.

La page des chiffres enregistre comment le chiffre de latence est utilisé sur la page d’accueil, et la page des preuves liste l’étude de cas à côté de tout ce qui a été publié sur nos produits.

Tous les billets