Blog

Local par défaut, cloud en repli : comment l’étape de peaufinage de Cue a fini sur la machine de l’utilisateur

L’étape de peaufinage de la dictée de Cue a été conçue pour le cloud, avec un repli local. Un benchmark de 227 échantillons a inversé cette décision. Ce que l’étude de cas rapporte sur la décision.

Publié le

La dictée de Cue a une étape de peaufinage : la transcription brute, avec ses mots de remplissage et sa ponctuation manquante, est transformée en un texte qui se lit comme l’orateur l’entendait. L’endroit où cette étape s’exécute a été décidé par une mesure, et cette mesure est publique. Cet article suit l’étude de cas de Google DeepMind, avec des chiffres à jour en mai 2026, et n’ajoute rien que la page ne mentionne pas.

La conception originale

L’étape a été conçue pour utiliser un modèle cloud, avec un modèle local en repli, en supposant qu’un modèle plus grand peaufinerait avec plus de précision. L’objectif déclaré de l’équipe pour cette étape était un texte qui ressemble à l’utilisateur plutôt qu’à un modèle : ponctuation restaurée, phrases segmentées, mots de remplissage supprimés, sans imposer un style maison.

La mesure

L’équipe a réalisé un benchmark de l’étape sur 227 échantillons vocaux réels couvrant l’anglais, d’autres langues et des entrées multilingues. Sur ce benchmark, Gemma 4 E4B, exécuté localement via Ollama sur Apple Silicon, a été choisi comme modèle de premier choix. La latence médiane de l’étape de peaufinage est passée de 876 ms à 488 ms, ce que la page décrit comme étant dans le budget que l’équipe avait fixé pour une étape qui doit sembler plus rapide que la frappe.

L’inversion

Après le benchmark, l’architecture a été inversée : le modèle local est devenu le défaut et le modèle cloud le repli. L’application de bureau vérifie au démarrage si Ollama est en cours d’exécution ; si ce n’est pas le cas, l’étape de peaufinage est acheminée vers un modèle cloud et la dictée continue.

Ce qui a changé pour les utilisateurs, d’après la page

  • La dictée par utilisateur a augmenté d’environ 30 pour cent chez les utilisateurs actifs de la bêta dans les quatre semaines avant et après le changement ; les utilisateurs qui avaient dicté des messages courts ont commencé à en dicter de plus longs.
  • Le coût d’inférence marginal de l’étape est tombé à zéro, et la page donne cela comme la raison pour laquelle la dictée est illimitée dans chaque forfait, y compris le gratuit.

La limite de l’affirmation

Seule l’étape de peaufinage a été déplacée. La transcription est effectuée par un service de reconnaissance vocale cloud avant l’étape de peaufinage, et le mode agent de Cue repose sur un modèle cloud. La page rapporte les premières évaluations de l’appel de fonction de Gemma 4 pour des tâches d’agent autonomes et les qualifie de précoces. Notre page d’accueil indique donc que le peaufinage s’exécute sur la machine de l’utilisateur et ne dit rien sur l’exécution locale de l’agent ; la page des plateformes consigne la même limite.

Tous les billets