Blog

Local por padrão, nuvem como alternativa: como a etapa de refinamento do Cue foi parar na máquina do usuário

A etapa de refinamento do ditado do Cue foi projetada para a nuvem, com uma alternativa local. Um benchmark de 227 amostras inverteu isso. O que o estudo de caso registra sobre a decisão.

Publicado em

O ditado do Cue tem uma etapa de refinamento: a transcrição bruta, com suas palavras de preenchimento e pontuação ausente, é transformada em um texto que se lê como o falante pretendia. Onde essa etapa é executada foi decidido por uma medição, e a medição é pública. Esta postagem segue o estudo de caso do Google DeepMind, com cifras atuais de maio de 2026, e não acrescenta nada que a página não declare.

O projeto original

A etapa foi construída para usar um modelo de nuvem, com um modelo local como alternativa, na suposição de que um modelo maior faria o refinamento com mais precisão. O objetivo declarado da equipe para a etapa era um texto que soasse como o usuário, e não como um modelo: pontuação restaurada, frases segmentadas, preenchimentos removidos, sem impor um estilo da casa.

A medição

A equipe fez um benchmark da etapa com 227 amostras de voz reais, cobrindo inglês, outros idiomas e entradas em vários idiomas. Nesse benchmark, o Gemma 4 E4B, rodando localmente através do Ollama no Apple Silicon, foi escolhido como o modelo de primeira opção. A latência mediana da etapa de refinamento caiu de 876 ms para 488 ms, o que a página descreve como dentro do orçamento que a equipe havia estabelecido para uma etapa que precisa parecer mais rápida do que digitar.

A inversão

Após o benchmark, a arquitetura foi invertida: o modelo local tornou-se o padrão e o modelo de nuvem, a alternativa. O aplicativo de desktop verifica na inicialização se o Ollama está em execução; se não estiver, a etapa de refinamento é direcionada para um modelo de nuvem e o ditado continua.

O que mudou para os usuários, segundo a página

  • O ditado por usuário aumentou cerca de 30% entre os usuários beta ativos nas quatro semanas antes e depois da mudança; usuários que ditavam mensagens curtas começaram a ditar mensagens mais longas.
  • O custo marginal de inferência da etapa caiu para zero, e a página aponta isso como o motivo pelo qual o ditado é ilimitado em todos os planos, incluindo o gratuito.

O limite da afirmação

Apenas a etapa de refinamento mudou. A transcrição é feita por um serviço de conversão de fala em texto na nuvem antes da etapa de refinamento, e o modo agente do Cue depende de um modelo de nuvem. A página relata avaliações iniciais da chamada de função do Gemma 4 para tarefas de agente autocontidas e as chama de iniciais. Nossa página inicial, portanto, diz que o refinamento roda na máquina do usuário e não diz nada sobre o agente rodar localmente; a página de plataformas registra o mesmo limite.

Todos os posts