Blog

O que o estudo de caso do DeepMind diz sobre o Cue, e o que não diz

O Google DeepMind publicou um estudo de caso sobre o Cue em 2026: o que ele mediu, o que roda onde, como o citamos e as afirmações que ele não sustenta.

Publicado em

O estudo de caso do Google DeepMind sobre o Cue é a única evidência externa sobre um produto nosso, então ele é citado, por nós e por outros. Esta postagem expõe o que a página diz, para que as citações possam ser verificadas. A página está em deepmind.google/models/gemma/gemmaverse/cue-ai; suas cifras são marcadas como atuais em maio de 2026.

O que foi medido

  • A latência mediana da etapa de refinamento de ditado do Cue caiu de 876 ms para 488 ms depois que a etapa passou de um modelo na nuvem para o Gemma 4 E4B rodando localmente através do Ollama. A página chama isso de uma redução de 44 por cento.
  • A medição foi feita em Apple Silicon (série M) via Ollama, sobre um benchmark de 227 amostras de voz reais cobrindo inglês e entrada em múltiplos idiomas.
  • O ditado por usuário aumentou cerca de 30 por cento, medido entre usuários beta ativos nas quatro semanas antes e depois que o modelo local se tornou o padrão.
  • O custo marginal de inferência da etapa de refinamento caiu para zero, o que a página apresenta como o motivo pelo qual o ditado é ilimitado em todos os planos, incluindo o gratuito.

O que roda onde, segundo a página

  • O usuário pressiona um atalho de teclado e fala. O áudio é transcrito para texto bruto por um serviço de conversão de fala em texto na nuvem.
  • O texto bruto é enviado ao Gemma 4, rodando localmente na máquina do usuário através do Ollama, com um prompt de sistema de cerca de 400 tokens que restaura a pontuação, segmenta as frases e remove palavras de preenchimento.
  • Se o Ollama não estiver rodando, o aplicativo de desktop detecta isso na inicialização e direciona a etapa de refinamento para um modelo na nuvem.
  • O modo agente do Cue depende de um modelo na nuvem. A página relata avaliações iniciais da chamada de função do Gemma 4 para tarefas autocontidas e as descreve como iniciais.

Portanto, “local” naquela página significa uma etapa de um recurso. A transcrição é na nuvem; o agente é na nuvem; o refinamento é local por padrão, com um fallback para a nuvem.

Como o citamos

A página inicial usa duas cifras dele: 488 ms, uma redução de 876 ms, e a frase de que o Cue é “a voice-activated AI agent that lives on the user's desktop.” Ambas estão na página com essas palavras. A página inicial também mostra um segmento de 45 segundos de uma palestra da equipe do Gemma em que o palestrante diz que o engajamento aumentou 30 por cento; o estudo de caso escrito diz uso do recurso. Nós imprimimos a cifra escrita e observamos a diferença ao lado do segmento.

O que ele não sustenta

  • Não é uma avaliação de produto e não faz nenhuma afirmação sobre a precisão da transcrição ou o sucesso das tarefas do agente.
  • O benchmark de 227 amostras que ele descreve é privado do Cue e não é publicado. Nosso conjunto de dados público, o Voice Agent Benchmark Landscape, é uma coisa diferente: um mapa dos benchmarks públicos de outras pessoas, sem pontuações.
  • Suas cifras são de maio de 2026. Uma versão do Cue lançada após essa data não é descrita pela página.

A página de cifras registra como o número de latência é usado na página inicial, e a página de evidências lista o estudo de caso ao lado de tudo o mais que foi publicado sobre nossos produtos.

Todos os posts