O estudo de caso do Google DeepMind sobre o Cue é a única evidência externa sobre um produto nosso, então ele é citado, por nós e por outros. Esta postagem expõe o que a página diz, para que as citações possam ser verificadas. A página está em deepmind.google/models/gemma/gemmaverse/cue-ai; suas cifras são marcadas como atuais em maio de 2026.
O que foi medido
- A latência mediana da etapa de refinamento de ditado do Cue caiu de 876 ms para 488 ms depois que a etapa passou de um modelo na nuvem para o Gemma 4 E4B rodando localmente através do Ollama. A página chama isso de uma redução de 44 por cento.
- A medição foi feita em Apple Silicon (série M) via Ollama, sobre um benchmark de 227 amostras de voz reais cobrindo inglês e entrada em múltiplos idiomas.
- O ditado por usuário aumentou cerca de 30 por cento, medido entre usuários beta ativos nas quatro semanas antes e depois que o modelo local se tornou o padrão.
- O custo marginal de inferência da etapa de refinamento caiu para zero, o que a página apresenta como o motivo pelo qual o ditado é ilimitado em todos os planos, incluindo o gratuito.
O que roda onde, segundo a página
- O usuário pressiona um atalho de teclado e fala. O áudio é transcrito para texto bruto por um serviço de conversão de fala em texto na nuvem.
- O texto bruto é enviado ao Gemma 4, rodando localmente na máquina do usuário através do Ollama, com um prompt de sistema de cerca de 400 tokens que restaura a pontuação, segmenta as frases e remove palavras de preenchimento.
- Se o Ollama não estiver rodando, o aplicativo de desktop detecta isso na inicialização e direciona a etapa de refinamento para um modelo na nuvem.
- O modo agente do Cue depende de um modelo na nuvem. A página relata avaliações iniciais da chamada de função do Gemma 4 para tarefas autocontidas e as descreve como iniciais.
Portanto, “local” naquela página significa uma etapa de um recurso. A transcrição é na nuvem; o agente é na nuvem; o refinamento é local por padrão, com um fallback para a nuvem.
Como o citamos
A página inicial usa duas cifras dele: 488 ms, uma redução de 876 ms, e a frase de que o Cue é “a voice-activated AI agent that lives on the user's desktop.” Ambas estão na página com essas palavras. A página inicial também mostra um segmento de 45 segundos de uma palestra da equipe do Gemma em que o palestrante diz que o engajamento aumentou 30 por cento; o estudo de caso escrito diz uso do recurso. Nós imprimimos a cifra escrita e observamos a diferença ao lado do segmento.
O que ele não sustenta
- Não é uma avaliação de produto e não faz nenhuma afirmação sobre a precisão da transcrição ou o sucesso das tarefas do agente.
- O benchmark de 227 amostras que ele descreve é privado do Cue e não é publicado. Nosso conjunto de dados público, o Voice Agent Benchmark Landscape, é uma coisa diferente: um mapa dos benchmarks públicos de outras pessoas, sem pontuações.
- Suas cifras são de maio de 2026. Uma versão do Cue lançada após essa data não é descrita pela página.
A página de cifras registra como o número de latência é usado na página inicial, e a página de evidências lista o estudo de caso ao lado de tudo o mais que foi publicado sobre nossos produtos.