Cue에 대한 Google DeepMind의 사례 연구는 저희 제품에 대한 유일한 외부 증거이므로 저희와 다른 이들이 인용합니다. 이 게시물은 해당 페이지의 내용을 설명하여 인용문을 확인할 수 있도록 합니다. 페이지 주소는 deepmind.google/models/gemma/gemmaverse/cue-ai이며, 수치는 2026년 5월 기준으로 최신 정보임이 명시되어 있습니다.
측정 항목
- Cue의 받아쓰기 다듬기 단계의 중앙값 지연 시간은 해당 단계가 클라우드 모델에서 Ollama를 통해 로컬로 실행되는 Gemma 4 E4B로 전환된 후 876ms에서 488ms로 감소했습니다. 해당 페이지에서는 이를 44% 감소라고 부릅니다.
- 측정은 Apple Silicon(M-시리즈)에서 Ollama를 통해 영어 및 혼합 언어 입력을 포함하는 227개의 실제 음성 샘플 벤치마크를 대상으로 수행되었습니다.
- 로컬 모델이 기본값이 되기 전후 4주 동안의 활성 베타 사용자를 대상으로 측정한 결과, 사용자당 받아쓰기 사용량은 약 30% 증가했습니다.
- 다듬기 단계의 한계 추론 비용은 0으로 떨어졌으며, 해당 페이지에서는 이것이 무료 요금제를 포함한 모든 요금제에서 받아쓰기가 무제한인 이유라고 설명합니다.
페이지에 따른 실행 위치
- 사용자가 단축키를 누르고 말합니다. 오디오는 클라우드 음성-텍스트 변환 서비스에 의해 원시 텍스트로 변환됩니다.
- 원시 텍스트는 Ollama를 통해 사용자 기기에서 로컬로 실행되는 Gemma 4로 전송되며, 약 400토큰의 시스템 프롬프트를 통해 구두점을 복원하고, 문장을 분할하며, 필러 단어를 제거합니다.
- Ollama가 실행되고 있지 않으면 데스크톱 앱이 시작 시 이를 감지하고 다듬기 단계를 클라우드 모델로 라우팅합니다.
- Cue의 에이전트 모드는 클라우드 모델에 의존합니다. 해당 페이지는 독립형 작업에 대한 Gemma 4의 함수 호출 초기 평가를 보고하며, 이를 초기 단계라고 설명합니다.
그래서 그 페이지의 “local”은 한 기능의 한 단계를 의미합니다. 녹취록은 클라우드이고, 에이전트는 클라우드이며, 다듬기는 기본적으로 로컬이지만 클라우드 폴백이 있습니다.
저희가 인용하는 방식
홈페이지는 거기서 두 가지 수치를 사용합니다. 876ms에서 488ms로 줄어든 것과, Cue가 “a voice-activated AI agent that lives on the user's desktop.”라는 문장입니다. 둘 다 그 페이지에 있는 그대로의 표현입니다. 홈페이지에는 Gemma 팀 발표의 45초짜리 부분도 나오는데, 여기서는 발표자가 참여도가 30% 증가했다고 말합니다. 서면 사례 연구에는 기능 사용량이라고 되어 있습니다. 저희는 서면 수치를 싣고 해당 부분 옆에 차이점을 명시합니다.
이 연구가 뒷받침하지 않는 것
- 이것은 제품 리뷰가 아니며 텍스트 변환 정확도나 에이전트 작업 성공률에 대해 어떠한 주장도 하지 않습니다.
- 여기에 기술된 227개 샘플 벤치마크는 Cue의 비공개 자료이며 공개되지 않았습니다. 저희의 공개 데이터 세트인 Voice Agent Benchmark Landscape는 다른 것으로, 점수 없이 다른 사람들의 공개 벤치마크를 모아놓은 지도입니다.
- 수치는 2026년 5월 기준입니다. 그 날짜 이후에 출시된 Cue 버전은 이 페이지에서 설명되지 않습니다.
수치 페이지는 홈페이지에서 지연 시간 수치가 어떻게 사용되는지 기록하고, 증거 페이지는 저희 제품에 대해 발표된 다른 모든 자료와 함께 이 사례 연구를 리스팅합니다.