Google DeepMind 关于 Cue 的案例研究是唯一一份关于我们产品的外部证据,因此它被我们和他人引用。本文旨在阐明该页面所述内容,以便核对引文。该页面地址为 deepmind.google/models/gemma/gemmaverse/cue-ai;其数据标注为截至 2026 年 5 月的最新数据。
它测量了什么
- 在将处理步骤从云端模型迁移到通过 Ollama 本地运行的 Gemma 4 E4B 后,Cue 的听写润色步骤的延迟中位数从 876 ms 降至 488 ms。该页面称之为 44% 的降幅。
- 该测量是在 Apple Silicon (M 系列) 上通过 Ollama 进行的,基于一个包含 227 个真实语音样本的基准测试,涵盖英语和混合语言输入。
- 在本地模型成为默认选项前后的四个星期内,活跃测试用户的平均听写使用量增加了约 30%。
- 润色步骤的边际推理成本降至零,该页面指出,这就是包括免费版在内的所有套餐都提供无限听写功能的原因。
根据该页面,什么在哪里运行
- 用户按住一个快捷键并说话。音频由云端语音转文本服务转写为原始文本。
- 原始文本被发送到通过 Ollama 在用户机器上本地运行的 Gemma 4,并附带一个约 400 个词元的系统提示,用于恢复标点、分句和移除填充词。
- 如果 Ollama 未在运行,桌面应用程序会在启动时检测到此情况,并将润色步骤路由到云端模型。
- Cue 的智能体模式依赖于云端模型。该页面报告了对 Gemma 4 用于独立任务的函数调用能力的早期评估,并称其为早期阶段。
所以,那个页面上的“local”意思是一个功能里的一个步骤。转写在云端进行,智能体在云端运行,润色默认在本地进行,并有云端备选方案。
我们如何引用它
主页引用了其中的两个数据:延迟从 876 ms 降至 488 ms,以及一句描述 Cue 是 “a voice-activated AI agent that lives on the user's desktop.” 的话。这两处都按原文呈现在页面上。主页还展示了一段 45 秒的 Gemma 团队演讲片段,其中演讲者称参与度提高了 30%;而书面案例研究中则说是功能使用率。我们采用了书面数据,并在视频片段旁注明了这一差异。
它不支持什么
- 它不是产品评测,也没有对转写准确性或智能体任务成功率做出任何声明。
- 它所描述的 227 个样本的基准测试是 Cue 内部私有的,并未发布。我们的公开数据集,即语音智能体基准测试概览,是另一回事:它是一份其他人公开基准测试的汇总,不含任何评分。
- 其数据截至 2026 年 5 月。该页面未描述在此日期之后发布的 Cue 版本。