Blog

DeepMind 案例研究说明了 Cue 的什么,以及没有说明什么

Google DeepMind 在 2026 年发布了一份关于 Cue 的案例研究:它测量了什么,什么在哪里运行,我们如何引用它,以及它不支持哪些主张。

发布于

Google DeepMind 关于 Cue 的案例研究是唯一一份关于我们产品的外部证据,因此它被我们和他人引用。本文旨在阐明该页面所述内容,以便核对引文。该页面地址为 deepmind.google/models/gemma/gemmaverse/cue-ai;其数据标注为截至 2026 年 5 月的最新数据。

它测量了什么

  • 在将处理步骤从云端模型迁移到通过 Ollama 本地运行的 Gemma 4 E4B 后,Cue 的听写润色步骤的延迟中位数从 876 ms 降至 488 ms。该页面称之为 44% 的降幅。
  • 该测量是在 Apple Silicon (M 系列) 上通过 Ollama 进行的,基于一个包含 227 个真实语音样本的基准测试,涵盖英语和混合语言输入。
  • 在本地模型成为默认选项前后的四个星期内,活跃测试用户的平均听写使用量增加了约 30%。
  • 润色步骤的边际推理成本降至零,该页面指出,这就是包括免费版在内的所有套餐都提供无限听写功能的原因。

根据该页面,什么在哪里运行

  • 用户按住一个快捷键并说话。音频由云端语音转文本服务转写为原始文本。
  • 原始文本被发送到通过 Ollama 在用户机器上本地运行的 Gemma 4,并附带一个约 400 个词元的系统提示,用于恢复标点、分句和移除填充词。
  • 如果 Ollama 未在运行,桌面应用程序会在启动时检测到此情况,并将润色步骤路由到云端模型。
  • Cue 的智能体模式依赖于云端模型。该页面报告了对 Gemma 4 用于独立任务的函数调用能力的早期评估,并称其为早期阶段。

所以,那个页面上的“local”意思是一个功能里的一个步骤。转写在云端进行,智能体在云端运行,润色默认在本地进行,并有云端备选方案。

我们如何引用它

主页引用了其中的两个数据:延迟从 876 ms 降至 488 ms,以及一句描述 Cue 是 “a voice-activated AI agent that lives on the user's desktop.” 的话。这两处都按原文呈现在页面上。主页还展示了一段 45 秒的 Gemma 团队演讲片段,其中演讲者称参与度提高了 30%;而书面案例研究中则说是功能使用率。我们采用了书面数据,并在视频片段旁注明了这一差异。

它不支持什么

  • 它不是产品评测,也没有对转写准确性或智能体任务成功率做出任何声明。
  • 它所描述的 227 个样本的基准测试是 Cue 内部私有的,并未发布。我们的公开数据集,即语音智能体基准测试概览,是另一回事:它是一份其他人公开基准测试的汇总,不含任何评分。
  • 其数据截至 2026 年 5 月。该页面未描述在此日期之后发布的 Cue 版本。

数据页面记录了延迟数据在首页的使用方式,而证据页面则列出了该案例研究以及所有其他已发布的关于我们产品的信息。

所有文章