Cueのディクテーションには推敲ステップがあります。フィラーワードや句読点の欠落を含む生の文字起こしが、話し手の意図した通りに読めるテキストに変換されます。そのステップがどこで実行されるかは測定によって決定され、その測定結果は公開されています。この記事は、Google DeepMindのケーススタディ(2026年5月時点の数値)に沿っており、そのページに記載されていないことは一切追加していません。
当初の設計
このステップは、より大きなモデルの方がより正確に推敲できるという想定のもと、クラウドモデルを使用し、ローカルモデルをフォールバックとして構築されました。チームがこのステップに掲げた目標は、モデルのような文章ではなく、ユーザー自身のような文章が読めるテキストを作成することでした。つまり、独自のスタイルを押し付けることなく、句読点を復元し、文を区切り、フィラーを削除することです。
測定
チームは、英語、その他の言語、および複数言語が混在する入力を含む227件の実際の音声サンプルでこのステップのベンチマークを実施しました。そのベンチマークに基づき、Apple Silicon上でOllamaを介してローカルで実行されるGemma 4 E4Bが、第一選択のモデルとして選ばれました。推敲ステップのレイテンシの中央値は876msから488msに低下しました。このページでは、これをチームがタイピングよりも速く感じられる必要があるステップとして設定した予算の範囲内であると説明しています。
優先順位の逆転
ベンチマークの後、アーキテクチャは反転されました。ローカルモデルがデフォルトとなり、クラウドモデルがフォールバックとなりました。デスクトップアプリは起動時にOllamaが実行中であるかを確認します。実行中でない場合、推敲ステップはクラウドモデルにルーティングされ、ディクテーションは続行されます。
ページによると、ユーザーにとって何が変わったか
- 切り替え前後の4週間で、アクティブなベータ版ユーザー全体のユーザー1人あたりのディクテーション量が約30%増加しました。短いメッセージをディクテーションしていたユーザーが、より長いメッセージをディクテーションするようになりました。
- このステップの限界推論コストはゼロに低下し、ページではそれが無料プランを含むすべてのプランでディクテーションが無制限である理由として挙げられています。
主張の境界
移動したのは推敲ステップのみです。文字起こしは、推敲ステップの前にクラウドの音声テキスト変換サービスによって行われ、Cueのエージェントモードはクラウドモデルに依存します。このページでは、自己完結型のエージェントタスクに対するGemma 4の関数呼び出しの初期評価を報告し、それを初期段階のものとしています。したがって、当社のホームページでは、推敲はユーザーのマシンで実行されると記載し、エージェントがローカルで実行されることについては何も述べていません。プラットフォームのページにも同じ境界が記録されています。