Nghiên cứu tình huống của Google DeepMind về Cue là bằng chứng bên ngoài duy nhất về một sản phẩm của chúng tôi, vì vậy nó được trích dẫn, bởi chúng tôi và bởi những người khác. Bài đăng này trình bày những gì trang đó nói, để các trích dẫn có thể được kiểm tra đối chiếu. Trang này có tại deepmind.google/models/gemma/gemmaverse/cue-ai; các con số của nó được ghi là cập nhật đến tháng 5 năm 2026.
Họ đã đo lường những gì
- Median độ trễ của bước trau chuốt chính tả của Cue đã giảm từ 876 ms xuống 488 ms sau khi bước này chuyển từ một mô hình đám mây sang Gemma 4 E4B chạy cục bộ thông qua Ollama. Trang này gọi đó là mức giảm 44 phần trăm.
- Phép đo được thực hiện trên Apple Silicon (dòng M) thông qua Ollama, trên một benchmark gồm 227 mẫu giọng nói thực tế bao gồm cả đầu vào tiếng Anh và đa ngôn ngữ.
- Lượng chính tả trên mỗi người dùng đã tăng khoảng 30 phần trăm, được đo trên những người dùng beta đang hoạt động trong bốn tuần trước và sau khi mô hình cục bộ trở thành mặc định.
- Chi phí suy luận cận biên của bước trau chuốt đã giảm xuống không, điều mà trang này cho là lý do chính tả không bị giới hạn ở mọi bậc, kể cả bậc miễn phí.
Cái gì chạy ở đâu, theo trang này
- Người dùng giữ một phím tắt và nói. Âm thanh được chuyển thành văn bản thô bởi một dịch vụ chuyển giọng nói thành văn bản trên đám mây.
- Văn bản thô được gửi đến Gemma 4 chạy cục bộ trên máy của người dùng thông qua Ollama, với một câu lệnh hệ thống khoảng 400 token để khôi phục dấu câu, phân đoạn câu và loại bỏ các từ đệm.
- Nếu Ollama không chạy, ứng dụng trên máy tính sẽ phát hiện điều đó khi khởi động và chuyển bước trau chuốt đến một mô hình đám mây.
- Chế độ tác nhân của Cue dựa vào một mô hình đám mây. Trang này báo cáo các đánh giá ban đầu về khả năng gọi hàm của Gemma 4 cho các tác vụ độc lập, và mô tả chúng là sơ bộ.
Vậy, “local” trên trang đó có nghĩa là một bước của một tính năng. Việc chuyển âm thành văn bản là trên đám mây; tác nhân là trên đám mây; bước trau chuốt mặc định là cục bộ với phương án dự phòng trên đám mây.
Cách chúng tôi trích dẫn
Trang chủ sử dụng hai con số từ đó: 488 ms giảm từ 876 ms, và câu nói rằng Cue là “a voice-activated AI agent that lives on the user's desktop.” Cả hai đều có trên trang với đúng nguyên văn. Trang chủ cũng hiển thị một đoạn 45 giây của một buổi nói chuyện của đội ngũ Gemma trong đó người nói cho biết mức độ tương tác đã tăng 30 phần trăm; nghiên cứu tình huống bằng văn bản thì nói là mức sử dụng tính năng. Chúng tôi in con số bằng văn bản và ghi chú sự khác biệt bên cạnh đoạn video.
Những gì tài liệu không hỗ trợ
- Đây không phải là một bài đánh giá sản phẩm và không đưa ra khẳng định nào về độ chính xác của bản ghi hay sự thành công của tác vụ của tác nhân.
- Benchmark 227 mẫu mà tài liệu mô tả là riêng tư của Cue và không được công bố. Bộ dữ liệu công khai của chúng tôi, Voice Agent Benchmark Landscape, là một thứ khác: một bản đồ các benchmark công khai của người khác, không có điểm số.
- Các con số của tài liệu có ghi ngày tháng 5 năm 2026. Một phiên bản của Cue được phát hành sau ngày đó không được mô tả trong trang này.
Trang các con số ghi lại cách con số về độ trễ được sử dụng trên trang chủ, và trang bằng chứng liệt kê nghiên cứu tình huống này bên cạnh mọi thứ khác đã được công bố về các sản phẩm của chúng tôi.