Chức năng đọc chính tả của Cue có một bước trau chuốt: bản ghi thô, với các từ đệm và thiếu dấu câu, được chuyển thành văn bản đọc giống như ý của người nói. Nơi bước đó chạy được quyết định bởi một phép đo, và phép đo đó được công khai. Bài đăng này bám sát nghiên cứu tình huống của Google DeepMind, với các con số cập nhật đến tháng 5 năm 2026, và không thêm bất cứ điều gì mà trang đó không nêu.
Thiết kế ban đầu
Bước này được xây dựng để sử dụng một mô hình đám mây, với một mô hình cục bộ làm phương án dự phòng, dựa trên giả định rằng một mô hình lớn hơn sẽ trau chuốt chính xác hơn. Mục tiêu đã nêu của nhóm cho bước này là văn bản đọc giống người dùng hơn là giống một mô hình: khôi phục dấu câu, phân đoạn câu, loại bỏ từ đệm, mà không áp đặt một văn phong riêng.
Phép đo
Nhóm đã thực hiện benchmark cho bước này trên 227 mẫu giọng nói thực tế bao gồm tiếng Anh, các ngôn ngữ khác và đầu vào đa ngôn ngữ. Trên benchmark đó, Gemma 4 E4B, chạy cục bộ thông qua Ollama trên Apple Silicon, đã được chọn làm mô hình ưu tiên hàng đầu. Độ trễ median của bước trau chuốt giảm từ 876 ms xuống 488 ms, điều mà trang này mô tả là nằm trong ngân sách mà nhóm đã đặt ra cho một bước phải cho cảm giác nhanh hơn gõ phím.
Sự đảo ngược
Sau benchmark, kiến trúc đã bị đảo ngược: mô hình cục bộ trở thành mặc định và mô hình đám mây trở thành phương án dự phòng. Ứng dụng trên máy tính để bàn kiểm tra khi khởi động xem Ollama có đang chạy không; nếu không, bước trau chuốt sẽ chuyển đến một mô hình đám mây và việc đọc chính tả vẫn tiếp tục.
Những gì đã thay đổi cho người dùng, theo trang này
- Lượng đọc chính tả trên mỗi người dùng đã tăng khoảng 30 phần trăm trong số những người dùng beta tích cực trong bốn tuần trước và sau khi chuyển đổi; những người dùng đã đọc chính tả các tin nhắn ngắn bắt đầu đọc những tin nhắn dài hơn.
- Chi phí suy luận cận biên của bước này đã giảm xuống không, và trang này cho đó là lý do tại sao việc đọc chính tả là không giới hạn trên mọi gói, bao gồm cả gói miễn phí.
Giới hạn của khẳng định
Chỉ có bước trau chuốt được di chuyển. Việc chuyển đổi giọng nói thành văn bản được thực hiện bởi một dịch vụ đám mây trước bước trau chuốt, và chế độ tác nhân của Cue dựa vào một mô hình đám mây. Trang này báo cáo các đánh giá ban đầu về khả năng gọi hàm của Gemma 4 cho các tác vụ tác nhân độc lập và gọi chúng là sơ bộ. Do đó, trang chủ của chúng tôi nói rằng bước trau chuốt chạy trên máy của người dùng và không nói gì về việc tác nhân chạy cục bộ; trang nền tảng ghi lại cùng một giới hạn đó.