Blogu

Lokal si parazgjedhje, cloud si alternativë: si përfundoi hapi i lëmimit të Cue në pajisjen e përdoruesit

Hapi i lëmimit të diktimit të Cue u projektua fillimisht për cloud, me një alternativë lokale. Një benchmark me 227 mostra e përmbysi këtë. Çfarë regjistron studimi i rastit për vendimin.

Publikuar më

Diktimi i Cue ka një hap lëmini: transkripti i papërpunuar, me fjalët e tij mbushëse dhe shenjat e pikësimit që mungojnë, kthehet në tekst që lexohet ashtu siç e ka menduar folësi. Se ku ekzekutohet ky hap u vendos nga një matje, dhe matja është publike. Ky postim ndjek studimin e rastit të Google DeepMind, me shifra aktuale që nga maji 2026, dhe nuk shton asgjë që faqja nuk e pohon.

Dizajni origjinal

Hapi u ndërtua për të përdorur një model cloud, me një model lokal si alternativë, duke supozuar se një model më i madh do të lëmonte me më shumë saktësi. Qëllimi i deklaruar i ekipit për këtë hap ishte një tekst që lexohej si përdoruesi dhe jo si një model: shenjat e pikësimit të rivendosura, fjalitë e segmentuara, fjalët mbushëse të hequra, pa imponuar një stil të brendshëm.

Matja

Ekipi bëri benchmark hapin në 227 mostra zanore reale që mbulonin anglishten, gjuhë të tjera dhe input në gjuhë të përziera. Në atë benchmark, Gemma 4 E4B, duke u ekzekutuar lokalisht përmes Ollama në Apple Silicon, u zgjodh si modeli i parë. Vonesa mediane e hapit të lëmimit ra nga 876 ms në 488 ms, të cilën faqja e përshkruan si brenda buxhetit që ekipi kishte vendosur për një hap që duhet të ndihet më i shpejtë se shtypja.

Përmbysja

Pas benchmark-ut, arkitektura u përmbys: modeli lokal u bë parazgjedhja dhe modeli cloud alternativa. Aplikacioni i desktopit kontrollon në nisje nëse Ollama po ekzekutohet; nëse jo, hapi i lëmimit kalon te një model cloud dhe diktimi vazhdon.

Çfarë ndryshoi për përdoruesit, sipas faqes

  • Diktimi për përdorues u rrit me rreth 30 për qind te përdoruesit aktivë të versionit beta në katër javët para dhe pas ndryshimit; përdoruesit që kishin diktuar mesazhe të shkurtra filluan të diktonin mesazhe më të gjata.
  • Kostoja margjinale e inferencës së hapit ra në zero, dhe faqja e jep këtë si arsyen pse diktimi është i pakufizuar në çdo nivel, përfshirë atë falas.

Kufiri i pohimit

Vetëm hapi i lëmimit u zhvendos. Transkriptimi bëhet nga një shërbim cloud fjalë-në-tekst para hapit të lëmimit, dhe modaliteti i agjentit të Cue mbështetet në një model cloud. Faqja raporton vlerësime të hershme të thirrjes së funksioneve të Gemma 4 për detyra agjenti të pavarura dhe i quan ato të hershme. Prandaj, faqja jonë kryesore thotë se lëmi ekzekutohet në pajisjen e përdoruesit dhe nuk thotë asgjë për agjentin që ekzekutohet lokalisht; faqja e platformave regjistron të njëjtin kufi.

Të gjitha postimet