PPT AI publică 3.926 de șabloane de prezentare, fiecare cu propria pagină la ppt.sophoninc.com. O pagină a cărei sarcină este să arate un design trebuie să fie totuși lizibilă pentru cineva care nu poate vedea încă designul sau care decide între două dintre ele. Asta înseamnă cel puțin: pentru ce este pachetul de diapozitive, ce este pe fiecare diapozitiv, câte diapozitive și la ce dimensiune, ce poate fi schimbat și cum să începeți. Această postare este despre a afla cât de departe erau paginile noastre de acest ideal și ce am măsurat înainte de a adăuga ceva.
Ce redă o pagină de șablon astăzi
Patru pagini de șabloane au fost preluate și numărate la 16 septembrie 2026. Metoda de numărare: eliminați elementele script și style, eliminați etichetele rămase, decodificați entitățile HTML, extrageți tokenurile de cuvinte care corespund cu [A-Za-z0-9][A-Za-z0-9’'&-]* și le convertiți la minuscule înainte de a număra cele distincte. Tokenizatorul este menționat deoarece numărul de cuvinte distincte variază cu câteva cuvinte în funcție de el.
| Pagină | Cuvinte totale | Cuvinte distincte | Cuvinte distincte în afara elementelor comune |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
„Shared chrome” reprezintă cele 60 de cuvinte distincte comune tuturor celor patru pagini: navigarea, subsolul, firul Ariadnei și cele două îndemnuri la acțiune. Dacă le eliminați, între 19 și 31 de cuvinte distincte de pe fiecare pagină sunt despre șablonul respectiv. Restul paginii este identic pe 3.926 de pagini.
Pentru context, în cele trei luni până la 16 septembrie 2026, acele pagini au atras 484 de afișări și 7 clicuri, cu o poziție medie de 20,2, pe 187 de pagini distincte și 12 interogări distincte. Cifra provine din Google Search Console pentru sc-domain:sophoninc.com, filtrată la ppt.sophoninc.com/templates/. Search Console este vizibil doar proprietarilor proprietății; proprietatea, filtrul și intervalul de date sunt furnizate astfel încât oricine cu acces să poată reproduce rezultatul, ceea ce este maximul de verificabilitate pe care îl permite sursa.
Întrebarea la care a trebuit să răspundă auditul
Diapozitivele fiecărui șablon conțin text: titluri, etichete, text de umplutură scris pentru a completa designul. Acesta este servit public la /api/v2/templates/<slug>/slides/<n> și este lucrul evident de pus pe pagină. Înainte de a face asta, trebuie răspuns la o obiecție: 3.926 de pagini de text de prezentare generat ar putea fi 3.926 de pagini aproape identice, ceea ce este mai rău decât 3.926 de pagini cu conținut sumar.
Deci: cât de mult text are în comun un șablon cu șablonul cu care se aseamănă cel mai mult?
De ce un eșantion uniform dă un răspuns greșit
Metoda naivă este de a eșantiona șabloane la întâmplare și de a compara perechi. Această metodă nu poate găsi duplicarea în acest corpus și merită să fim exacți cu privire la motiv.
Biblioteca este organizată pe categorii, pe rețete și pe familii de stiluri. O pereche aleatorie extrasă din 3.926 de elemente este, în majoritatea covârșitoare a cazurilor, o pereche din categorii diferite, despre subiecte diferite. Aceste perechi nu au aproape nimic în comun, indiferent cât de duplicativ este corpusul. Am măsurat acest lucru: 392 de perechi aleatorii între familii diferite au o incluziune mediană a 5-gramelor de 0,00% și un maxim de 0,3%. Un eșantion uniform returnează „the corpus is unique” ca artefact al eșantionării, nu ca o concluzie.
Perechile care ar dezvălui duplicarea sunt vecinii cei mai apropiați și reprezintă o fracțiune infimă din totalul perechilor. Așa că eșantionul a fost ponderat în favoarea lor. Șabloanele au fost grupate pe categorii, pe slug-ul rețetei și pe familia de stiluri, și au fost extrase 33 de grupuri de patru tipuri:
- gemeni numerotați, unde slug-urile diferă doar printr-un
-2sau-3la final (8 grupuri) - aceeași rețetă și aceeași familie de stiluri (4 grupuri)
- aceeași familie de stiluri, rețetă diferită (13 grupuri)
- grupuri de acoperire, unul pe categorie, astfel încât nicio categorie să nu rămână nemăsurată (8 grupuri)
Textul diapozitivelor a fost apoi preluat pentru fiecare membru al fiecărui grup: 232 de șabloane, 1.034 de diapozitive, 0 erori de preluare, la 16 septembrie 2026. Aceasta reprezintă 5,9% din corpus, aleasă pentru a fi cea mai dificilă porțiune de 5,9%.
Pasul decisiv
Ponderarea eșantionului nu este încă suficientă de la sine, deoarece cel mai apropiat vecin real al unui șablon ar putea fi unul care nu a fost preluat, ceea ce ar subestima suprapunerea. Așadar, o a doua trecere a restrâns comparația la clustere în care fiecare membru fusese preluat: 46 de clustere complete, 117 șabloane. În interiorul acestora, este garantat că cel mai apropiat vecin al unui șablon din întregul corpus de 3.926 de șabloane se află în setul măsurat.
Metrica este conținerea de 5-grame: fracțiunea de secvențe distincte de cinci cuvinte dintr-un șablon care apar și în cel mai apropiat omolog al său. Conținere în loc de Jaccard, deoarece este asimetrică — un șablon scurt conținut în întregime într-unul lung ar trebui să fie considerat complet duplicat, iar Jaccard l-ar raporta ca fiind parțial unic.
Rezultate pentru acele 117 șabloane, în comparație cu cel mai apropiat vecin real din corpus:
| Măsură | Valoare |
|---|---|
| Conținere mediană de 5-grame | 0,00% |
| Medie | 0,50% |
| Percentila 95 | 3,46% |
| Maxim | 8,82% |
| Șabloane peste 10% | 0 |
| Conținere de 3-grame, mediană / maximă | 0,31% / 13,89% |
Trecerea de 3-grame este menită să detecteze textul care a fost reformulat, nu refolosit; aceasta modifică cifrele, dar nu și concluzia. Cea mai slabă pereche din corpus este poster-quote-typography-modern-gradient contra poster-bold-text-modern-gradient, la 8,82%.
Pe toate cele 232 de șabloane: din 3.448 de propoziții distincte de șase sau mai multe cuvinte, 2 apar în mai mult de un șablon — „the results relate only to the items tested” și „no other graphic elements should intrude into this zone”. Pe diapozitiv, din 992 de diapozitive care conțin 20 de cuvinte sau mai mult, conținerea mediană cu cel mai apropiat diapozitiv din orice alt șablon este de 0,0%; 8 sunt peste 20% și niciunul nu este peste 50%. Similaritatea tematică măsurată prin cosinusul bag-of-words, care ignoră formularea, este mai mare, așa cum ar trebui să fie pentru două șabloane de CV: mediană de 12,7% față de cel mai apropiat omolog din aceeași familie, maxim de 35,3%.
Limita onestă: acestea sunt 232 din 3.926 de șabloane și 117 în setul cu cel mai apropiat vecin garantat. Este o dovadă despre cea mai dificilă parte a corpusului, nu o demonstrație despre întregul corpus.
Ce am decis
Auditul elimină obiecția de duplicare la publicarea textului diapozitivelor. Nu am publicat corpurile diapozitivelor. Am publicat titlurile diapozitivelor, care existau deja în înregistrarea șablonului și erau preluate și eliminate.
Verificat pe toate cele 3.926 de șabloane înainte de a le publica: 14.969 de titluri, niciunul gol, niciunul un simplu „Slide N” sau „Page N”, și slide_titles.length egal cu slide_count pentru fiecare. Două limite au fost înregistrate în loc să fie netezite: 156 de titluri (1,0%) se termină în „… Page N”, iar la 77 de șabloane (2%) fiecare titlu face acest lucru. 1.321 de șabloane (34%) au un singur diapozitiv și nu primesc nicio listă.
Prin urmare, modificarea ajunge la 2.605 pagini și adaugă o mediană de 15 cuvinte fiecăreia, o medie de 10,4 cuvinte pe pagină în întregul corpus. Acest lucru este real și este mic. Nu scoate de la sine o pagină din teritoriul conținutului superficial, iar partea mai utilă poate fi că titlurile sunt clicabile: pentru a sări la diapozitivul 7 era necesar anterior să apăsați Next de șase ori.
Aceeași ramură leagă șabloanele de care nu se lega nimic. Paginile de navigare au fixat aspect_ratio la 16:9, ceea ce reprezintă aproximativ 45% din bibliotecă, astfel că restul nu apărea pe nicio pagină centralizatoare și în niciun bloc de conținut similar: /templates?category=document și ?category=poster returnau o pagină «coming soon» fără nicio legătură către vreun șablon. O pagină fără legături interne către ea nu datorează nimic unui cititor, pentru că niciun cititor nu ajunge acolo.
Nu a fost implementat, și o întrebare rămâne deschisă
Nimic din toate acestea nu este live. Este pull request 10 pe Sophon-LLC/ppt-ai, deschis pe 15 septembrie 2026 și încă deschis pe 16 septembrie 2026, trei commit-uri, verificat cu o verificare de tip, un lint run și un build de producție servit pe datastore-ul live. Până când se face merge, paginile sunt așa cum au fost măsurate la începutul acestei postări.
Întrebarea deschisă este cea la care auditul nu răspunde. Setul măsurat conține o mediană de 288 de cuvinte de text de corp pe șablon, față de cele 19 până la 31 de cuvinte specifice șablonului pe care o pagină le redă astăzi. Auditul spune că textul nu este duplicativ. Nu spune că textul scris pentru a umple un layout este perceput de o persoană ca fiind conținut, mai degrabă decât text de umplutură, și nimeni nu a măsurat acest lucru. A publica 3.926 de pagini de astfel de text doar pe baza unui rezultat de duplicare ar însemna să răspundem la o întrebare pe care nu am pus-o.