PPT AI pubblica 3.926 modelli di presentazione, ciascuno con una propria pagina su ppt.sophoninc.com. Una pagina il cui compito è mostrare un design deve comunque essere leggibile da chi non può ancora vedere il design, o da chi sta decidendo tra due di essi. Ciò significa almeno: a cosa serve il mazzo di diapositive, cosa c’è su ogni diapositiva, quante diapositive e di quali dimensioni, cosa si può modificare e come iniziare. Questo articolo spiega come abbiamo scoperto quanto le nostre pagine fossero lontane da ciò, e cosa abbiamo misurato prima di aggiungere qualsiasi cosa.
Cosa mostra oggi una pagina di modello
Il 16 settembre 2026 sono state recuperate e contate quattro pagine di modelli. Metodo di conteggio: rimuovere gli elementi script e style, rimuovere i tag rimanenti, convertire le entità HTML, prendere i token di parole che corrispondono a [A-Za-z0-9][A-Za-z0-9’'&-]* e convertirli in minuscolo prima di contare quelli distinti. Il tokenizer è specificato perché, a seconda di quale si usa, il conteggio delle parole distinte varia di qualche unità.
| Pagina | Parole totali | Parole distinte | Parole distinte fuori dagli elementi comuni |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
“Shared chrome” sono le 60 parole distinte comuni a tutte e quattro le pagine: la navigazione, il piè di pagina, il breadcrumb e le due call to action. Togliendo queste, su ogni pagina restano tra 19 e 31 parole distinte che riguardano quel modello. Il resto del contenuto è identico su 3.926 pagine.
Per dare un contesto, nei tre mesi fino al 16 settembre 2026 quelle pagine hanno ottenuto 484 impressioni e 7 clic con una posizione media di 20,2, distribuite su 187 pagine distinte e 12 query distinte. La cifra proviene da Google Search Console per sc-domain:sophoninc.com, con filtro ppt.sophoninc.com/templates/. Search Console è visibile solo ai proprietari del sito; la proprietà, il filtro e l’intervallo di date sono indicati in modo che chiunque abbia accesso possa riprodurre il dato, il massimo della verificabilità per questa fonte.
La domanda a cui l’analisi doveva rispondere
Le diapositive di ogni modello contengono del testo: titoli, etichette, corpo del testo scritto per riempire il design. È servito pubblicamente all’indirizzo /api/v2/templates/<slug>/slides/<n>, ed è la cosa più ovvia da mettere sulla pagina. Prima di farlo, bisogna rispondere a un’obiezione: 3.926 pagine di testo generato per le presentazioni potrebbero diventare 3.926 pagine quasi identiche, il che è peggio di 3.926 pagine scarne.
Quindi: quanto testo condivide un modello con il modello che più gli assomiglia?
Perché un campione uniforme dà la risposta sbagliata
Il metodo ingenuo è campionare modelli a caso e confrontare le coppie. Questo metodo non può trovare duplicazioni in questo corpus, e vale la pena spiegare esattamente perché.
La libreria è organizzata per categoria, per ricetta e per famiglia di stili. Una coppia casuale estratta da 3.926 elementi è quasi sempre una coppia di categorie diverse su argomenti diversi. Queste coppie non hanno quasi nulla in comune, non importa quanto sia duplicato il corpus. Lo abbiamo misurato: 392 coppie casuali tra famiglie diverse hanno una mediana di contenimento di 5-grammi dello 0,00% e un massimo dello 0,3%. Un campione uniforme restituisce “the corpus is unique” come un artefatto del campionamento, non come una scoperta.
Le coppie che rivelerebbero la duplicazione sono quelle più simili, e sono una frazione infinitesimale di tutte le coppie. Quindi il campione è stato ponderato verso di esse. I modelli sono stati raggruppati per categoria, slug della ricetta e famiglia di stili, e sono stati estratti 33 gruppi di quattro tipi:
- gemelli numerati, dove gli slug differiscono solo per un
-2o-3finale (8 gruppi) - stessa ricetta e stessa famiglia di stili (4 gruppi)
- stessa famiglia di stili, ricetta diversa (13 gruppi)
- gruppi di copertura, uno per categoria, in modo che nessuna categoria resti non misurata (8 gruppi)
Il testo delle diapositive è stato poi recuperato per ogni membro di ogni gruppo: 232 modelli, 1.034 diapositive, 0 errori di recupero, il 16 settembre 2026. Si tratta del 5,9% del corpus, scelto per essere il 5,9% più difficile.
Il passaggio decisivo
Ponderare il campione non è ancora sufficiente, perché il vicino più prossimo di un modello potrebbe essere uno non recuperato, il che sottostimerebbe la sovrapposizione. Un secondo passaggio ha quindi ristretto il confronto ai cluster in cui ogni membro era stato recuperato: 46 cluster completi, 117 modelli. All’interno di questi, si ha la garanzia che il vicino più prossimo di un modello nell’intero corpus di 3.926 modelli sia nel set misurato.
La metrica è il contenimento di 5-grammi: la frazione delle sequenze distinte di cinque parole di un modello che si trovano anche nel suo omologo più vicino. Contenimento anziché Jaccard perché è asimmetrico: un modello breve interamente contenuto in uno lungo dovrebbe risultare come completamente duplicato, mentre Jaccard lo riporterebbe come parzialmente unico.
Risultati per questi 117 modelli, rispetto al vero vicino più prossimo nel corpus:
| Misura | Valore |
|---|---|
| Contenimento mediano di 5-grammi | 0,00% |
| Media | 0,50% |
| 95° percentile | 3,46% |
| Massimo | 8,82% |
| Modelli sopra il 10% | 0 |
| Contenimento di 3-grammi, mediana / massimo | 0,31% / 13,89% |
Il passaggio sui 3-grammi serve a intercettare il testo che è stato riformulato anziché riutilizzato; sposta le cifre ma non la conclusione. La coppia peggiore nel corpus è poster-quote-typography-modern-gradient contro poster-bold-text-modern-gradient, con l’8,82%.
Su tutti i 232 modelli: di 3.448 frasi distinte di sei o più parole, 2 compaiono in più di un modello: “the results relate only to the items tested” e “no other graphic elements should intrude into this zone”. Per diapositiva, su 992 diapositive con 20 o più parole, il contenimento mediano con la diapositiva più vicina in qualsiasi altro modello è dello 0,0%; 8 sono sopra il 20% e nessuna è sopra il 50%. La somiglianza tematica misurata con il coseno bag-of-words, che ignora la formulazione, è più alta, come dovrebbe essere per due modelli di curriculum: mediana del 12,7% rispetto all’omologo più vicino della stessa famiglia, massimo del 35,3%.
Il limite onesto: si tratta di 232 dei 3.926 modelli e 117 nel set con vicinanza garantita. È una prova sulla parte più difficile del corpus, non una dimostrazione sulla sua totalità.
Cosa abbiamo deciso
L’audit rimuove l’obiezione della duplicazione alla pubblicazione del testo delle diapositive. Non abbiamo pubblicato il corpo delle diapositive. Abbiamo pubblicato i titoli delle diapositive, che esistevano già nel record del modello e venivano recuperati e scartati.
Controllo effettuato su tutti i 3.926 modelli prima di pubblicarli: 14.969 titoli, nessuno vuoto, nessuno un semplice “Slide N” o “Page N”, e slide_titles.length uguale a slide_count per ognuno. Due limiti sono stati registrati anziché appianati: 156 titoli (1,0%) terminano con “… Page N”, e su 77 modelli (2%) ogni titolo lo fa. 1.321 modelli (34%) hanno una singola diapositiva e non ottengono alcun elenco.
La modifica raggiunge quindi 2.605 pagine e aggiunge una mediana di 15 parole a ciascuna, una media di 10,4 parole per pagina in tutto il corpus. È un dato reale e piccolo. Di per sé non porta una pagina fuori dal territorio dei contenuti scarni, e la parte più utile potrebbe essere che i titoli sono cliccabili: prima, per saltare alla diapositiva 7, bisognava premere Avanti sei volte.
Lo stesso branch collega i modelli a cui nulla era collegato. Le interfacce di navigazione fissavano aspect_ratio a 16:9, che è circa il 45% della libreria, quindi il resto non appariva in nessuna pagina hub e in nessun blocco correlato: /templates?category=document e ?category=poster restituivano una pagina “coming soon” con zero link a modelli. Una pagina senza link interni non deve nulla a un lettore, perché nessun lettore vi arriva.
Non implementato, e una domanda ancora aperta
Niente di tutto questo è online. Si tratta della pull request 10 su Sophon-LLC/ppt-ai, aperta il 15 settembre 2026 e ancora aperta il 16 settembre 2026, tre commit, verificata con un controllo dei tipi, un’analisi del codice e una build di produzione servita sul datastore di produzione. Finché non sarà integrata, le pagine resteranno come misurate all’inizio di questo articolo.
La questione aperta è quella a cui l’audit non risponde. L’insieme misurato ha una mediana di 288 parole di testo per modello, contro le 19-31 parole specifiche per modello che una pagina mostra oggi. L’audit afferma che il testo non è duplicato. Non dice se un testo scritto per riempire un layout venga percepito come contenuto o come riempitivo, e nessuno l’ha misurato. Pubblicarne 3.926 pagine basandosi solo su un risultato di duplicazione significherebbe rispondere a una domanda che non abbiamo posto.