Blog

Què deu una pàgina de plantilla a un lector

Les nostres 3.926 pàgines de plantilla representen unes 90 paraules diferents cadascuna. Què vam mesurar abans d’afegir-ne més, per què es va ponderar la mostra i què va trobar.

Publicat el

PPT AI publica 3.926 plantilles de presentació, cadascuna amb una pàgina pròpia a ppt.sophoninc.com. Una pàgina que té la funció de mostrar un disseny ha de ser llegible per a algú que encara no pot veure el disseny, o que està decidint entre dos. Això significa, com a mínim: per a què serveix la presentació, què hi ha a cada diapositiva, quantes diapositives i de quina mida, què es pot canviar i com començar. Aquesta entrada tracta sobre com vam esbrinar com de lluny estaven les nostres pàgines d’això, i què vam mesurar abans d’afegir-hi res.

Què renderitza avui una pàgina de plantilla

Es van obtenir i comptar quatre pàgines de plantilla el 16 de setembre de 2026. Mètode de recompte: eliminar els elements script i style, eliminar les etiquetes restants, descodificar les entitats HTML, agafar els tokens de paraules que coincideixen amb [A-Za-z0-9][A-Za-z0-9’'&-]* i passar-los a minúscules abans de comptar els que són diferents. S’indica el tokenitzador perquè els recomptes de paraules diferents varien lleugerament segons quin s’usi.

PàginaTotal de paraulesParaules úniquesParaules úniques fora dels elements comuns
brand-agency-book-editorial-dark1489131
medical-blood-test-clean-corporate1428828
resume-illustrator-professional-blue1479030
poster-bold-text-modern-gradient1347919

«Shared chrome» són les 60 paraules diferents comunes a les quatre pàgines: la navegació, el peu de pàgina, el fil d'Ariadna i les dues crides a l'acció. Si les traiem, entre 19 i 31 paraules diferents de cada pàgina tracten sobre aquella plantilla. La resta de la pàgina és la mateixa en 3.926 pàgines.

Com a context, durant els tres mesos fins al 16 de setembre de 2026, aquestes pàgines van obtenir 484 impressions i 7 clics amb una posició mitjana de 20,2, en 187 pàgines úniques i 12 consultes úniques. Aquesta xifra prové de Google Search Console per a sc-domain:sophoninc.com, filtrat a ppt.sophoninc.com/templates/. Search Console només és visible per als propietaris de la propietat; la propietat, el filtre i l’interval de dates es proporcionen perquè qualsevol persona amb accés pugui reproduir-ho, que és el màxim de verificable que pot ser aquesta font.

La pregunta que l’auditoria havia de respondre

Les diapositives de cada plantilla contenen text: encapçalaments, etiquetes, text de farciment escrit per omplir el disseny. Se serveix públicament a /api/v2/templates/<slug>/slides/<n> i és el més obvi per posar a la pàgina. Abans de fer-ho, cal respondre una objecció: 3.926 pàgines de text de presentació generat podrien ser 3.926 pàgines gairebé idèntiques, la qual cosa és pitjor que 3.926 pàgines amb poc contingut.

Així doncs: quant de text comparteix una plantilla amb la plantilla a la qual més s’assembla?

Per què una mostra uniforme dona una resposta equivocada

El mètode ingenu és mostrejar plantilles a l’atzar i comparar-les per parelles. Aquest mètode no pot trobar duplicació en aquest corpus, i val la pena ser exacte sobre el perquè.

La biblioteca està organitzada per categoria, per recepta i per família d'estils. Una parella aleatòria extreta de 3.926 elements és, de manera aclaparadora, una parella de categories diferents sobre temes diferents. Aquestes parelles no comparteixen gairebé res, per molt duplicat que sigui el corpus. Ho hem mesurat: 392 parelles aleatòries de famílies diferents tenen una contenció mediana de 5-grames del 0,00 % i una màxima del 0,3 %. Una mostra uniforme retorna «the corpus is unique» com un artefacte del mostreig, no com una troballa.

Les parelles que revelarien la duplicació són les més properes, i són una fracció ínfima de totes les parelles. Per tant, la mostra es va ponderar cap a elles. Les plantilles es van agrupar per categoria, slug de recepta i família d’estils, i es van extreure 33 grups de quatre tipus:

  • bessones numerades, on els slugs només difereixen per un -2 o -3 al final (8 grups)
  • mateixa recepta i mateixa família d’estils (4 grups)
  • mateixa família d’estils, recepta diferent (13 grups)
  • grups de cobertura, un per categoria, perquè cap categoria quedi sense mesurar (8 grups)

A continuació, es va obtenir el text de les diapositives de cada membre de cada grup: 232 plantilles, 1.034 diapositives, 0 errors d’obtenció, el 16 de setembre de 2026. Això és el 5,9 % del corpus, escollit per ser el 5,9 % més difícil.

La passada decisiva

Ponderar la mostra no és suficient per si sol, perquè el veí més proper real d’una plantilla podria ser un que no s’hagi recuperat, la qual cosa subestimaria la superposició. Per tant, una segona passada va restringir la comparació a clústers on s’havia recuperat cada membre: 46 clústers complets, 117 plantilles. Dins d’aquests, es garanteix que el veí més proper d’una plantilla en tot el corpus de 3.926 plantilles es troba en el conjunt mesurat.

La mètrica és la contenció de 5-grames: la fracció de les seqüències de cinc paraules diferents d’una plantilla que també apareixen en el seu parell més proper. Contenció en lloc de Jaccard perquè és asimètrica: una plantilla curta continguda completament en una de llarga s’hauria de llegir com a totalment duplicada, i Jaccard la informaria com a parcialment única.

Resultats per a aquestes 117 plantilles, en comparació amb el veí més proper real del corpus:

MètricaValor
Contenció de 5-grames (mediana)0,00%
Mitjana0,50%
Percentil 953,46%
Màxim8,82%
Plantilles per sobre del 10 %0
Contenció de 3-grames, mediana / màxim0,31% / 13,89%

La passada de 3-grames serveix per detectar còpies que s’han reformulat en lloc de reutilitzar; mou les xifres, però no la conclusió. El pitjor parell del corpus és poster-quote-typography-modern-gradient contra poster-bold-text-modern-gradient, amb un 8,82 %.

En el conjunt de les 232 plantilles: de 3.448 frases diferents de sis paraules o més, 2 apareixen en més d’una plantilla: “the results relate only to the items tested” i “no other graphic elements should intrude into this zone”. Per diapositiva, de 992 diapositives amb 20 paraules o més, la contenció mediana amb la diapositiva més propera de qualsevol altra plantilla és del 0,0 %; 8 estan per sobre del 20 % i cap supera el 50 %. La similitud temàtica mesurada pel cosinus de bossa de paraules, que ignora la redacció, és més alta, com ha de ser per a dues plantilles de currículum: mediana del 12,7 % respecte al parell més proper de la mateixa família, màxim del 35,3 %.

El límit honest: es tracta de 232 de 3.926 plantilles i 117 en el conjunt amb el veí més proper garantit. És una prova sobre la part més difícil del corpus, no una demostració sobre la seva totalitat.

Què vam decidir

L’auditoria elimina l’objecció de duplicació a la publicació del text de les diapositives. No vam publicar el cos de les diapositives. Vam publicar els títols de les diapositives, que ja existien en el registre de la plantilla i que s’estaven recuperant i descartant.

Comprovat en les 3.926 plantilles abans de publicar-les: 14.969 títols, cap de buit, cap que fos un simple “Slide N” o “Page N”, i slide_titles.length igual a slide_count en totes. Es van registrar dos límits en lloc de suavitzar-los: 156 títols (1,0 %) acaben en “… Page N”, i en 77 plantilles (2 %) ho fan tots els títols. 1.321 plantilles (34 %) tenen una sola diapositiva i no reben cap llista.

Per tant, el canvi afecta 2.605 pàgines i hi afegeix una mediana de 15 paraules a cadascuna, una mitjana de 10,4 paraules per pàgina en tot el corpus. Això és real i és poc. No treu per si sol una pàgina del territori de contingut escàs, i la part més útil pot ser que es pot fer clic als títols: abans, per saltar a la diapositiva 7 calia prémer Següent sis vegades.

La mateixa branca enllaça les plantilles que no tenien cap altre enllaç. Les pàgines de navegació fixaven la aspect_ratio a 16:9, que és aproximadament el 45% de la col·lecció, de manera que la resta no apareixia a cap pàgina central ni a cap bloc relacionat: /templates?category=document i ?category=poster retornaven una pàgina «coming soon» sense cap enllaç a plantilles. Una pàgina sense cap enllaç intern que hi apunti no deu res a cap lector, perquè cap lector no hi arriba.

No implementat, i una pregunta encara oberta

Res d’això està en línia. És la pull request 10 a Sophon-LLC/ppt-ai, oberta el 15 de setembre de 2026 i encara oberta el 16 de setembre de 2026, tres commits, verificada amb una comprovació de tipus, una execució de lint i una compilació de producció servida contra el magatzem de dades en línia. Fins que no es fusioni, les pàgines són tal com es van mesurar a l’inici d’aquesta entrada.

La pregunta oberta és la que l’auditoria no respon. El conjunt mesurat conté una mediana de 288 paraules de text principal per plantilla, enfront de les 19 a 31 paraules específiques de la plantilla que una pàgina mostra avui. L’auditoria diu que aquest text no és duplicat. No diu que el text escrit per omplir un disseny es llegeixi com a contingut per a una persona en lloc de com a farciment, i ningú no ho ha mesurat. Publicar-ne 3.926 pàgines basant-se només en un resultat de duplicació seria respondre una pregunta que no hem fet.

Totes les entrades