Blog

O que unha páxina de modelo lle debe a un lector

As nosas 3926 páxinas de modelo mostran unhas 90 palabras distintas cada unha. O que medimos antes de engadir máis, por que se ponderou a mostra e o que se atopou.

Publicado o

PPT AI publica 3926 modelos de presentación, cada un coa súa propia páxina en ppt.sophoninc.com. Unha páxina cuxo traballo é mostrar un deseño aínda ten que ser lexible para alguén que aínda non pode ver o deseño, ou que está a decidir entre dous deles. Iso significa, como mínimo: para que é a presentación, que hai en cada diapositiva, cantas diapositivas e de que tamaño, que se pode cambiar e como comezar. Esta publicación trata sobre descubrir o lonxe que estaban as nosas páxinas diso e o que medimos antes de engadir nada.

O que unha páxina de modelo representa hoxe

O 16 de setembro de 2026 obtivéronse e contáronse catro páxinas de modelos. Método de reconto: eliminar os elementos script e style, eliminar as etiquetas restantes, descodificar as entidades HTML, tomar os tokens de palabras que coincidan con [A-Za-z0-9][A-Za-z0-9’'&-]* e poñelos en minúsculas antes de contar os distintos. O tokenizador indícase porque os recontos distintos varían nalgunhas palabras dependendo del.

PáxinaPalabras totaisPalabras distintasPalabras distintas fóra dos elementos comúns
brand-agency-book-editorial-dark1489131
medical-blood-test-clean-corporate1428828
resume-illustrator-professional-blue1479030
poster-bold-text-modern-gradient1347919

«Shared chrome» son as 60 palabras distintas comúns ás catro páxinas: a navegación, o pé de páxina, a ruta de navegación e as dúas chamadas á acción. Se se eliminan, entre 19 e 31 palabras distintas en cada páxina son sobre ese modelo. O resto da páxina é o mesmo en 3926 páxinas.

Como contexto, nos tres meses anteriores ao 16 de setembro de 2026, esas páxinas obtiveron 484 impresións e 7 clics cunha posición media de 20,2, en 187 páxinas distintas e 12 consultas distintas. Esta cifra provén da Google Search Console para sc-domain:sophoninc.com, filtrada a ppt.sophoninc.com/templates/. A Search Console só é visible para os propietarios do sitio; indícanse o sitio, o filtro e o intervalo de datas para que calquera persoa con acceso poida reproducir o resultado, que é o máis verificable que permite esa fonte.

A pregunta que a auditoría tiña que responder

As diapositivas de cada modelo levan texto: títulos, etiquetas, corpo de texto escrito para encher o deseño. Sírvese publicamente en /api/v2/templates/<slug>/slides/<n> e é o contido máis obvio para poñer na páxina. Antes de facelo, hai que responder a unha obxección: 3926 páxinas de texto xerado para presentacións poderían ser 3926 páxinas case idénticas, o que é peor que 3926 páxinas con pouco contido.

Polo tanto: canto texto comparte un modelo co modelo ao que máis se parece?

Por que unha mostra uniforme dá a resposta incorrecta

O método inxenuo é tomar mostras de modelos ao chou e comparar os pares. Ese método non pode atopar duplicacións neste corpus, e paga a pena explicar con exactitude por que.

A biblioteca está organizada por categoría, por receita e por familia de estilos. Un par aleatorio extraído de 3926 elementos é de forma esmagadora un par de categorías diferentes sobre temas diferentes. Eses pares non comparten case nada, por moi duplicativo que sexa o corpus. Medímolo: 392 pares aleatorios entre familias teñen unha mediana de contención de 5-gramas do 0,00 % e un máximo do 0,3 %. Unha mostra uniforme devolve «the corpus is unique» como un artefacto da mostraxe, non como un achado.

Os pares que revelarían a duplicación son os veciños máis próximos, e son unha fracción ínfima de todos os pares. Así que a mostra ponderouse cara a eles. Os modelos agrupáronse por categoría, slug de receita e familia de estilos, e extraéronse 33 grupos de catro tipos:

  • xemelgos numerados, onde os slugs só difiren nun -2 ou -3 ao final (8 grupos)
  • mesma receita e mesma familia de estilos (4 grupos)
  • mesma familia de estilos, receita diferente (13 grupos)
  • grupos de cobertura, un por categoría, para que ningunha categoría quede sen medir (8 grupos)

A continuación, o 16 de setembro de 2026, recolleuse o texto das diapositivas de cada membro de cada grupo: 232 modelos, 1034 diapositivas, 0 erros de obtención. Iso é o 5,9 % do corpus, escollido por ser o 5,9 % máis difícil.

A pasada decisiva

Ponderar a mostra non é suficiente por si só, porque o verdadeiro veciño máis próximo dun modelo podería ser un que non se recuperou, o que subestimaría a superposición. Así que unha segunda pasada restrinxiu a comparación a clústeres nos que se recuperara cada membro: 46 clústeres completos, 117 modelos. Dentro deses, garántese que o veciño máis próximo dun modelo en todo o corpus de 3926 modelos está no conxunto medido.

A métrica é a contención de 5-gramas: a fracción das secuencias de cinco palabras distintas dun modelo que tamén aparecen no seu par máis próximo. Usamos a contención no canto do índice de Jaccard porque é asimétrica: un modelo curto contido por completo nun longo debería lerse como totalmente duplicado, e Jaccard indicaríao como parcialmente único.

Resultados para eses 117 modelos, contra o seu veciño máis próximo real do corpus:

MedidaValor
Contención de 5-gramas mediana0,00%
Media0,50%
Percentil 953,46%
Máximo8,82%
Modelos por riba do 10 %0
Contención de 3-gramas, mediana / máximo0,31% / 13,89%

A pasada de 3-gramas está aí para detectar texto que foi reformulado no canto de reutilizado; move as cifras, pero non a conclusión. O peor par do corpus é poster-quote-typography-modern-gradient contra poster-bold-text-modern-gradient, cun 8,82 %.

En todos os 232 modelos: de 3448 frases distintas de seis ou máis palabras, 2 aparecen en máis dun modelo: “the results relate only to the items tested” e “no other graphic elements should intrude into this zone”. Por diapositiva, de 992 diapositivas con 20 ou máis palabras, a contención mediana coa diapositiva máis próxima de calquera outro modelo é do 0,0 %; 8 están por riba do 20 % e ningunha por riba do 50 %. A similitude temática medida polo coseno de bolsa de palabras, que ignora a redacción, é máis alta, como debería ser para dous modelos de currículo: mediana do 12,7 % contra o par máis próximo da mesma familia, máximo do 35,3 %.

O límite honesto: isto son 232 de 3926 modelos e 117 no conxunto de veciño garantido. É unha proba sobre a parte máis difícil do corpus, non unha demostración sobre todo el.

O que decidimos

A auditoría elimina a obxección da duplicación á publicación do texto das diapositivas. Non publicamos os corpos das diapositivas. Publicamos os títulos das diapositivas, que xa existían no rexistro do modelo e que se estaban a recuperar e descartar.

Comprobado en todos os 3926 modelos antes de publicalos: 14.969 títulos, ningún baleiro, ningún un simple “Slide N” ou “Page N”, e slide_titles.length igual a slide_count en todos eles. Rexistráronse dous límites no canto de suavizalos: 156 títulos (1,0 %) rematan en “… Page N”, e en 77 modelos (2 %) todos os títulos o fan. 1321 modelos (34 %) teñen unha soa diapositiva e non obteñen ningunha lista.

Polo tanto, o cambio afecta a 2605 páxinas e engade unha mediana de 15 palabras a cada unha, unha media de 10,4 palabras por páxina en todo o corpus. Iso é real e é pequeno. Non saca por si só unha páxina do territorio do contido escaso, e a parte máis útil pode ser que os títulos son clicables: saltar á diapositiva 7 antes requiría premer «Seguinte» seis veces.

A mesma rama enlaza os modelos aos que nada enlazaba. As páxinas de exploración fixaban a relación de aspecto en 16:9, o que é arredor do 45 % da colección, así que o resto non aparecía en ningunha páxina principal nin en ningún bloque relacionado: /templates?category=document e ?category=poster devolvían unha páxina de «coming soon» sen ningunha ligazón a modelos. Unha páxina sen ligazóns internas non lle debe nada a un lector, porque ningún lector chega a ela.

Non despregado, e unha pregunta aínda aberta

Nada disto está activo. É a pull request 10 en Sophon-LLC/ppt-ai, aberta o 15 de setembro de 2026 e aínda aberta o 16 de setembro de 2026, tres commits, verificada cunha comprobación de tipos, unha execución de lint e unha compilación de produción servida contra o almacén de datos en directo. Ata que se fusione, as páxinas son como se mediron ao principio desta entrada.

A pregunta aberta é a que a auditoría non responde. O conxunto medido contén unha mediana de 288 palabras de texto de corpo por modelo, fronte ás 19 a 31 palabras específicas do modelo que unha páxina representa hoxe. A auditoría di que ese texto non é duplicado. Non di que o texto escrito para encher un deseño se lea como contido para unha persoa no canto de como recheo, e ninguén mediu iso. Publicar 3926 páxinas del baseándose unicamente nun resultado de duplicación sería responder a unha pregunta que non fixemos.

Todas as entradas