Blog

Qué le debe una página de plantilla a un lector

Nuestras 3926 páginas de plantilla muestran unas 90 palabras distintas cada una. Qué medimos antes de añadir más, por qué se ponderó la muestra y qué se encontró.

Publicado el

PPT AI publica 3926 plantillas de presentación, cada una con su propia página en ppt.sophoninc.com. Una página cuyo trabajo es mostrar un diseño debe ser legible para alguien que aún no puede ver el diseño, o que está decidiendo entre dos de ellos. Eso significa, como mínimo: para qué sirve la presentación, qué hay en cada diapositiva, cuántas diapositivas y de qué tamaño, qué se puede cambiar y cómo empezar. Esta entrada trata sobre cómo descubrimos lo lejos que estaban nuestras páginas de eso y qué medimos antes de añadir nada.

Qué muestra hoy una página de plantilla

Se obtuvieron y contaron cuatro páginas de plantillas el 16 de septiembre de 2026. Método de recuento: eliminar los elementos script y style, eliminar las etiquetas restantes, decodificar las entidades HTML, tomar los componentes léxicos de palabras que coincidan con [A-Za-z0-9][A-Za-z0-9’'&-]* y pasarlos a minúsculas antes de contar los que son distintos. Se especifica el tokenizador porque el recuento de palabras distintas varía ligeramente según cuál se use.

PáginaPalabras totalesPalabras distintasPalabras distintas fuera de los elementos comunes
brand-agency-book-editorial-dark1489131
medical-blood-test-clean-corporate1428828
resume-illustrator-professional-blue1479030
poster-bold-text-modern-gradient1347919

«Shared chrome» son las 60 palabras distintas comunes a las cuatro páginas: la navegación, el pie de página, la ruta de navegación y las dos llamadas a la acción. Si se eliminan, entre 19 y 31 palabras distintas en cada página tratan sobre esa plantilla. El resto de la página es el mismo en 3926 páginas.

Como contexto, en los tres meses hasta el 16 de septiembre de 2026, esas páginas generaron 484 impresiones y 7 clics con una posición media de 20,2, en 187 páginas distintas y 12 consultas distintas. Esta cifra procede de Google Search Console para sc-domain:sophoninc.com, filtrado a ppt.sophoninc.com/templates/. Search Console solo es visible para los propietarios de la propiedad; se indican la propiedad, el filtro y el intervalo de fechas para que cualquiera con acceso pueda reproducirlo, que es lo más verificable que puede ser esa fuente.

La pregunta que la auditoría debía responder

Las diapositivas de cada plantilla contienen texto: encabezados, etiquetas, texto de relleno escrito para completar el diseño. Se sirve públicamente en /api/v2/templates/<slug>/slides/<n>, y es lo más obvio para poner en la página. Antes de hacerlo, hay que responder a una objeción: 3926 páginas de texto de presentación generado podrían ser 3926 páginas casi idénticas, lo que es peor que 3926 páginas con poco contenido.

Entonces: ¿cuánto texto comparte una plantilla con la plantilla a la que más se parece?

Por qué una muestra uniforme da la respuesta equivocada

El método ingenuo es muestrear plantillas al azar y comparar pares. Ese método no puede encontrar duplicación en este corpus, y vale la pena ser exactos sobre por qué.

La biblioteca está organizada por categoría, por receta y por familia de estilos. Un par aleatorio extraído de 3926 elementos es, de forma abrumadora, un par de categorías diferentes sobre temas diferentes. Esos pares no comparten casi nada, por muy duplicado que sea el corpus. Lo medimos: 392 pares aleatorios de distintas familias tienen una contención de 5-gram mediana del 0,00 % y una máxima del 0,3 %. Una muestra uniforme devuelve «the corpus is unique» como un artefacto del muestreo, no como un hallazgo.

Los pares que revelarían la duplicación son los vecinos más cercanos, y son una fracción minúscula de todos los pares. Así que la muestra se ponderó hacia ellos. Las plantillas se agruparon por categoría, slug de receta y familia de estilos, y se extrajeron 33 grupos de cuatro tipos:

  • gemelos numerados, donde los slugs solo difieren en un -2 o -3 al final (8 grupos)
  • misma receta y misma familia de estilos (4 grupos)
  • misma familia de estilos, diferente receta (13 grupos)
  • grupos de cobertura, uno por categoría, para que ninguna categoría quede sin medir (8 grupos)

A continuación, se obtuvo el texto de las diapositivas para cada miembro de cada grupo: 232 plantillas, 1034 diapositivas, 0 errores de obtención, el 16 de septiembre de 2026. Esto es el 5,9% del corpus, elegido por ser el 5,9% más difícil.

El pase decisivo

Ponderar la muestra todavía no es suficiente por sí solo, porque el vecino más cercano real de una plantilla podría ser uno que no se obtuvo, lo que subestimaría la superposición. Así que un segundo pase restringió la comparación a los clústeres donde se había obtenido cada miembro: 46 clústeres completos, 117 plantillas. Dentro de esos, se garantiza que el vecino más cercano de una plantilla en todo el corpus de 3926 plantillas está en el conjunto medido.

La métrica es la contención de 5-gramas: la fracción de las secuencias de cinco palabras distintas de una plantilla que también aparecen en su par más cercano. Contención en lugar de Jaccard porque es asimétrica: una plantilla corta contenida por completo en una larga debería leerse como totalmente duplicada, y Jaccard la registraría como parcialmente única.

Resultados para esas 117 plantillas, frente al vecino más cercano real del corpus:

MedidaValor
Mediana de contención de 5-gramas0,00%
Media0,50%
Percentil 953,46%
Máximo8,82%
Plantillas por encima del 10%0
Contención de 3-gramas, mediana / máximo0,31% / 13,89%

El pase de 3-gramas sirve para detectar copias que se reformularon en lugar de reutilizarse; mueve las cifras, pero no la conclusión. El peor par del corpus es poster-quote-typography-modern-gradient frente a poster-bold-text-modern-gradient, con un 8,82%.

En las 232 plantillas: de 3448 frases distintas de seis palabras o más, 2 aparecen en más de una plantilla: «the results relate only to the items tested» y «no other graphic elements should intrude into this zone». Por diapositiva, de 992 diapositivas con 20 palabras o más, la mediana de contención con la diapositiva más cercana en cualquier otra plantilla es del 0,0%; 8 están por encima del 20% y ninguna por encima del 50%. La similitud temática medida por el coseno de bolsa de palabras, que ignora la redacción, es mayor, como debería ser para dos plantillas de currículum: mediana del 12,7% frente al par más cercano de la misma familia, máximo del 35,3%.

El límite honesto: esto es 232 de 3926 plantillas y 117 en el conjunto de vecino garantizado más cercano. Es una prueba sobre la parte más difícil del corpus, no una demostración sobre la totalidad.

Lo que decidimos

La auditoría elimina la objeción de duplicación a la publicación del texto de las diapositivas. No publicamos los cuerpos de las diapositivas. Publicamos los títulos de las diapositivas, que ya existían en el registro de la plantilla y se estaban obteniendo y descartando.

Comprobado en las 3926 plantillas antes de publicarlas: 14.969 títulos, ninguno vacío, ninguno un simple «Slide N» o «Page N», y slide_titles.length igual a slide_count en cada una. Se registraron dos límites en lugar de suavizarlos: 156 títulos (1,0%) terminan en «… Page N», y en 77 plantillas (2%) todos los títulos lo hacen. 1321 plantillas (34%) tienen una sola diapositiva y no obtienen ninguna lista.

Por lo tanto, el cambio llega a 2605 páginas y añade una mediana de 15 palabras a cada una, una media de 10,4 palabras por página en todo el corpus. Eso es real y es pequeño. No saca por sí solo a una página del territorio de contenido escaso, y la parte más útil puede ser que los títulos son clicables: saltar a la diapositiva 7 antes requería pulsar Siguiente seis veces.

La misma rama enlaza las plantillas que no tenían enlaces. Las páginas de exploración fijaban la relación de aspecto a 16:9, que es aproximadamente el 45 % de la colección, así que el resto no aparecía en ninguna página principal ni en ningún bloque relacionado: /templates?category=document y ?category=poster devolvían una página «coming soon» sin enlaces a plantillas. Una página sin enlaces internos no le debe nada a un lector, porque ningún lector llega a ella.

No desplegado, y una pregunta aún abierta

Nada de esto está publicado. Es la pull request 10 en Sophon-LLC/ppt-ai, abierta el 15 de septiembre de 2026 y todavía abierta el 16 de septiembre de 2026, con tres commits, verificada con una comprobación de tipos, una ejecución de linter y una compilación de producción servida desde el datastore en producción. Hasta que se fusione, las páginas son como se midieron al principio de esta entrada.

La cuestión abierta es la que la auditoría no responde. El conjunto medido contiene una mediana de 288 palabras de cuerpo de texto por plantilla, frente a las 19 a 31 palabras específicas de la plantilla que una página muestra hoy. La auditoría dice que el texto no es duplicado. No dice si el texto escrito para rellenar un diseño se lee como contenido para una persona en lugar de como relleno, y nadie ha medido eso. Publicar 3926 páginas basándonos únicamente en un resultado de duplicación sería responder a una pregunta que no hemos hecho.

Todas las entradas