Blogg

Vad en mallsida är skyldig en läsare

Våra 3 926 mallsidor återger cirka 90 distinkta ord vardera. Vad vi mätte innan vi lade till fler, varför urvalet var viktat och vad det visade.

Publicerad

PPT AI publicerar 3 926 presentationsmallar, var och en med en egen sida på ppt.sophoninc.com. En sida vars uppgift är att visa en design måste fortfarande vara läsbar för någon som inte kan se designen än, eller som väljer mellan två av dem. Det betyder åtminstone: vad presentationen är till för, vad som finns på varje bild, hur många bilder och i vilken storlek, vad som kan ändras och hur man börjar. Detta inlägg handlar om att ta reda på hur långt våra sidor var från det, och vad vi mätte innan vi lade till något.

Vad en mallsida återger idag

Fyra mallsidor hämtades och räknades den 16 september 2026. Räknemetod: ta bort elementen script och style, ta bort de återstående taggarna, avkoda HTML-entiteter, ta ord-tokens som matchar [A-Za-z0-9][A-Za-z0-9’'&-]* och konvertera dem till gemener innan unika ord räknas. Tokenizern anges eftersom antalet unika ord varierar med några ord beroende på den.

SidaLöpande ordUnika ordUnika ord utöver gemensamma element
brand-agency-book-editorial-dark1489131
medical-blood-test-clean-corporate1428828
resume-illustrator-professional-blue1479030
poster-bold-text-modern-gradient1347919

”Shared chrome” är de 60 unika ord som är gemensamma för alla fyra sidor: navigeringen, sidfoten, brödsmulestigen och de två uppmaningarna. Tar du bort dem handlar mellan 19 och 31 unika ord på varje sida om den mallen. Resten av sidan är densamma på 3 926 sidor.

Som kontext kan nämnas att under de tre månaderna fram till 16 september 2026 fick dessa sidor 484 exponeringar och 7 klick med en genomsnittlig position på 20,2, fördelat på 187 unika sidor och 12 unika sökfrågor. Siffran kommer från Google Search Console för sc-domain:sophoninc.com, filtrerat på ppt.sophoninc.com/templates/. Search Console är endast synligt för egendomens ägare; egendomen, filtret och datumintervallet anges så att alla med åtkomst kan återskapa resultatet, vilket är så kontrollerbart som den källan blir.

Frågan som granskningen skulle besvara

Varje malls bilder innehåller text: rubriker, etiketter och brödtext skriven för att fylla ut designen. Den serveras offentligt på /api/v2/templates/<slug>/slides/<n>, och det är det självklara innehållet att lägga på sidan. Innan vi gör det måste en invändning bemötas: 3 926 sidor med genererad presentationstext skulle kunna bli 3 926 nästan identiska sidor, vilket är värre än 3 926 sidor med tunt innehåll.

Så: hur mycket text delar en mall med den mall den mest liknar?

Varför ett slumpmässigt urval ger fel svar

Den naiva metoden är att slumpmässigt välja ut mallar och jämföra dem parvis. Den metoden kan inte hitta duplicering i denna korpus, och det är värt att vara exakt med varför.

Biblioteket är organiserat efter kategori, recept och stilfamilj. Ett slumpmässigt par draget från 3 926 objekt är i överväldigande grad ett par från olika kategorier om olika ämnen. Dessa par delar nästan ingenting oavsett hur duplicerande korpusen är. Vi mätte det: 392 slumpmässiga par från olika familjer har en medianinneslutning av 5-gram på 0,00 % och ett maximum på 0,3 %. Ett enhetligt urval returnerar ”the corpus is unique” som en artefakt av urvalet, inte som ett resultat.

De par som skulle avslöja duplicering är de närmaste grannarna, och de utgör en försvinnande liten andel av alla par. Därför viktades urvalet mot dem. Mallar grupperades efter kategori, receptslug och stilfamilj, och 33 grupper valdes ut från fyra olika sorter:

  • numrerade tvillingar, där sluggarna endast skiljer sig åt med ett efterföljande -2 eller -3 (8 grupper)
  • samma recept och samma stilfamilj (4 grupper)
  • samma stilfamilj, olika recept (13 grupper)
  • täckningsgrupper, en per kategori, så att ingen kategori förblir omätt (8 grupper)

Bildtext hämtades sedan för varje medlem i varje grupp: 232 mallar, 1 034 bilder, 0 hämtningsfel, den 16 september 2026. Det är 5,9 % av korpusen, utvalda för att vara de svåraste 5,9 %.

Den avgörande genomgången

Att vikta urvalet räcker ändå inte i sig. En malls verkliga närmaste granne kan vara en som inte hämtades, vilket skulle underskatta överlappningen. Därför begränsade en andra körning jämförelsen till kluster där varje medlem hade hämtats: 46 kompletta kluster, 117 mallar. Inom dessa är en malls närmaste granne i hela korpusen på 3 926 mallar garanterat med i den uppmätta uppsättningen.

Måttet är 5-gramsinneslutning: andelen av en malls distinkta femordssekvenser som också förekommer i dess närmaste granne. Inneslutning snarare än Jaccard eftersom det är asymmetriskt – en kort mall som helt och hållet ryms i en lång bör räknas som helt duplicerad, och Jaccard skulle rapportera den som delvis unik.

Resultat för dessa 117 mallar, mot den verkliga närmaste grannen i korpusen:

MåttVärde
Median för 5-gramsinneslutning0,00%
Medelvärde0,50%
95:e percentilen3,46%
Maximum8,82%
Mallar över 10 %0
3-gramsinneslutning, median/maximum0,31% / 13,89%

Körningen med 3-gram finns för att fånga upp text som har omformulerats snarare än återanvänts; den ändrar siffrorna men inte slutsatsen. Det sämsta paret i korpusen är poster-quote-typography-modern-gradient mot poster-bold-text-modern-gradient, med 8,82 %.

För alla 232 mallar: av 3 448 distinkta meningar på sex ord eller mer förekommer 2 i mer än en mall – ”the results relate only to the items tested” och ”no other graphic elements should intrude into this zone”. Per bild, av 992 bilder med 20 ord eller mer, är medianinneslutningen med den närmaste bilden i någon annan mall 0,0 %; 8 ligger över 20 % och ingen ligger över 50 %. Tematisk likhet mätt med bag-of-words cosinus, som ignorerar formulering, är högre, vilket den bör vara för två CV-mallar: median 12,7 % mot den närmaste grannen i samma familj, maximum 35,3 %.

Den ärliga begränsningen: detta är 232 av 3 926 mallar och 117 i uppsättningen med garanterat närmaste granne. Det är belägg om den svåraste delen av korpusen, inte ett bevis om hela.

Vad vi beslutade

Revisionen undanröjer invändningen om duplicering mot att publicera bildtext. Vi publicerade inte bildernas brödtext. Vi publicerade bildtitlarna, som redan fanns i mallposten och som hämtades och kasserades.

Kontrollerat för alla 3 926 mallar innan de publicerades: 14 969 titlar, ingen tom, ingen enbart ”Slide N” eller ”Page N”, och slide_titles.length är lika med slide_count för varenda en. Två begränsningar noterades snarare än slätades över: 156 titlar (1,0 %) slutar på ”… Page N”, och på 77 mallar (2 %) gör varje titel det. 1 321 mallar (34 %) har en enda bild och får ingen lista alls.

Ändringen når därför 2 605 sidor och lägger till en median på 15 ord till varje, ett medelvärde på 10,4 ord per sida över hela korpusen. Det är verkligt och det är litet. Det tar inte i sig en sida ur territoriet för tunt innehåll, och den mer användbara delen kan vara att titlarna är klickbara: att hoppa till bild 7 krävde tidigare att man tryckte på Nästa sex gånger.

Samma gren länkar till de mallar som inget annat länkade till. Bläddringsytorna låste aspect_ratio till 16:9, vilket är cirka 45 % av biblioteket, så resten dök varken upp på någon hubbsida eller i något relaterat block: /templates?category=document och ?category=poster returnerade en ”coming soon”-sida med noll mallänkar. En sida utan interna länkar till sig är inte skyldig en läsare någonting, eftersom ingen läsare kommer dit.

Inte driftsatt, och en fråga fortfarande öppen

Inget av detta är live. Det är pull request 10 på Sophon-LLC/ppt-ai, öppnad 15 september 2026 och fortfarande öppen 16 september 2026, tre commits, verifierad med en typkontroll, en lint-körning och en produktions-build som körs mot den live databasen. Tills den slås samman är sidorna som uppmätts i början av detta inlägg.

Den öppna frågan är den som revisionen inte besvarar. Den uppmätta uppsättningen innehåller en median på 288 ord brödtext per mall, jämfört med de 19 till 31 mallspecifika ord som en sida återger idag. Revisionen säger att texten inte är duplicerad. Den säger inte att text skriven för att fylla en layout läses som innehåll för en person snarare än som utfyllnad, och ingen har mätt det. Att publicera 3 926 sidor av den enbart på grundval av ett dupliceringsresultat skulle vara att besvara en fråga vi inte ställde.

Alla inlägg