Blog

Hvad en skabelonside skylder en læser

Vores 3.926 skabelonsider gengiver omkring 90 forskellige ord hver. Hvad vi målte, før vi tilføjede flere, hvorfor stikprøven var vægtet, og hvad den fandt.

Udgivet

PPT AI udgiver 3.926 præsentationsskabeloner, hver med sin egen side på ppt.sophoninc.com. En side, hvis opgave er at vise et design, skal stadig være læselig for en, der endnu ikke kan se designet, eller som er ved at beslutte sig mellem to af dem. Det betyder mindst: hvad præsentationen er til, hvad der er på hver slide, hvor mange slides og i hvilken størrelse, hvad der kan ændres, og hvordan man kommer i gang. Dette indlæg handler om at finde ud af, hvor langt vores sider var fra det, og hvad vi målte, før vi tilføjede noget.

Hvad en skabelonside gengiver i dag

Fire skabelonsider blev hentet og talt op den 16. september 2026. Tællemetode: fjern script- og style-elementer, fjern de resterende tags, unescape HTML-entiteter, tag ord-tokens, der matcher [A-Za-z0-9][A-Za-z0-9’'&-]*, og konverter dem til små bogstaver, før de unikke tælles. Tokenizeren er angivet, fordi antallet af unikke ord ændrer sig med et par ord afhængigt af den.

SideAntal ordUnikke ordUnikke ord uden for den delte chrome
brand-agency-book-editorial-dark1489131
medical-blood-test-clean-corporate1428828
resume-illustrator-professional-blue1479030
poster-bold-text-modern-gradient1347919

“Shared chrome” er de 60 forskellige ord, der er fælles for alle fire sider: navigationen, sidefoden, brødkrummestien og de to opfordringer til handling. Fjern dem, og mellem 19 og 31 forskellige ord på hver side handler om den pågældende skabelon. Resten af siden er den samme på 3.926 sider.

Til sammenligning fik disse sider i de tre måneder frem til 16. september 2026 484 eksponeringer og 7 klik med en gennemsnitlig placering på 20,2, fordelt på 187 unikke sider og 12 unikke søgeforespørgsler. Dette tal kommer fra Google Search Console for sc-domain:sophoninc.com, filtreret til ppt.sophoninc.com/templates/. Search Console er kun synlig for ejendommens ejere; ejendommen, filteret og datointervallet er angivet, så alle med adgang kan gengive det, hvilket er så verificerbart, som den kilde kan blive.

Spørgsmålet, som revisionen skulle besvare

Hver skabelons slides indeholder tekst: overskrifter, etiketter, brødtekst skrevet for at udfylde designet. Den serveres offentligt på /api/v2/templates/<slug>/slides/<n>, og det er det oplagte at sætte på siden. Før man gør det, skal én indvending besvares: 3.926 sider med genereret præsentationstekst kunne være 3.926 næsten identiske sider, hvilket er værre end 3.926 sider med tyndt indhold.

Så: hvor meget tekst deler en skabelon med den skabelon, den ligner mest?

Hvorfor en ensartet stikprøve giver det forkerte svar

Den naive metode er at udtage tilfældige skabeloner og sammenligne par. Den metode kan ikke finde duplikering i dette korpus, og det er værd at være præcis omkring hvorfor.

Biblioteket er organiseret efter kategori, efter opskrift og efter stilfamilie. Et tilfældigt par trukket fra 3.926 elementer er altovervejende et par fra forskellige kategorier om forskellige emner. Disse par har næsten intet til fælles, uanset hvor duplikativt korpusset er. Vi målte det: 392 tilfældige par på tværs af familier har en median 5-gram-indeslutning på 0,00 % og et maksimum på 0,3 %. En ensartet stikprøve returnerer “the corpus is unique” som en artefakt af stikprøveudtagningen, ikke som et fund.

De par, der ville afsløre duplikering, er de nærmeste naboer, og de udgør en forsvindende lille brøkdel af alle par. Derfor blev stikprøven vægtet mod dem. Skabeloner blev grupperet efter kategori, opskrifts-slug og stilfamilie, og 33 grupper blev udvalgt på tværs af fire slags:

  • nummererede tvillinger, hvor slugs kun adskiller sig ved et efterstillet -2 eller -3 (8 grupper)
  • samme opskrift og samme stilfamilie (4 grupper)
  • samme stilfamilie, forskellig opskrift (13 grupper)
  • dækningsgrupper, én pr. kategori, så ingen kategori er umålt (8 grupper)

Slidetekst blev derefter hentet for hvert medlem af hver gruppe: 232 skabeloner, 1.034 slides, 0 hentefejl, den 16. september 2026. Det er 5,9 % af korpusset, valgt til at være de sværeste 5,9 %.

Den afgørende gennemgang

At vægte stikprøven er stadig ikke nok i sig selv, fordi en skabelons sande nærmeste nabo kunne være en, der ikke blev hentet, hvilket ville underdrive overlapningen. Så en anden gennemgang begrænsede sammenligningen til klynger, hvor hvert medlem var blevet hentet: 46 komplette klynger, 117 skabeloner. Inden for disse er en skabelons nærmeste nabo i hele korpusset på 3.926 skabeloner garanteret at være i det målte sæt.

Målingen er 5-gram-indeslutning: den andel af en skabelons distinkte femordssekvenser, der også forekommer i dens nærmeste modstykke. Indeslutning frem for Jaccard, fordi den er asymmetrisk – en kort skabelon, der er fuldstændig indeholdt i en lang, bør læses som fuldt duplikeret, og Jaccard ville rapportere den som delvist unik.

Resultater for de 117 skabeloner, mod den sande nærmeste nabo i korpusset:

MålingVærdi
Median 5-gram-indeslutning0,00%
Gennemsnit0,50%
95. percentil3,46%
Maksimum8,82%
Skabeloner over 10 %0
3-gram-indeslutning, median / maksimum0,31% / 13,89%

3-gram-gennemgangen er med for at fange kopi, der blev omformuleret snarere end genbrugt; den flytter tallene, men ikke konklusionen. Det værste par i korpusset er poster-quote-typography-modern-gradient mod poster-bold-text-modern-gradient, med 8,82 %.

På tværs af alle 232 skabeloner: ud af 3.448 distinkte sætninger på seks ord eller mere, optræder 2 i mere end én skabelon – “the results relate only to the items tested” og “no other graphic elements should intrude into this zone”. Per slide, ud af 992 slides med 20 ord eller mere, er medianindeslutningen med det nærmeste slide i enhver anden skabelon 0,0 %; 8 er over 20 %, og ingen er over 50 %. Topisk lighed målt ved bag-of-words-cosinus, som ignorerer formulering, er højere, som den bør være for to CV-skabeloner: median 12,7 % mod det nærmeste modstykke i samme familie, maksimum 35,3 %.

Den ærlige begrænsning: dette er 232 af 3.926 skabeloner og 117 i sættet med garanteret nærmeste nabo. Det er belæg for den sværeste del af korpusset, ikke et bevis for det hele.

Hvad vi besluttede

Revisionen fjerner indvendingen om duplikering mod at udgive slidetekst. Vi udgav ikke slide-brødteksterne. Vi udgav slidetitlerne, som allerede eksisterede i skabelonposten og blev hentet og kasseret.

Tjekket på tværs af alle 3.926 skabeloner før udgivelse: 14.969 titler, ingen tomme, ingen blot “Slide N” eller “Page N”, og slide_titles.length lig med slide_count på hver eneste. To begrænsninger blev registreret i stedet for at blive glattet ud: 156 titler (1,0 %) slutter med “… Page N”, og på 77 skabeloner (2 %) gør hver titel det. 1.321 skabeloner (34 %) har et enkelt slide og får slet ingen liste.

Ændringen når derfor 2.605 sider og tilføjer en median på 15 ord til hver, et gennemsnit på 10,4 ord pr. side på tværs af korpusset. Det er reelt, og det er lidt. Det tager ikke i sig selv en side ud af kategorien for tyndt indhold, og den mere nyttige del er måske, at titlerne er klikbare: at hoppe til slide 7 krævede tidligere, at man trykkede på Næste seks gange.

Den samme branch linker til de skabeloner, som intet før linkede til. Gennemse-siderne fastlåste aspect_ratio til 16:9, hvilket er omkring 45 % af biblioteket, så resten dukkede ikke op på nogen hub-side eller i nogen relateret blok: /templates?category=document og ?category=poster returnerede en »coming soon«-side uden links til skabeloner. En side uden interne links skylder ikke en læser noget, for ingen læser ankommer.

Ikke implementeret, og et spørgsmål stadig åbent

Intet af dette er live. Det er pull request 10 på Sophon-LLC/ppt-ai, åbnet 15. september 2026 og stadig åben 16. september 2026, tre commits, verificeret med et type-tjek, en lint-kørsel og en produktions-build serveret mod den live datastore. Indtil den merges, er siderne som målt øverst i dette indlæg.

Det åbne spørgsmål er det, revisionen ikke besvarer. Det målte sæt indeholder en median på 288 ord brødtekst pr. skabelon, mod de 19 til 31 skabelonspecifikke ord, en side gengiver i dag. Revisionen siger, at teksten ikke er duplikeret. Den siger ikke, at tekst skrevet for at udfylde et layout læses som indhold for en person snarere end som fyld, og ingen har målt det. At udgive 3.926 sider af det alene på baggrund af et duplikeringsresultat ville være at besvare et spørgsmål, vi ikke stillede.

Alle indlæg