PPT AI publiceert 3.926 presentatietemplates, elk met een eigen pagina op ppt.sophoninc.com. Een pagina die bedoeld is om een ontwerp te tonen, moet nog steeds leesbaar zijn voor iemand die het ontwerp nog niet kan zien, of die tussen twee ervan kiest. Dat betekent op zijn minst: waarvoor het deck is, wat er op elke slide staat, hoeveel slides en in welk formaat, wat er kan worden gewijzigd en hoe je begint. Deze post gaat erover hoe we hebben ontdekt hoe ver onze pagina's daarvan af stonden, en wat we hebben gemeten voordat we iets toevoegden.
Wat een templatepagina vandaag de dag rendert
Vier templatepagina's werden opgehaald en geteld op 16 september 2026. Telmethode: verwijder script- en style-elementen, verwijder de overige tags, decodeer HTML-entiteiten, neem woordtokens die overeenkomen met [A-Za-z0-9][A-Za-z0-9’'&-]*, en zet ze om naar kleine letters voordat je de unieke woorden telt. De tokenizer wordt vermeld omdat de tellingen van unieke woorden er met een paar woorden van afhangen.
| Pagina | Totaal aantal woorden | Unieke woorden | Unieke woorden buiten de gedeelde chrome |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
“Shared chrome” zijn de 60 unieke woorden die de vier pagina's gemeen hebben: de navigatie, de voettekst, het broodkruimelpad en de twee calls-to-action. Haal je die weg, dan gaan op elke pagina tussen de 19 en 31 unieke woorden over die template. De rest van de pagina is op 3.926 pagina's hetzelfde.
Ter context: in de drie maanden tot 16 september 2026 leverden die pagina's 484 vertoningen en 7 klikken op met een gemiddelde positie van 20,2, verspreid over 187 unieke pagina's en 12 unieke zoekopdrachten. Dit cijfer komt uit Google Search Console voor sc-domain:sophoninc.com, gefilterd op ppt.sophoninc.com/templates/. Search Console is alleen zichtbaar voor de eigenaren van de property; de property, het filter en de datumperiode worden gegeven zodat iedereen met toegang het kan reproduceren, wat zo controleerbaar is als die bron kan zijn.
De vraag die de audit moest beantwoorden
De slides van elke template bevatten tekst: koppen, labels, bodytekst geschreven om het ontwerp te vullen. Deze wordt publiekelijk aangeboden op /api/v2/templates/<slug>/slides/<n>, en het is het meest voor de hand liggende om op de pagina te zetten. Voordat we dat doen, moet één bezwaar worden beantwoord: 3.926 pagina's met gegenereerde deck-tekst zouden 3.926 bijna identieke pagina's kunnen zijn, wat erger is dan 3.926 pagina's met weinig inhoud.
Dus: hoeveel tekst deelt een template met het template waar het het meest op lijkt?
Waarom een uniforme steekproef het verkeerde antwoord geeft
De naïeve methode is om willekeurig templates te nemen en paren te vergelijken. Die methode kan geen duplicatie vinden in dit corpus, en het is de moeite waard om precies uit te leggen waarom.
De bibliotheek is georganiseerd per categorie, per recept en per stijlfamilie. Een willekeurig paar getrokken uit 3.926 items is vrijwel altijd een paar uit verschillende categorieën over verschillende onderwerpen. Die paren hebben bijna niets gemeen, hoe dupliceerbaar het corpus ook is. We hebben het gemeten: 392 willekeurige paren uit verschillende families hebben een mediane 5-gram-insluiting van 0,00% en een maximum van 0,3%. Een uniforme steekproef levert “the corpus is unique” op als een artefact van de steekproef, niet als een bevinding.
De paren die duplicatie zouden onthullen, zijn de naaste buren, en zij vormen een verwaarloosbaar deel van alle paren. De steekproef werd dus naar hen gewogen. Templates werden gegroepeerd per categorie, recept-slug en stijlfamilie, en er werden 33 groepen getrokken uit vier soorten:
- genummerde tweelingen, waarbij de slugs alleen verschillen door een afsluitende
-2of-3(8 groepen) - zelfde recept en zelfde stijlfamilie (4 groepen)
- zelfde stijlfamilie, ander recept (13 groepen)
- dekkingsgroepen, één per categorie, zodat geen enkele categorie ongemeten blijft (8 groepen)
Vervolgens werd de tekst van de dia's opgehaald voor elk lid van elke groep: 232 templates, 1.034 dia's, 0 ophaalfouten, op 16 september 2026. Dat is 5,9% van het corpus, gekozen als de moeilijkste 5,9%.
De beslissende stap
Het wegen van de steekproef is op zichzelf nog niet genoeg, omdat de ware naaste buur van een template er een kan zijn die niet is opgehaald, wat de overlap zou onderschatten. Daarom beperkte een tweede stap de vergelijking tot clusters waarvan elk lid was opgehaald: 46 complete clusters, 117 templates. Daarbinnen is de naaste buur van een template in het hele corpus van 3.926 templates gegarandeerd aanwezig in de gemeten set.
De meetwaarde is 5-gram-containment: de fractie van de unieke reeksen van vijf woorden van een template die ook voorkomen in zijn naaste buur. Containment in plaats van Jaccard omdat het asymmetrisch is: een kort template dat volledig in een lang template is opgenomen, moet als volledig gedupliceerd worden beschouwd, terwijl Jaccard het als deels uniek zou rapporteren.
Resultaten voor die 117 templates, vergeleken met de ware naaste buur in het corpus:
| Meetwaarde | Waarde |
|---|---|
| Mediane 5-gram-containment | 0,00% |
| Gemiddelde | 0,50% |
| 95e percentiel | 3,46% |
| Maximum | 8,82% |
| Templates boven 10% | 0 |
| 3-gram-containment, mediaan / maximum | 0,31% / 13,89% |
De 3-gram-controle is er om tekst te vangen die is herschreven in plaats van hergebruikt; het verandert de cijfers, maar niet de conclusie. Het slechtste paar in het corpus is poster-quote-typography-modern-gradient tegen poster-bold-text-modern-gradient, met 8,82%.
Voor alle 232 sjablonen geldt: van de 3.448 unieke zinnen van zes woorden of meer, komen er 2 in meer dan één sjabloon voor: “the results relate only to the items tested” en “no other graphic elements should intrude into this zone”. Per dia, van de 992 dia's met 20 woorden of meer, is de mediane overlap met de meest vergelijkbare dia in een ander sjabloon 0,0%; 8 liggen boven de 20% en geen enkele boven de 50%. De thematische gelijkenis, gemeten met bag-of-words-cosinus die de formulering negeert, is hoger, zoals het hoort voor twee cv-sjablonen: mediaan 12,7% ten opzichte van de meest vergelijkbare uit dezelfde familie, maximum 35,3%.
De eerlijke beperking: dit zijn 232 van de 3.926 sjablonen en 117 in de set met gegarandeerd de meest vergelijkbare. Het is bewijs over het moeilijkste deel van het corpus, geen bewijs over het geheel.
Wat we hebben besloten
De audit neemt het bezwaar van duplicatie tegen het publiceren van diatekst weg. We hebben de hoofdtekst van de dia's niet gepubliceerd. We hebben de diatitels gepubliceerd, die al bestonden in de sjabloongegevens en werden opgehaald en weggegooid.
Gecontroleerd voor alle 3.926 sjablonen voordat we ze publiceerden: 14.969 titels, geen enkele leeg, geen enkele een kaal “Slide N” of “Page N”, en slide_titles.length is gelijk aan slide_count bij elke sjabloon. Twee beperkingen werden vastgelegd in plaats van gladgestreken: 156 titels (1,0%) eindigen op “… Page N”, en bij 77 sjablonen (2%) doen alle titels dat. 1.321 sjablonen (34%) hebben een enkele dia en krijgen helemaal geen lijst.
De wijziging bereikt dus 2.605 pagina's en voegt een mediaan van 15 woorden aan elke pagina toe, een gemiddelde van 10,4 woorden per pagina over het hele corpus. Dat is reëel en het is weinig. Het haalt een pagina op zichzelf niet uit de categorie 'thin content', en het nuttigste deel is misschien dat de titels klikbaar zijn: om naar dia 7 te springen moest je voorheen zes keer op Volgende drukken.
Dezelfde branch linkt de sjablonen waar niets naar linkte. De overzichtspagina's stelden aspect_ratio vast op 16:9, wat ongeveer 45% van de bibliotheek is, dus de rest verscheen op geen enkele hubpagina en in geen enkel gerelateerd blok: /templates?category=document en ?category=poster gaven een “coming soon”-pagina zonder sjabloonlinks. Een pagina zonder interne link ernaartoe is een lezer niets verschuldigd, omdat er geen lezer aankomt.
Niet doorgevoerd, en één vraag nog open
Niets van dit is live. Het is pull request 10 op Sophon-LLC/ppt-ai, geopend op 15 september 2026 en nog steeds open op 16 september 2026, drie commits, geverifieerd met een type check, een lint run en een production build die draait tegen de live datastore. Totdat het wordt samengevoegd, zijn de pagina's zoals gemeten aan het begin van dit bericht.
De open vraag is degene die de audit niet beantwoordt. De gemeten set bevat een mediaan van 288 woorden hoofdtekst per sjabloon, tegenover de 19 tot 31 sjabloonspecifieke woorden die een pagina vandaag de dag weergeeft. De audit zegt dat die tekst niet dubbel is. Het zegt niet dat tekst die is geschreven om een lay-out te vullen, voor een persoon leest als inhoud in plaats van als opvulling, en niemand heeft dat gemeten. 3.926 pagina's ervan publiceren, enkel op basis van een duplicatieresultaat, zou een antwoord zijn op een vraag die we niet hebben gesteld.