PPT AI zverejňuje 3 926 šablón prezentácií, pričom každá má vlastnú stránku na ppt.sophoninc.com. Stránka, ktorej úlohou je ukázať dizajn, musí byť stále čitateľná pre niekoho, kto dizajn ešte nevidí, alebo kto sa rozhoduje medzi dvoma. To znamená prinajmenšom: na čo je prezentácia určená, čo je na každej snímke, koľko snímok a v akej veľkosti, čo sa dá zmeniť a ako začať. Tento príspevok je o tom, ako sme zisťovali, ako ďaleko od toho naše stránky boli, a čo sme merali pred pridaním čohokoľvek.
Čo dnes stránka so šablónou vykresľuje
Dňa 16. septembra 2026 boli načítané a spočítané štyri stránky so šablónami. Metóda počítania: odstrániť elementy script a style, odstrániť zostávajúce značky, dekódovať HTML entity, vybrať slovné tokeny zodpovedajúce [A-Za-z0-9][A-Za-z0-9’'&-]* a pred spočítaním jedinečných ich previesť na malé písmená. Tokenizér je uvedený, pretože počty jedinečných slov sa v závislosti od neho menia o niekoľko slov.
| Stránka | Počet slov | Jedinečné slová | Jedinečné slová mimo zdieľaných prvkov |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
„Shared chrome“ je 60 jedinečných slov spoločných pre všetky štyri stránky: navigácia, päta stránky, navigačná cesta a dve výzvy na akciu. Ak ich odstránite, na každej stránke zostane 19 až 31 jedinečných slov, ktoré sa týkajú danej šablóny. Zvyšok stránky je na 3 926 stránkach rovnaký.
Pre kontext, za tri mesiace do 16. septembra 2026 tieto stránky zaznamenali 484 zobrazení a 7 kliknutí s priemernou pozíciou 20,2, a to na 187 jedinečných stránkach a pri 12 jedinečných dopytoch. Tento údaj pochádza z Google Search Console pre sc-domain:sophoninc.com, filtrovaný na ppt.sophoninc.com/templates/. Search Console je viditeľná iba pre vlastníkov služby. Služba, filter a časové obdobie sú uvedené, aby si to mohol ktokoľvek s prístupom zopakovať, čo je najvyššia možná miera overiteľnosti pre tento zdroj.
Otázka, na ktorú mal audit odpovedať
Snímky každej šablóny obsahujú text: nadpisy, menovky, text tela napísaný na vyplnenie dizajnu. Je verejne dostupný na /api/v2/templates/<slug>/slides/<n> a je zrejmé, že by sa mal umiestniť na stránku. Predtým je však potrebné vyriešiť jednu námietku: 3 926 stránok s generovaným textom prezentácie by mohlo byť 3 926 takmer identických stránok, čo je horšie ako 3 926 stránok s riedkym obsahom.
Takže: koľko textu zdieľa šablóna so šablónou, ktorej sa najviac podobá?
Prečo rovnomerná vzorka dáva nesprávnu odpoveď
Naívnou metódou je náhodne vyberať šablóny a porovnávať dvojice. Táto metóda nedokáže nájsť duplicitu v tomto korpuse a stojí za to presne vysvetliť prečo.
Knižnica je usporiadaná podľa kategórie, receptu a rodiny štýlov. Náhodný pár vybraný z 3 926 položiek je s drvivou prevahou pár z rôznych kategórií o rôznych témach. Tieto páry nemajú takmer nič spoločné, bez ohľadu na to, aký duplicitný je korpus. Zmerali sme to: 392 náhodných párov z rôznych rodín má medián 5-gramovej zhody 0,00 % a maximum 0,3 %. Jednotná vzorka vráti „the corpus is unique“ ako artefakt vzorkovania, nie ako zistenie.
Dvojice, ktoré by odhalili duplicitu, sú najbližší susedia a tvoria mizivý zlomok všetkých dvojíc. Vzorka bola preto vážená v ich prospech. Šablóny boli zoskupené podľa kategórie, slugu receptu a rodiny štýlov a bolo vybraných 33 skupín štyroch druhov:
- číslované dvojčatá, kde sa slugy líšia iba koncovkou
-2alebo-3(8 skupín) - rovnaký recept a rovnaká rodina štýlov (4 skupiny)
- rovnaká rodina štýlov, iný recept (13 skupín)
- skupiny pre pokrytie, jedna pre každú kategóriu, aby žiadna kategória neostala nezmeraná (8 skupín)
Následne bol 16. septembra 2026 získaný text snímok pre každého člena každej skupiny: 232 šablón, 1 034 snímok, 0 chýb pri načítaní. To je 5,9 % korpusu, vybraných tak, aby to bolo najnáročnejších 5,9 %.
Rozhodujúci krok
Váženie vzorky samo osebe stále nestačí, pretože skutočný najbližší sused šablóny môže byť taký, ktorý nebol načítaný, čo by podhodnotilo prekrytie. Preto druhý prechod obmedzil porovnanie na klastre, kde bol načítaný každý člen: 46 kompletných klastrov, 117 šablón. V rámci nich je zaručené, že najbližší sused šablóny v celom korpuse 3 926 šablón sa nachádza v meranej množine.
Metrikou je 5-gramové obsiahnutie: podiel jedinečných päťslovných sekvencií šablóny, ktoré sa vyskytujú aj v jej najbližšom páre. Obsiahnutie namiesto Jaccardovho indexu, pretože je asymetrické – krátka šablóna úplne obsiahnutá v dlhej by sa mala javiť ako úplne duplikovaná a Jaccardov index by ju označil za čiastočne jedinečnú.
Výsledky pre týchto 117 šablón v porovnaní so skutočným najbližším susedom v korpuse:
| Metrika | Hodnota |
|---|---|
| Medián 5-gramového obsiahnutia | 0,00% |
| Priemer | 0,50% |
| 95. percentil | 3,46% |
| Maximum | 8,82% |
| Šablóny nad 10 % | 0 |
| 3-gramové obsiahnutie, medián / maximum | 0,31% / 13,89% |
3-gramový prechod slúži na zachytenie kópie, ktorá bola preformulovaná, nie znovu použitá; mení čísla, ale nie záver. Najhorší pár v korpuse je poster-quote-typography-modern-gradient oproti poster-bold-text-modern-gradient s 8,82 %.
Zo všetkých 232 šablón: z 3 448 jedinečných viet so šiestimi alebo viacerými slovami sa 2 objavujú vo viac ako jednej šablóne – „the results relate only to the items tested“ a „no other graphic elements should intrude into this zone“. Na snímku: z 992 snímok s 20 alebo viacerými slovami je medián obsiahnutia s najbližším snímkom v akejkoľvek inej šablóne 0,0 %; 8 je nad 20 % a žiadna nie je nad 50 %. Tematická podobnosť meraná kosínusovou podobnosťou bag-of-words, ktorá ignoruje formuláciu, je vyššia, ako by mala byť pre dve šablóny životopisov: medián 12,7 % oproti najbližšiemu páru z rovnakej rodiny, maximum 35,3 %.
Úprimné obmedzenie: ide o 232 z 3 926 šablón a 117 v množine so zaručeným najbližším susedom. Je to dôkaz o najťažšej časti korpusu, nie dôkaz o celom korpuse.
O čom sme rozhodli
Audit odstraňuje námietku proti duplicite pri zverejňovaní textu snímok. Telá snímok sme nezverejnili. Zverejnili sme názvy snímok, ktoré už existovali v zázname šablóny a boli načítavané a zahadzované.
Skontrolované vo všetkých 3 926 šablónach pred ich zverejnením: 14 969 názvov, žiadny prázdny, žiadny len „Slide N“ alebo „Page N“ a slide_titles.length sa rovná slide_count v každej z nich. Dve obmedzenia boli zaznamenané, nie vyhladené: 156 názvov (1,0 %) končí na „… Page N“ a v 77 šablónach (2 %) tak končí každý názov. 1 321 šablón (34 %) má jednu snímku a nedostane žiadny zoznam.
Zmena sa teda týka 2 605 stránok a pridáva medián 15 slov na každú, čo je v priemere 10,4 slova na stránku v celom korpuse. Je to skutočné a je to málo. Samo osebe to nevyradí stránku z kategórie s riedkym obsahom a užitočnejšou časťou môže byť, že názvy sú klikateľné: predtým si skok na snímku 7 vyžadoval šesťkrát stlačiť tlačidlo Ďalej.
Rovnaká vetva odkazuje na šablóny, na ktoré nič neodkazovalo. Stránky na prehliadanie mali napevno nastavený pomer strán na 16:9, čo je asi 45 % knižnice. Zvyšok sa teda neobjavil na žiadnej hlavnej stránke ani v súvisiacom bloku: /templates?category=document a ?category=poster vracali stránku „coming soon“ bez akýchkoľvek odkazov na šablóny. Stránka, na ktorú nevedie žiadny interný odkaz, nedlhuje čitateľovi nič, pretože žiadny čitateľ na ňu nepríde.
Nenasadené a jedna otvorená otázka
Nič z toho nie je v prevádzke. Je to pull request 10 na Sophon-LLC/ppt-ai, otvorený 15. septembra 2026 a stále otvorený 16. septembra 2026, tri commity, overené kontrolou typov, spustením lintu a produkčným buildom spusteným oproti živému datastore. Kým sa nezlúči, stránky sú také, ako boli zmerané na začiatku tohto príspevku.
Otvorená otázka je tá, na ktorú audit neodpovedá. Meraná množina obsahuje medián 288 slov hlavného textu na šablónu, oproti 19 až 31 slovám špecifickým pre šablónu, ktoré stránka dnes zobrazuje. Audit hovorí, že tento text nie je duplicitný. Nehovorí, že text napísaný na vyplnenie rozloženia vníma človek ako obsah a nie ako výplň, a to nikto nemeral. Zverejniť 3 926 stránok tohto textu len na základe výsledku o duplicite by znamenalo odpovedať na otázku, ktorú sme si nepoložili.