PPT AI zveřejňuje 3 926 šablon prezentací, každou s vlastní stránkou na ppt.sophoninc.com. Stránka, jejímž úkolem je ukázat design, musí být stále čitelná pro někoho, kdo design ještě nevidí nebo kdo se mezi dvěma rozhoduje. To znamená alespoň: k čemu je prezentace určena, co je na každém snímku, kolik snímků a v jaké velikosti, co lze změnit a jak začít. Tento příspěvek je o tom, jak jsme zjišťovali, jak daleko od toho naše stránky jsou, a co jsme měřili, než jsme cokoli přidali.
Co dnes stránka se šablonou vykresluje
Dne 16. září 2026 byly načteny a spočítány čtyři stránky se šablonami. Metoda počítání: odstranit prvky script a style, odstranit zbývající značky, dekódovat HTML entity, vzít slovní tokeny odpovídající [A-Za-z0-9][A-Za-z0-9’'&-]* a před počítáním unikátních je převést na malá písmena. Tokenizér je uveden, protože počet unikátních slov se v závislosti na něm o několik slov liší.
| Stránka | Celkový počet slov | Jedinečná slova | Jedinečná slova mimo sdílené prvky |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
„Shared chrome“ je 60 různých slov společných pro všechny čtyři stránky: navigace, zápatí, drobečková navigace a dvě výzvy k akci. Když je odstraníte, na každé stránce se dané šablony týká 19 až 31 různých slov. Zbytek obsahu je na 3 926 stránkách stejný.
Pro kontext: za tři měsíce do 16. září 2026 tyto stránky zaznamenaly 484 zobrazení a 7 prokliků při průměrné pozici 20,2, a to na 187 jedinečných stránkách a pro 12 jedinečných dotazů. Tento údaj pochází z Google Search Console pro sc-domain:sophoninc.com, s filtrem na ppt.sophoninc.com/templates/. Search Console je viditelná pouze pro vlastníky služby; služba, filtr a časové období jsou uvedeny, aby si to mohl kdokoli s přístupem ověřit, což je největší možná míra kontroly u tohoto zdroje.
Otázka, na kterou musel audit odpovědět
Snímky každé šablony obsahují text: nadpisy, popisky, textová pole vyplňující design. Je veřejně dostupný na adrese /api/v2/templates/<slug>/slides/<n> a je logické ho na stránku umístit. Než to uděláme, musíme vyřešit jednu námitku: 3 926 stránek s vygenerovaným textem prezentace by mohlo znamenat 3 926 téměř totožných stránek, což je horší než 3 926 stránek s malým obsahem.
Takže: kolik textu sdílí šablona se šablonou, které se nejvíce podobá?
Proč jednotný vzorek dává špatnou odpověď
Naivní metodou je náhodně vybrat vzorky šablon a porovnávat dvojice. Tato metoda nemůže v tomto korpusu najít duplikaci a stojí za to si přesně vysvětlit proč.
Knihovna je uspořádána podle kategorií, receptů a rodin stylů. Náhodný pár vybraný z 3 926 položek je s drtivou převahou pár z různých kategorií o různých tématech. Tyto páry nesdílejí téměř nic bez ohledu na to, jak duplicitní je korpus. Změřili jsme to: 392 náhodných párů z různých rodin má medián 5-gram containment 0,00 % a maximum 0,3 %. Jednotný vzorek vrátí „the corpus is unique“ jako artefakt vzorkování, nikoli jako zjištění.
Dvojice, které by odhalily duplikaci, jsou nejbližší sousedé a tvoří mizivý zlomek všech dvojic. Vzorek byl tedy zvážen v jejich prospěch. Šablony byly seskupeny podle kategorie, slugu receptu a rodiny stylů a bylo vybráno 33 skupin čtyř druhů:
- číslovaná dvojčata, kde se slugy liší pouze koncovkou
-2nebo-3(8 skupin) - stejný recept a stejná rodina stylů (4 skupiny)
- stejná rodina stylů, jiný recept (13 skupin)
- skupiny pro pokrytí, jedna pro každou kategorii, aby žádná kategorie nebyla nezměřena (8 skupin)
Text snímků byl poté 16. září 2026 stažen pro každý prvek každé skupiny: 232 šablon, 1 034 snímků, 0 chyb při stahování. To je 5,9 % korpusu, vybraných tak, aby to bylo nejtěžších 5,9 %.
Rozhodující krok
Vážení vzorku samo o sobě stále nestačí, protože skutečný nejbližší soused šablony může být ten, který nebyl načten, což by podhodnotilo překryv. Druhý průchod tedy omezil srovnání na klastry, kde byl načten každý člen: 46 kompletních klastrů, 117 šablon. Uvnitř nich je zaručeno, že nejbližší soused šablony v celém korpusu 3 926 šablon je v měřené sadě.
Metrikou je 5gramový containment: podíl jedinečných pětislovných sekvencí šablony, které se vyskytují i v jejím nejbližším protějšku. Containment spíše než Jaccard, protože je asymetrický – krátká šablona zcela obsažená v dlouhé by se měla jevit jako plně duplikovaná a Jaccard by ji hlásil jako částečně jedinečnou.
Výsledky pro těchto 117 šablon v porovnání se skutečným nejbližším sousedem v korpusu:
| Metrika | Hodnota |
|---|---|
| Medián 5gramového containmentu | 0,00% |
| Průměr | 0,50% |
| 95. percentil | 3,46% |
| Maximum | 8,82% |
| Šablony nad 10 % | 0 |
| 3gramový containment, medián / maximum | 0,31% / 13,89% |
3gramový průchod je zde proto, aby zachytil text, který byl spíše přeformulován než znovu použit; mění čísla, ale ne závěr. Nejhorší dvojicí v korpusu je poster-quote-typography-modern-gradient proti poster-bold-text-modern-gradient s 8,82 %.
Napříč všemi 232 šablonami: z 3 448 jedinečných vět o šesti a více slovech se 2 objevují ve více než jedné šabloně – „the results relate only to the items tested“ a „no other graphic elements should intrude into this zone“. Na snímek, z 992 snímků s 20 a více slovy, je medián containmentu s nejbližším snímkem v jakékoli jiné šabloně 0,0 %; 8 je nad 20 % a žádný není nad 50 %. Tematická podobnost měřená pomocí kosinové podobnosti bag-of-words, která ignoruje formulaci, je vyšší, jak by měla být u dvou šablon životopisů: medián 12,7 % oproti nejbližšímu protějšku ze stejné rodiny, maximum 35,3 %.
Upřímné omezení: toto je 232 z 3 926 šablon a 117 v sadě se zaručeně nejbližším sousedem. Je to důkaz o nejtěžší části korpusu, ne důkaz o celém korpusu.
O čem jsme rozhodli
Audit odstraňuje námitku proti duplikaci při publikování textu snímků. Texty těl snímků jsme nezveřejnili. Zveřejnili jsme názvy snímků, které již existovaly v záznamu šablony a byly načítány a zahazovány.
Zkontrolováno u všech 3 926 šablon před jejich zveřejněním: 14 969 názvů, žádný prázdný, žádný pouze „Slide N“ nebo „Page N“ a slide_titles.length se u každé rovná slide_count. Dvě omezení byla zaznamenána, nikoli vyhlazena: 156 názvů (1,0 %) končí na „… Page N“ a u 77 šablon (2 %) tak končí každý název. 1 321 šablon (34 %) má jediný snímek a nedostává žádný seznam.
Změna se tedy týká 2 605 stránek a přidává na každou medián 15 slov, což je v průměru 10,4 slova na stránku v celém korpusu. To je skutečné a je to málo. Samo o sobě to stránku nevyvede z kategorie stránek s řídkým obsahem a užitečnější částí může být, že názvy jsou klikatelné: přechod na snímek 7 dříve vyžadoval šestkrát stisknout Další.
Stejná větev odkazuje na šablony, na které nevedly žádné odkazy. Stránky pro procházení omezily poměr stran na 16:9, což je asi 45 % knihovny, takže zbytek se neobjevil na žádné hlavní stránce ani v žádném souvisejícím bloku: /templates?category=document a ?category=poster vracely stránku „coming soon“ bez jediného odkazu na šablonu. Stránka, na kterou nevede žádný interní odkaz, nic čtenáři nedluží, protože žádný čtenář nepřijde.
Nenasazeno a jedna otázka stále otevřená
Nic z toho není v provozu. Je to pull request 10 na Sophon-LLC/ppt-ai, otevřený 15. září 2026 a stále otevřený 16. září 2026, tři commity, ověřené kontrolou typů, spuštěním lintu a produkčním sestavením spuštěným proti živému datovému úložišti. Dokud se nesloučí, stránky jsou takové, jak byly změřeny na začátku tohoto příspěvku.
Otevřenou otázkou je ta, na kterou audit neodpovídá. Měřená sada obsahuje medián 288 slov hlavního textu na šablonu, oproti 19 až 31 slovům specifickým pro šablonu, které stránka dnes zobrazuje. Audit říká, že tento text není duplicitní. Neříká, že text napsaný pro vyplnění rozvržení vnímá člověk jako obsah, a ne jako výplň, a to nikdo neměřil. Zveřejnit na základě samotného výsledku duplikace 3 926 stránek takového textu by znamenalo odpovědět na otázku, kterou jsme si nepoložili.