Blog

Mivel tartozik egy sablonoldal az olvasónak

A 3926 sablonoldalunk egyenként körülbelül 90 különböző szót jelenít meg. Mit mértünk, mielőtt továbbiakat adtunk volna hozzá, miért volt súlyozott a minta, és mit talált.

Közzétéve:

A PPT AI 3926 prezentációsablont tesz közzé, mindegyiknek saját oldala van a ppt.sophoninc.com címen. Egy olyan oldalnak, amelynek feladata egy dizájn bemutatása, még olvashatónak kell lennie annak is, aki még nem látja a dizájnt, vagy aki kettő között dönt. Ez legalább a következőket jelenti: mire való a prezentáció, mi van az egyes diákon, hány dia van és mekkora méretben, mit lehet megváltoztatni, és hogyan kell elkezdeni. Ez a bejegyzés arról szól, hogy kiderítettük, milyen messze voltak ettől az oldalaink, és mit mértünk, mielőtt bármit is hozzáadtunk volna.

Mit jelenít meg ma egy sablonoldal

2026. szeptember 16-án négy sablonoldal került lekérésre és megszámlálásra. A számlálás módszere: a script és style elemek, a fennmaradó tagek eltávolítása, a HTML-entitások visszaalakítása, a [A-Za-z0-9][A-Za-z0-9’'&-]* mintának megfelelő szótokenek kiválasztása, majd kisbetűssé alakítása az egyedi szavak megszámlálása előtt. A tokenizáló azért van megadva, mert attól függően az egyedi szavak száma néhány szóval eltérhet.

OldalSzavak számaEgyedi szavakEgyedi szavak a közös elemeken kívül
brand-agency-book-editorial-dark1489131
medical-blood-test-clean-corporate1428828
resume-illustrator-professional-blue1479030
poster-bold-text-modern-gradient1347919

A „Shared chrome” az a 60 egyedi szó, amely mind a négy oldalon közös: a navigáció, a lábléc, a navigációs útvonal és a két cselekvésre ösztönző elem. Ha ezeket eltávolítjuk, minden oldalon 19 és 31 közötti egyedi szó szól az adott sablonról. Az oldal többi része 3926 oldalon azonos.

Kontextusként: a 2026. szeptember 16-ig tartó három hónap alatt ezek az oldalak 484 megjelenítést és 7 kattintást értek el, átlagosan 20,2-es pozícióval, 187 egyedi oldalon és 12 egyedi lekérdezésben. Ez a szám a Google Search Console-ból származik a sc-domain:sophoninc.com tulajdonra, a ppt.sophoninc.com/templates/ címre szűrve. A Search Console csak a tulajdon tulajdonosai számára látható; a tulajdon, a szűrő és a dátumtartomány azért van megadva, hogy bárki, akinek van hozzáférése, reprodukálhassa az eredményt, ami a leginkább ellenőrizhetővé teszi ezt a forrást.

A kérdés, amire az auditnak választ kellett adnia

Minden sablon diái szöveget tartalmaznak: címsorokat, címkéket, a dizájn kitöltésére írt szövegtörzset. Ez nyilvánosan elérhető a /api/v2/templates/<slug>/slides/<n> címen, és kézenfekvő, hogy ezt tegyük az oldalra. Mielőtt ezt megtennénk, egy ellenvetésre választ kell adni: 3926 oldalnyi generált prezentációszöveg lehet 3926 majdnem azonos oldal, ami rosszabb, mint 3926 szegényes tartalmú oldal.

Tehát: mennyi szövegben egyezik meg egy sablon azzal a sablonnal, amelyikre a leginkább hasonlít?

Miért ad rossz választ az egyenletes mintavétel

A naiv módszer a sablonok véletlenszerű mintavétele és a párok összehasonlítása. Ez a módszer nem talál duplikációt ebben a korpuszban, és érdemes pontosan megvizsgálni, hogy miért.

A könyvtár kategóriák, receptek és stíluscsaládok szerint van rendezve. Egy 3926 elemből véletlenszerűen kiválasztott pár túlnyomó többségében különböző kategóriákból származó, különböző témájú párt alkot. Ezek a párok szinte semmiben sem közösek, bármennyire is ismétlődő a korpusz. Megmértük: 392 véletlenszerű, családok közötti pár medián 5-grammos átfedése 0,00%, a maximum pedig 0,3%. Egy egyenletes mintavétel a „the corpus is unique” eredményt adja vissza, ami a mintavétel műterméke, nem pedig egy megállapítás.

A duplikációt felfedő párok a legközelebbi szomszédok, és ezek az összes párnak csak egy elenyésző töredékét teszik ki. Ezért a mintát feléjük súlyoztuk. A sablonokat kategória, recept slug és stíluscsalád szerint csoportosítottuk, és 33 csoportot választottunk ki négyféle típusból:

  • számozott ikrek, ahol a slugok csak egy záró -2 vagy -3 karakterben különböznek (8 csoport)
  • azonos recept és azonos stíluscsalád (4 csoport)
  • azonos stíluscsalád, különböző recept (13 csoport)
  • lefedettségi csoportok, kategóriánként egy, hogy egyetlen kategória se maradjon mérés nélkül (8 csoport)

Ezután 2026. szeptember 16-án lekérdeztük a diaszöveget minden csoport minden tagjához: 232 sablon, 1034 dia, 0 lekérdezési hiba. Ez a korpusz 5,9%-a, méghozzá a legnehezebb 5,9%-a.

A döntő menet

A minta súlyozása önmagában még nem elég, mert egy sablon valódi legközelebbi szomszédja lehet egy olyan, amelyet nem kértek le, ami alulbecsülné az átfedést. Ezért egy második futtatás azokra a klaszterekre korlátozta az összehasonlítást, amelyeknek minden tagját lekérték: 46 teljes klaszter, 117 sablon. Ezeken belül egy sablon legközelebbi szomszédja a teljes, 3926 sablonból álló korpuszban garantáltan a mért halmazban van.

A metrika az 5-grammos tartalmazás: egy sablon különböző, ötszavas szekvenciáinak azon hányada, amely a legközelebbi párjában is előfordul. A tartalmazás a Jaccard-index helyett azért használatos, mert aszimmetrikus – egy rövid sablon, amely teljes egészében egy hosszúban található, teljesen duplikáltnak számít, míg a Jaccard-index részben egyedinek jelentené.

Eredmények a 117 sablonra, a valódi legközelebbi korpusz-szomszédhoz viszonyítva:

MérőszámÉrték
Medián 5-grammos tartalmazás0,00%
Átlag0,50%
95. percentilis3,46%
Maximum8,82%
10% feletti sablonok0
3-grammos tartalmazás, medián / maximum0,31% / 13,89%

A 3-grammos futtatás célja az átfogalmazott, nem pedig újrahasznosított szövegek kiszűrése; ez módosítja a számokat, de a következtetést nem. A legrosszabb pár a korpuszban a poster-quote-typography-modern-gradient és a poster-bold-text-modern-gradient, 8,82%-kal.

Mind a 232 sablonra vetítve: a 3448 különböző, legalább hat szóból álló mondatból 2 jelenik meg egynél több sablonban – „the results relate only to the items tested” és „no other graphic elements should intrude into this zone”. Diánként, a 992, legalább 20 szót tartalmazó diából a medián tartalmazás a bármely más sablonban lévő legközelebbi diához képest 0,0%; 8 diánál 20% feletti, és egyiknél sem haladja meg az 50%-ot. A tematikus hasonlóság, amelyet a szóhasználatot figyelmen kívül hagyó bag-of-words koszinusz módszerrel mértek, magasabb, ahogy az két önéletrajzsablon esetében elvárható: a medián 12,7% a legközelebbi, azonos családba tartozó párhoz képest, a maximum 35,3%.

A becsületes korlát: ez 3926 sablonból 232-t, a garantáltan legközelebbi halmazban pedig 117-et jelent. Ez bizonyíték a korpusz legnehezebb részéről, nem pedig az egészre vonatkozó bizonyítás.

A döntésünk

Az audit megszünteti a duplikációval kapcsolatos ellenvetést a diák szövegének közzétételével szemben. A diák törzsszövegét nem tettük közzé. A diák címeit tettük közzé, amelyek már léteztek a sablonrekordban, és amelyeket eddig lekértünk, majd eldobtunk.

A közzététel előtt mind a 3926 sablonon ellenőrizve: 14 969 cím, egyik sem üres, egyik sem csupán „Slide N” vagy „Page N”, és a slide_titles.length mindegyiknél megegyezik a slide_count értékkel. Két korlátot rögzítettünk ahelyett, hogy elsimítottuk volna őket: 156 cím (1,0%) végződik „… Page N”-re, és 77 sablon (2%) esetében minden cím így végződik. 1321 sablon (34%) egyetlen diából áll, és egyáltalán nem kap listát.

A változás tehát 2605 oldalt érint, és mediánértéken 15 szót ad hozzá mindegyikhez, ami a korpusz egészére vetítve oldalanként átlagosan 10,4 szót jelent. Ez valós, de csekély. Önmagában nem emel ki egy oldalt a vékony tartalom kategóriájából, és a hasznosabb része talán az, hogy a címek kattinthatók: a 7. diára ugráshoz korábban hatszor kellett megnyomni a Következő gombot.

Ugyanez az ág linkeli azokat a sablonokat, amelyekre semmi sem mutatott. A böngészőfelületek a aspect_ratio (képarányt) 16:9-re rögzítették, ami a könyvtár körülbelül 45%-a, így a többi semmilyen gyűjtőoldalon és kapcsolódó blokkban sem jelent meg: a /templates?category=document és a ?category=poster egy „coming soon” oldalt adott vissza nulla sablonlinkkel. Egy oldal, amelyre nem mutat belső link, semmivel sem tartozik az olvasónak, mert nem érkezik oda olvasó.

Nincs élesítve, és egy kérdés még nyitott

Ebből semmi sincs élesítve. Ez a 10-es számú pull-kérelem a Sophon-LLC/ppt-ai tárolóban, amelyet 2026. szeptember 15-én nyitottak meg, és 2026. szeptember 16-án még mindig nyitva van, három committal, típusellenőrzéssel, lint futtatással és egy, az éles adattárral szemben kiszolgált production builddel igazolva. Amíg nem egyesül, az oldalak a bejegyzés elején mért állapotban vannak.

A nyitott kérdés az, amire az audit nem ad választ. A mért halmaz sablononként mediánértéken 288 szónyi törzsszöveget tartalmaz, szemben azzal a 19–31 sablonspecifikus szóval, amelyet egy oldal ma megjelenít. Az audit szerint ez a szöveg nem duplikált. Azt azonban nem mondja ki, hogy egy elrendezés kitöltésére írt szöveget az ember tartalomnak és nem kitöltő szövegnek olvas-e, és ezt senki sem mérte. 3926 oldalnyi ilyen szöveg közzététele csupán egy duplikációs eredményre alapozva azt jelentené, hogy egy olyan kérdésre válaszolunk, amelyet fel sem tettünk.

Minden bejegyzés