PPT AI avaldab 3926 esitlusmalli, millest igaühel on oma leht aadressil ppt.sophoninc.com. Leht, mille ülesanne on näidata disaini, peab siiski olema loetav ka kellelegi, kes disaini veel ei näe või kes kahe vahel valib. See tähendab vähemalt: milleks esitlus on mõeldud, mis on igal slaidil, kui palju slaide ja mis suuruses, mida saab muuta ja kuidas alustada. See postitus räägib sellest, kuidas me avastasime, kui kaugel meie lehed sellest olid ja mida me enne millegi lisamist mõõtsime.
Mida mallileht täna renderdab
16. septembril 2026 laaditi alla ja loendati neli mallilehte. Loendusmeetod: eemaldada script- ja style-elemendid, eemaldada ülejäänud märgendid, teisendada HTML-olemivormingud, võtta sõnaosad, mis vastavad mustrile [A-Za-z0-9][A-Za-z0-9’'&-]*, ja teisendada need väiketähtedeks enne eristuvate loendamist. Tokeniseerija on ära märgitud, sest eristuvate sõnade arv kõigub sellest sõltuvalt mõne sõna võrra.
| Leht | Sõnu kokku | Erinevaid sõnu | Erinevaid sõnu väljaspool ühisosa |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
“Shared chrome” on 60 erinevat sõna, mis on ühised kõigile neljale lehele: navigatsioon, jalus, navigeerimisrada ja kaks üleskutset tegevusele. Nende eemaldamisel on igal lehel 19 kuni 31 erinevat sõna, mis käivad selle malli kohta. Ülejäänud leht on 3926 lehel sama.
Kontekstiks: 16. septembrini 2026 lõppenud kolme kuu jooksul said need lehed 484 näitamist ja 7 klikki keskmise positsiooniga 20,2, jaotatuna 187 erinevale lehele ja 12 erinevale päringule. See arv pärineb Google Search Console'ist päringule sc-domain:sophoninc.com, filtreerituna aadressile ppt.sophoninc.com/templates/. Search Console on nähtav ainult vara omanikele; vara, filter ja kuupäevavahemik on antud selleks, et igaüks, kellel on juurdepääs, saaks seda korrata, mis on selle allika puhul maksimaalselt kontrollitav.
Küsimus, millele audit pidi vastama
Iga malli slaididel on tekst: pealkirjad, sildid, kujunduse täitmiseks kirjutatud tekst. See on avalikult kättesaadav aadressil /api/v2/templates/<slug>/slides/<n> ja selle lisamine lehele on ilmselge samm. Enne seda tuleb aga vastata ühele vastuväitele: 3926 lehekülge genereeritud esitlusteksti võib tähendada 3926 peaaegu identset lehekülge, mis on hullem kui 3926 sisutühja lehekülge.
Niisiis: kui palju teksti jagab mall selle malliga, mida ta kõige rohkem meenutab?
Miks ühtlane valim annab vale vastuse
Lihtsameelne meetod on võtta juhuslikult malle ja võrrelda paare. See meetod ei suuda selles tekstikogumis dubleerimist leida ja tasub täpselt selgitada, miks.
Kogu on korraldatud kategooria, retsepti ja stiiliperekonna järgi. Juhuslik paar, mis on võetud 3926 elemendi hulgast, on valdavalt eri kategooriatesse kuuluv ja eri teemasid käsitlev paar. Neil paaridel pole peaaegu midagi ühist, ükskõik kui dubleeriv korpus ka poleks. Mõõtsime seda: 392 juhusliku perekonnavälise paari mediaan-5-grammi sisaldus on 0,00% ja maksimaalne 0,3%. Ühtlane valim tagastab tulemuse “the corpus is unique” valimi artefaktina, mitte leiuna.
Paarid, mis dubleerimise paljastaksid, on lähimad naabrid, ja need moodustavad kaduvväikese osa kõigist paaridest. Seega kaaluti valimit nende suunas. Mallid grupeeriti kategooria, retsepti-slug'i ja stiilipere järgi ning nelja tüübi seast valiti 33 gruppi:
- nummerdatud kaksikud, kus slug'id erinevad ainult lõpus oleva
-2või-3poolest (8 gruppi) - sama retsept ja sama stiilipere (4 gruppi)
- sama stiilipere, erinev retsept (13 gruppi)
- katvuse grupid, üks iga kategooria kohta, et ükski kategooria ei jääks mõõtmata (8 gruppi)
Seejärel hangiti 16. septembril 2026 slaidi tekstid iga grupi iga liikme kohta: 232 malli, 1034 slaidi, 0 hankeviga. See on 5,9% tekstikogumist, mis on valitud kõige keerulisemaks 5,9%-ks.
Otsustav läbimine
Valimi kaalumisest üksi siiski ei piisa, sest malli tegelik lähim naaber võib olla selline, mida ei hangitud, mis alahindaks kattuvust. Seega piiras teine läbimine võrdlust klastritega, kus iga liige oli hangitud: 46 täielikku klastrit, 117 malli. Nende sees on malli lähim naaber kogu 3926 mallist koosnevas korpuses garanteeritult mõõdetud hulgas.
Mõõdikuks on 5-grammi sisaldumine: malli eristuvate viiesõnaliste jadade osa, mis esineb ka selle lähimas vastes. Sisaldumine, mitte Jaccardi indeks, sest see on asümmeetriline – lühike mall, mis sisaldub täielikult pikas, peaks lugema täielikult dubleerituks, kuid Jaccardi indeks näitaks seda osaliselt unikaalsena.
Tulemused nende 117 malli kohta, võrreldes korpuse tegeliku lähima naabriga:
| Mõõdik | Väärtus |
|---|---|
| 5-grammi sisaldumise mediaan | 0,00% |
| Keskmine | 0,50% |
| 95. protsentiil | 3,46% |
| Maksimum | 8,82% |
| Mallid üle 10% | 0 |
| 3-grammi sisaldumine, mediaan / maksimum | 0,31% / 13,89% |
3-grammi läbimine on mõeldud selleks, et tabada kopeeritud teksti, mida on pigem ümber sõnastatud kui taaskasutatud; see muudab arve, kuid mitte järeldust. Korpuse halvim paar on poster-quote-typography-modern-gradient ja poster-bold-text-modern-gradient, mille tulemus on 8,82%.
Kõigi 232 malli lõikes: 3448 eristuvast lausest, mis on kuus või enam sõna pikad, esineb 2 lauset rohkem kui ühes mallis – „the results relate only to the items tested“ ja „no other graphic elements should intrude into this zone“. Slaidi kohta: 992 slaidist, mis sisaldavad 20 või enam sõna, on mediaan-sisaldumine lähima slaidi suhtes mis tahes muus mallis 0,0%; 8 on üle 20% ja ükski pole üle 50%. Temaatiline sarnasus, mõõdetuna sõnakoti koosinussarnasusega, mis ignoreerib sõnastust, on kõrgem, nagu kahe CV-malli puhul peakski olema: mediaan 12,7% võrreldes lähima sama perekonna vastega, maksimum 35,3%.
Aus piirang: see on 232 malli 3926-st ja 117 garanteeritult lähima vastete hulgas. See on tõend korpuse kõige keerulisema osa kohta, mitte tõestus kogu korpuse kohta.
Mida me otsustasime
Audit eemaldab dubleerimise vastuväite slaiditeksti avaldamisele. Me ei avaldanud slaidide põhitekste. Avaldasime slaidide pealkirjad, mis olid juba malli kirjes olemas ning mida hangiti ja seejärel kõrvaldati.
Enne avaldamist kontrolliti kõiki 3926 malli: 14 969 pealkirja, ükski polnud tühi, ükski polnud paljas „Slide N“ või „Page N“ ning slide_titles.length oli igaühel võrdne slide_count-ga. Kaks piirangut registreeriti, mitte ei silutud: 156 pealkirja (1,0%) lõpeb tekstiga „… Page N“ ja 77 mallil (2%) teevad seda kõik pealkirjad. 1321 mallil (34%) on üksainus slaid ja need ei saa üldse loendit.
Muudatus jõuab seega 2605 lehele ja lisab igale mediaanina 15 sõna, mis teeb keskmiselt 10,4 sõna lehe kohta üle kogu korpuse. See on reaalne ja see on väike. See iseenesest ei vii lehte välja õhukese sisu territooriumilt ning kasulikum osa võib olla see, et pealkirjad on klikitavad: 7. slaidile hüppamine nõudis varem kuus korda nupu „Järgmine“ vajutamist.
Sama haru viitab mallidele, millele mujalt ei viidatud. Sirvimisvaated fikseerisid kuvasuhte 16:9 peale, mis on umbes 45% kogust, nii et ülejäänud ei ilmunud ühelgi jaoturilehel ega seotud plokis: /templates?category=document ja ?category=poster tagastasid „coming soon“ lehe, kus polnud ühtegi mallilinki. Leht, millele ei vii ühtegi siselinki, ei võlgne lugejale midagi, sest ükski lugeja ei jõua sinna.
Ei ole kasutusele võetud ja üks küsimus on endiselt lahtine
Miski sellest pole veel avalik. See on pull request 10 repos Sophon-LLC/ppt-ai, avatud 15. septembril 2026 ja endiselt avatud 16. septembril 2026, kolm commiti, kontrollitud tüübikontrolli, lint-analüüsi ja toodanguversiooni ehitusega, mida serveeriti reaalajas andmesalve vastu. Kuni see pole liidetud, on lehed sellised, nagu mõõdetud selle postituse alguses.
Lahtine küsimus on see, millele audit ei vasta. Mõõdetud hulk sisaldab mediaanina 288 sõna põhiteksti malli kohta, võrreldes 19 kuni 31 mallispetsiifilise sõnaga, mida leht täna kuvab. Audit ütleb, et see tekst ei ole dubleeriv. See ei ütle, kas paigutuse täitmiseks kirjutatud tekst mõjub inimesele sisuna, mitte täitematerjalina, ja keegi pole seda mõõtnud. Selle 3926 lehekülje avaldamine ainuüksi dubleerimistulemuse põhjal oleks vastamine küsimusele, mida me ei esitanud.