PPT AI objavlja 3.926 predlog za predstavitve, vsaka s svojo stranjo na ppt.sophoninc.com. Stran, katere naloga je prikazati obliko, mora biti še vedno berljiva za nekoga, ki oblike še ne vidi ali se odloča med dvema. To pomeni vsaj: čemu je predstavitev namenjena, kaj je na posamezni prosojnici, koliko prosojnic in kakšne velikosti, kaj je mogoče spremeniti in kako začeti. Ta objava govori o tem, kako smo ugotovili, kako daleč so bile naše strani od tega, in kaj smo izmerili, preden smo karkoli dodali.
Kaj stran s predlogo prikaže danes
Štiri strani s predlogami so bile pridobljene in preštete 16. septembra 2026. Metoda štetja: odstranite elemente script in style, odstranite preostale oznake, dekodirajte entitete HTML, vzemite besedne žetone, ki ustrezajo [A-Za-z0-9][A-Za-z0-9’'&-]*, in jih pred štetjem različnih pretvorite v male črke. Tokenizator je naveden, ker se število različnih besed glede na njega spreminja za nekaj besed.
| Stran | Skupno število besed | Različne besede | Različne besede zunaj skupnega ogrodja |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
»Shared chrome« je 60 različnih besed, ki so skupne vsem štirim stranem: navigacija, noga, drobtinice in dva poziva k dejanju. Če jih odstranite, je na vsaki strani med 19 in 31 različnih besed, ki se nanašajo na to predlogo. Preostanek strani je enak na 3.926 straneh.
Za kontekst: v treh mesecih do 16. septembra 2026 so te strani zabeležile 484 prikazov in 7 klikov s povprečnim položajem 20,2, in sicer na 187 različnih straneh in za 12 različnih poizvedb. To število prihaja iz orodja Google Search Console za sc-domain:sophoninc.com, filtrirano na ppt.sophoninc.com/templates/. Orodje Search Console je vidno samo lastnikom spletišča; spletišče, filter in časovno obdobje so navedeni, da lahko vsakdo z dostopom ponovi poizvedbo, kar je največja možna preverljivost za ta vir.
Vprašanje, na katerega je morala odgovoriti revizija
Prosojnice vsake predloge vsebujejo besedilo: naslove, oznake, besedilo, napisano za zapolnitev dizajna. Javno je dostopno na /api/v2/templates/<slug>/slides/<n> in je očitna izbira za vsebino strani. Preden to storimo, je treba odgovoriti na ugovor: 3.926 strani z generiranim besedilom bi lahko pomenilo 3.926 skoraj enakih strani, kar je slabše kot 3.926 strani z malo vsebine.
Torej: koliko besedila si predloga deli s predlogo, ki ji je najbolj podobna?
Zakaj enotni vzorec da napačen odgovor
Naivna metoda je naključno vzorčenje predlog in primerjava parov. Ta metoda v tem korpusu ne more najti podvajanja in vredno je natančno pojasniti, zakaj.
Knjižnica je organizirana po kategorijah, receptih in slogovnih družinah. Naključni par, izbran izmed 3.926 elementov, je v veliki večini primerov par iz različnih kategorij o različnih temah. Ti pari si ne delijo skoraj ničesar, ne glede na to, kako podvojen je korpus. To smo izmerili: 392 naključnih meddružinskih parov ima mediano vsebovanosti 5-gramov 0,00 % in največ 0,3 %. Enakomerni vzorec vrne »the corpus is unique« kot artefakt vzorčenja, ne kot ugotovitev.
Pari, ki bi razkrili podvajanje, so najbližji sosedje in predstavljajo zanemarljiv delež vseh parov. Zato je bil vzorec utežen v njihovo korist. Predloge so bile združene po kategoriji, oznaki recepta in slogovni družini, izbranih pa je bilo 33 skupin štirih vrst:
- oštevilčeni dvojčki, kjer se oznake razlikujejo le po končnici
-2ali-3(8 skupin) - isti recept in ista slogovna družina (4 skupine)
- ista slogovna družina, drugačen recept (13 skupin)
- skupine za pokritost, ena na kategorijo, da nobena kategorija ni neizmerjena (8 skupin)
Nato je bilo pridobljeno besedilo prosojnic za vsak element vsake skupine: 232 predlog, 1.034 prosojnic, 0 napak pri pridobivanju, dne 16. septembra 2026. To je 5,9 % korpusa, izbranega tako, da predstavlja najtežjih 5,9 %.
Odločilni prehod
Uteževanje vzorca samo po sebi še vedno ni dovolj, ker je lahko pravi najbližji sosed predloge tisti, ki ni bil pridobljen, kar bi podcenilo prekrivanje. Zato je drugi prehod omejil primerjavo na gruče, kjer je bil pridobljen vsak član: 46 celotnih gruč, 117 predlog. Znotraj teh je zagotovljeno, da je najbližji sosed predloge v celotnem korpusu 3.926 predlog v izmerjenem naboru.
Metrika je vsebovanost 5-gramov: delež različnih zaporedij petih besed v predlogi, ki se pojavijo tudi v njenem najbližjem sorodniku. Vsebovanost namesto Jaccardovega indeksa, ker je asimetrična – kratka predloga, ki je v celoti vsebovana v dolgi, bi se morala šteti kot popolnoma podvojena, Jaccardov indeks pa bi jo poročal kot delno edinstveno.
Rezultati za teh 117 predlog, v primerjavi s pravim najbližjim sosedom v korpusu:
| Mera | Vrednost |
|---|---|
| Mediana vsebovanosti 5-gramov | 0,00% |
| Povprečje | 0,50% |
| 95. percentil | 3,46% |
| Maksimum | 8,82% |
| Predloge nad 10 % | 0 |
| Vsebovanost 3-gramov, mediana / maksimum | 0,31% / 13,89% |
Prehod s 3-grami je namenjen odkrivanju kopij, ki so bile preoblikovane, ne pa ponovno uporabljene; spremeni števila, ne pa tudi zaključka. Najslabši par v korpusu je poster-quote-typography-modern-gradient proti poster-bold-text-modern-gradient, z 8,82 %.
V vseh 232 predlogah: od 3.448 različnih stavkov s šestimi ali več besedami se 2 pojavita v več kot eni predlogi – »the results relate only to the items tested« in »no other graphic elements should intrude into this zone«. Na prosojnico: od 992 prosojnic z 20 ali več besedami je mediana vsebovanosti z najbližjo prosojnico v kateri koli drugi predlogi 0,0 %; 8 jih je nad 20 % in nobena nad 50 %. Tematska podobnost, merjena s kosinusno podobnostjo vreče besed, ki ne upošteva besedila, je višja, kot bi morala biti za dve predlogi življenjepisa: mediana 12,7 % v primerjavi z najbližjim sorodnikom iz iste družine, maksimum 35,3 %.
Poštena omejitev: to je 232 od 3.926 predlog in 117 v naboru z zagotovljeno najbližjim sosedom. To je dokaz o najtežjem delu korpusa, ne pa dokaz o celotnem korpusu.
Kaj smo se odločili
Revizija odpravlja ugovor o podvajanju pri objavi besedila prosojnic. Nismo objavili telesa prosojnic. Objavili smo naslove prosojnic, ki so že obstajali v zapisu predloge in so bili pridobljeni ter zavrženi.
Preverjeno v vseh 3.926 predlogah pred objavo: 14.969 naslovov, noben prazen, noben zgolj »Slide N« ali »Page N«, in slide_titles.length enak slide_count pri vsaki. Dve omejitvi sta bili zabeleženi, ne pa zglajeni: 156 naslovov (1,0 %) se konča z »… Page N«, pri 77 predlogah (2 %) pa se tako konča vsak naslov. 1.321 predlog (34 %) ima eno samo prosojnico in sploh ne dobi seznama.
Sprememba torej doseže 2.605 strani in vsaki doda mediano 15 besed, kar je povprečno 10,4 besede na stran v celotnem korpusu. To je resnično in je malo. Samo po sebi strani ne reši iz območja pomanjkljive vsebine, bolj uporaben del pa je morda to, da so naslovi klikljivi: za skok na 7. prosojnico je bilo prej treba šestkrat pritisniti Naprej.
Ista veja povezuje predloge, na katere ni vodila nobena povezava. Stran za brskanje prikazuje predloge, pripete na razmerje stranic aspect_ratio 16:9, kar je približno 45 % knjižnice, zato se preostanek ni pojavil na nobeni zbirni strani in v nobenem bloku s povezanimi predlogami: /templates?category=document in ?category=poster sta vrnili stran »coming soon« brez povezav do predlog. Stran, na katero ne vodi nobena notranja povezava, bralcu ni dolžna ničesar, ker noben bralec ne pride nanjo.
Ni uvedeno in eno vprašanje je še odprto
Nič od tega ni v živo. To je pull request 10 na Sophon-LLC/ppt-ai, odprt 15. septembra 2026 in še vedno odprt 16. septembra 2026, trije commiti, preverjeni s preverjanjem tipov, lintom in produkcijsko gradnjo, postreženo proti živi podatkovni shrambi. Dokler se ne združi, so strani takšne, kot so bile izmerjene na vrhu te objave.
Odprto vprašanje je tisto, na katerega revizija ne odgovarja. Izmerjeni nabor vsebuje mediano 288 besed telesa besedila na predlogo, v primerjavi z 19 do 31 besedami, specifičnimi za predlogo, ki jih stran danes izriše. Revizija pravi, da to besedilo ni podvojeno. Ne pove pa, ali se besedilo, napisano za zapolnitev postavitve, človeku zdi kot vsebina in ne kot polnilo, in tega ni nihče izmeril. Objaviti 3.926 strani tega zgolj na podlagi rezultata o podvajanju bi pomenilo odgovoriti na vprašanje, ki ga nismo postavili.