Blogi

Mitä mallipohjasivu on velkaa lukijalle

3 926 mallipohjasivuamme sisältävät kukin noin 90 erillistä sanaa. Mitä mittasimme ennen uusien lisäämistä, miksi otos painotettiin ja mitä se paljasti.

Julkaistu

PPT AI julkaisee 3 926 esitysmallia, joista jokaisella on oma sivunsa osoitteessa ppt.sophoninc.com. Sivun, jonka tehtävänä on esitellä ulkoasua, on silti oltava luettavissa henkilölle, joka ei vielä näe ulkoasua tai joka tekee valintaa kahden välillä. Se tarkoittaa vähintään: mihin esitys on tarkoitettu, mitä kullakin dialla on, kuinka monta diaa ja minkä kokoisia ne ovat, mitä voidaan muuttaa ja miten pääsee alkuun. Tämä kirjoitus kertoo siitä, miten selvitimme, kuinka kaukana sivumme olivat siitä, ja mitä mittasimme ennen kuin lisäsimme mitään.

Mitä mallipohjasivu näyttää tänään

Neljä mallipohjasivua haettiin ja laskettiin 16. syyskuuta 2026. Laskentamenetelmä: poista script- ja style-elementit, poista jäljelle jääneet tagit, pura HTML-entiteetit, ota sanamerkit, jotka vastaavat sääntöä [A-Za-z0-9][A-Za-z0-9’'&-]*, ja muunna ne pieniksi kirjaimiksi ennen erillisten sanojen laskemista. Tokenisaattori mainitaan, koska erillisten sanojen määrä vaihtelee muutamalla sanalla siitä riippuen.

SivuSanoja yhteensäEri sanojaEri sanoja yhteisten osien ulkopuolella
brand-agency-book-editorial-dark1489131
medical-blood-test-clean-corporate1428828
resume-illustrator-professional-blue1479030
poster-bold-text-modern-gradient1347919

“Shared chrome” on ne 60 erillistä sanaa, jotka ovat yhteisiä kaikille neljälle sivulle: navigaatio, alatunniste, leivänmuru ja kaksi toimintakehotusta. Kun ne poistetaan, kullakin sivulla on 19–31 erillistä sanaa, jotka koskevat kyseistä mallia. Sivun loppuosa on sama 3 926 sivulla.

Taustaksi: 16. syyskuuta 2026 päättyneen kolmen kuukauden aikana kyseiset sivut saivat 484 näyttökertaa ja 7 klikkausta keskimääräisellä sijoituksella 20,2. Luvut kattoivat 187 eri sivua ja 12 eri hakukyselyä. Luku on peräisin Google Search Consolesta omaisuudelle sc-domain:sophoninc.com, suodatettuna osoitteeseen ppt.sophoninc.com/templates/. Search Console on vain omaisuuden omistajien nähtävissä; omaisuus, suodatin ja aikaväli on ilmoitettu, jotta kuka tahansa, jolla on pääsy, voi toisintaa tuloksen, mikä on niin tarkistettavissa kuin kyseinen lähde voi olla.

Kysymys, johon auditoinnin oli vastattava

Jokaisen mallin diat sisältävät tekstiä: otsikoita, nimikkeitä ja leipätekstiä, joka on kirjoitettu täyttämään asettelun. Se on julkisesti saatavilla osoitteessa /api/v2/templates/<slug>/slides/<n>, ja sen lisääminen sivulle on ilmeinen ratkaisu. Ennen sitä on vastattava yhteen vastaväitteeseen: 3 926 sivua generoitua esitystekstiä voisi tarkoittaa 3 926 lähes identtistä sivua, mikä on pahempi kuin 3 926 niukkasisältöistä sivua.

Joten: kuinka paljon tekstiä mallilla on yhteistä sen eniten muistuttavan mallin kanssa?

Miksi tasainen otos antaa väärän vastauksen

Naiivi menetelmä on ottaa satunnaisia otoksia malleista ja verrata pareja. Tämä menetelmä ei löydä päällekkäisyyksiä tästä aineistosta, ja on syytä selittää tarkasti, miksi.

Kirjasto on järjestetty luokan, reseptin ja tyyliperheen mukaan. 3 926 nimikkeestä satunnaisesti valittu pari on lähes aina eri luokkiin kuuluva ja eri aiheita käsittelevä pari. Näillä pareilla ei ole juuri mitään yhteistä, olipa korpus kuinka päällekkäinen tahansa. Mittasimme sen: 392 satunnaisen, eri perheisiin kuuluvan parin 5-grammien sisältymisen mediaani on 0,00 % ja enimmäisarvo 0,3 %. Yhtenäinen otos palauttaa tuloksen “the corpus is unique” otannan artefaktina, ei löydöksenä.

Parit, jotka paljastaisivat päällekkäisyyden, ovat lähimmät naapurit, ja ne ovat häviävän pieni osa kaikista pareista. Siksi otosta painotettiin niitä kohti. Mallit ryhmiteltiin kategorian, reseptin tunnisteen ja tyyliperheen mukaan, ja 33 ryhmää valittiin neljästä eri tyypistä:

  • numeroidut kaksoset, joissa tunnisteet eroavat vain loppuliitteen -2 tai -3 osalta (8 ryhmää)
  • sama resepti ja sama tyyliperhe (4 ryhmää)
  • sama tyyliperhe, eri resepti (13 ryhmää)
  • kattavuusryhmät, yksi per kategoria, jotta mikään kategoria ei jää mittaamatta (8 ryhmää)

Tämän jälkeen haettiin diojen tekstit jokaisesta ryhmän jäsenestä: 232 mallia, 1 034 diaa, 0 hakuvirhettä, 16. syyskuuta 2026. Tämä on 5,9 % aineistosta, ja se valittiin vaikeimmaksi 5,9 %:ksi.

Ratkaiseva vaihe

Otannan painottaminen ei vielä yksinään riitä, sillä mallipohjan todellinen lähin naapuri saattaa olla sellainen, jota ei haettu, mikä vähättelisi päällekkäisyyttä. Niinpä toisella kierroksella vertailu rajattiin klustereihin, joiden jokainen jäsen oli haettu: 46 kokonaista klusteria, 117 mallipohjaa. Niiden sisällä mallipohjan lähin naapuri koko 3 926 mallipohjan aineistossa on taatusti mitatussa joukossa.

Mittarina on 5-grammin sisältyminen: mallipohjan erillisten viiden sanan jaksojen osuus, jotka esiintyvät myös sen lähimmässä vertaisessa. Sisältyminen Jaccardin sijaan, koska se on epäsymmetrinen – lyhyen mallipohjan, joka sisältyy kokonaan pitkään, tulisi näyttää täysin päällekkäiseltä, ja Jaccard raportoisi sen osittain ainutlaatuiseksi.

Tulokset näille 117 mallipohjalle verrattuna todelliseen lähimpään aineistonaapuriin:

MittariArvo
5-grammin sisältymisen mediaani0,00%
Keskiarvo0,50%
95. persentiili3,46%
Maksimi8,82%
Mallipohjat yli 10 %0
3-grammin sisältyminen, mediaani / maksimi0,31% / 13,89%

3-grammin tarkistuksen tarkoitus on löytää kopioitu teksti, jota on muotoiltu uudelleen eikä vain käytetty sellaisenaan; se muuttaa lukuja, mutta ei lopputulosta. Aineiston huonoin pari on poster-quote-typography-modern-gradient vastaan poster-bold-text-modern-gradient, 8,82 %:lla.

Kaikissa 232 mallipohjassa: 3 448 erillisestä vähintään kuuden sanan lauseesta 2 esiintyy useammassa kuin yhdessä mallipohjassa – ”the results relate only to the items tested” ja ”no other graphic elements should intrude into this zone”. Dian tasolla: 992 diasta, joissa on vähintään 20 sanaa, mediaanisisältyminen lähimpään diaan missä tahansa muussa mallipohjassa on 0,0 %; 8 on yli 20 % ja yksikään ei ole yli 50 %. Aiheen samankaltaisuus mitattuna sanapussi-kosiinilla, joka ei huomioi sanamuotoja, on korkeampi, kuten kahden ansioluettelomallipohjan kohdalla kuuluukin: mediaani 12,7 % verrattuna lähimpään saman perheen vertaiseen, maksimi 35,3 %.

Rehellinen rajaus: tämä on 232 mallipohjaa 3 926:sta ja 117 taatusti lähimmän joukossa. Se on näyttöä aineiston vaikeimmasta osasta, ei todiste koko aineistosta.

Mitä päätimme

Tarkastus poistaa päällekkäisyyteen liittyvän vastalauseen diojen tekstin julkaisemiselle. Emme julkaisseet diojen leipätekstejä. Julkaisimme diojen otsikot, jotka olivat jo olemassa mallipohjan tiedoissa ja jotka haettiin ja hylättiin.

Tarkistettu kaikista 3 926 mallipohjasta ennen julkaisua: 14 969 otsikkoa, joista yksikään ei ole tyhjä, yksikään ei ole pelkkä ”Slide N” tai ”Page N”, ja slide_titles.length on yhtä suuri kuin slide_count jokaisessa. Kaksi rajoitusta kirjattiin ylös eikä niitä siloteltu: 156 otsikkoa (1,0 %) päättyy ”… Page N”, ja 77 mallipohjassa (2 %) jokainen otsikko tekee niin. 1 321 mallipohjassa (34 %) on vain yksi dia, eikä niille tule lainkaan luetteloa.

Muutos koskee siis 2 605 sivua ja lisää mediaanina 15 sanaa kullekin, keskimäärin 10,4 sanaa per sivu koko aineistossa. Se on todellista ja se on vähän. Se ei yksinään nosta sivua pois vähäsisältöisten alueelta, ja hyödyllisempi osa saattaa olla se, että otsikot ovat klikattavissa: diaan 7 hyppääminen vaati aiemmin Next-painikkeen painamista kuusi kertaa.

Sama haara linkittää malleihin, joihin mikään ei linkittänyt. Selausnäkymät olivat kiinnittäneet kuvasuhteen arvoon 16:9, mikä on noin 45 % kirjastosta, joten loput eivät näkyneet millään koontisivulla eivätkä missään aiheeseen liittyvässä lohkossa: /templates?category=document ja ?category=poster palauttivat ”coming soon” -sivun ilman yhtäkään mallilinkkiä. Sivu, jolle ei johda sisäistä linkkiä, ei ole lukijalle mitään velkaa, koska kukaan lukija ei saavu sinne.

Ei julkaistu, ja yksi kysymys yhä avoinna

Mikään tästä ei ole julkaistu. Se on pull request 10 Sophon-LLC/ppt-ai-repositoriossa, avattu 15. syyskuuta 2026 ja yhä avoinna 16. syyskuuta 2026, kolme committia, varmennettu tyyppitarkistuksella, lint-ajolla ja tuotantoversiolla, jota on ajettu live-tietovarastoa vasten. Ennen kuin se yhdistetään, sivut ovat sellaisia kuin ne mitattiin tämän kirjoituksen alussa.

Avoin kysymys on se, johon tarkastus ei vastaa. Mitattu joukko sisältää mediaanina 288 sanaa leipätekstiä per mallipohja, kun taas nykyään sivu näyttää 19–31 mallipohjakohtaista sanaa. Tarkastuksen mukaan teksti ei ole päällekkäistä. Se ei kerro, lukeeko henkilö asettelun täytteeksi kirjoitettua tekstiä sisältönä vai täytteenä, eikä kukaan ole mitannut sitä. 3 926 sivun julkaiseminen pelkän päällekkäisyystuloksen perusteella olisi vastaus kysymykseen, jota emme esittäneet.

Kaikki kirjoitukset