Ang PPT AI ay naglalathala ng 3,926 na template ng presentasyon, bawat isa ay may sariling pahina sa ppt.sophoninc.com. Ang isang pahina na ang trabaho ay magpakita ng isang disenyo ay kailangan pa ring mabasa ng isang taong hindi pa nakikita ang disenyo, o nagpapasya sa pagitan ng dalawa sa mga ito. Nangangahulugan iyon ng hindi bababa sa: para saan ang deck, ano ang nasa bawat slide, ilang slide at anong laki, ano ang maaaring baguhin, at paano magsimula. Ang post na ito ay tungkol sa pag-alam kung gaano kalayo ang aming mga pahina mula roon, at kung ano ang aming sinukat bago magdagdag ng anuman.
Ano ang nire-render ng isang template page ngayon
Apat na template page ang kinuha at binilang noong 16 Setyembre 2026. Paraan ng pagbilang: alisin ang mga elementong script at style, alisin ang mga natitirang tag, i-unescape ang mga HTML entity, kumuha ng mga word token na tumutugma sa [A-Za-z0-9][A-Za-z0-9’'&-]*, at i-lowercase ang mga ito bago bilangin ang mga natatangi. Nakasaad ang tokenizer dahil ang bilang ng mga natatanging salita ay nagbabago nang kaunti depende rito.
| Pahina | Kabuuang mga salita | Mga natatanging salita | Mga natatanging salita sa labas ng shared chrome |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
Ang “Shared chrome” ay ang 60 natatanging salita na karaniwan sa lahat ng apat na pahina: ang navigation, footer, breadcrumb, at dalawang call to action. Kapag inalis ang mga iyon, mayroong 19 hanggang 31 natatanging salita sa bawat pahina na tungkol sa template na iyon. Ang natitiráng bahagi ng pahina ay pareho sa 3,926 na pahina.
Para sa konteksto, sa loob ng tatlong buwan hanggang 16 Setyembre 2026, ang mga pahinang iyon ay nakakuha ng 484 na impression at 7 click sa average na posisyong 20.2, sa 187 natatanging pahina at 12 natatanging query. Ang numerong iyon ay mula sa Google Search Console para sa sc-domain:sophoninc.com, na na-filter sa ppt.sophoninc.com/templates/. Ang Search Console ay makikita lámang ng mga may-ari ng property; ibinigay ang property, filter, at saklaw ng petsa upang magawâ itong muli ng sinumang may access, na siyang pinakamalapit sa pagiging beripikado para sa source na iyon.
Ang tanong na kailangang sagutin ng audit
Ang mga slide ng bawat template ay may text: mga heading, label, body copy na isinulat upang punan ang disenyo. Inihahatid ito sa publiko sa /api/v2/templates/<slug>/slides/<n>, at ito ang malinaw na bagay na dapat ilagay sa pahina. Bago gawin iyon, kailangang sagutin ang isang pagtutol: ang 3,926 na pahina ng nabuong deck copy ay maaaring maging 3,926 na halos magkakaparehong pahina, na mas masahol pa kaysa sa 3,926 na pahinang manipis ang nilalaman.
Kaya: gaano karaming text ang ibinabahagi ng isang template sa template na pinakakahawig nito?
Kung bakit nagbibigay ng maling sagot ang isang uniform sample
Ang naive na paraan ay ang kumuha ng mga template nang random at paghambingin ang mga pares. Hindi mahahanap ng paraang ito ang duplikasyon sa corpus na ito, at mahalagang maging eksakto kung bakit.
Nakaayos ang library ayon sa kategorya, sa recipe, at sa style family. Ang isang random na pares na kinuha mula sa 3,926 na item ay halos palaging isang pares mula sa magkakaibang kategorya tungkol sa magkakaibang paksa. Halos walang pagkakatulad ang mga pares na iyon, gaano man ka-duplicative ang corpus. Sinukat namin ito: ang 392 na random na cross-family na pares ay may median na 5-gram containment na 0.00% at maximum na 0.3%. Ibinabalik ng isang uniform sample ang “the corpus is unique” bilang isang artefact ng sampling, hindi bilang isang finding.
Ang mga pares na magpapakita ng duplikasyon ay ang mga nearest neighbour, at napakaliit na bahagi lámang sila ng lahat ng pares. Kaya, ang sample ay tinimbang pabor sa kanila. Pinangkat ang mga template ayon sa kategorya, recipe slug, at style family, at 33 grupo ang kinuha mula sa apat na uri:
- mga numbered twin, kung saan ang mga slug ay nagkakaiba lámang sa isang kasunod na
-2o-3(8 grupo) - parehong recipe at parehong style family (4 na grupo)
- parehong style family, magkaibang recipe (13 grupo)
- mga coverage group, isa bawat kategorya, upang walang kategoryang hindi masukat (8 grupo)
Pagkatapos ay kinuha ang slide text para sa bawat miyembro ng bawat grupo: 232 template, 1,034 na slide, 0 fetch error, noong 16 Setyembre 2026. Iyon ay 5.9% ng corpus, na pinili upang maging ang pinakamahirap na 5.9%.
Ang mapagpasyang pass
Hindi pa rin sapat ang pag-weight sa sample nang mag-isa, dahil maaaring hindi nakuha ang totoong pinakamalapit na katulad ng isang template, na magpapaliit sa pagkakapatong. Kaya sa pangalawang pass, nilimitahan ang paghahambing sa mga cluster kung saan nakuha na ang bawat miyembro: 46 na kumpletong cluster, 117 na template. Sa loob ng mga iyon, garantisadong kasama sa sinusukat na set ang pinakamalapit na katulad ng isang template sa buong 3,926-template na corpus.
Ang metric ay 5-gram containment: ang bahagi ng mga natatanging pagkakasunod-sunod ng limang salita ng isang template na makikita rin sa pinakamalapit nitong katulad. Containment sa halip na Jaccard dahil ito ay asymmetric — ang isang maikling template na ganap na nakapaloob sa isang mahaba ay dapat basahin bilang ganap na nadoble, at iuulat ito ng Jaccard bilang bahagyang natatangi.
Mga resulta para sa 117 template na iyon, laban sa totoong pinakamalapit na katulad sa corpus:
| Sukatan | Halaga |
|---|---|
| Median 5-gram containment | 0.00% |
| Mean | 0.50% |
| 95th percentile | 3.46% |
| Maximum | 8.82% |
| Mga template na higit sa 10% | 0 |
| 3-gram containment, median / maximum | 0.31% / 13.89% |
Nariyan ang 3-gram pass upang mahuli ang kopyang binago ang mga salita sa halip na muling ginamit; binabago nito ang mga numero ngunit hindi ang konklusyon. Ang pinakamasamang pares sa corpus ay ang poster-quote-typography-modern-gradient laban sa poster-bold-text-modern-gradient, sa 8.82%.
Sa lahat ng 232 na template: sa 3,448 na natatanging pangungusap na may anim na salita o higit pa, 2 ang lumabas sa higit sa isang template — “the results relate only to the items tested” at “no other graphic elements should intrude into this zone”. Bawat slide, sa 992 na slide na may 20 salita o higit pa, ang median containment sa pinakamalapit na slide sa anumang ibang template ay 0.0%; 8 ang higit sa 20% at wala ni isa ang higit sa 50%. Ang topical similarity na sinukat ng bag-of-words cosine, na hindi pinapansin ang paggamit ng salita, ay mas mataas, gaya ng inaasahan para sa dalawang resume template: median 12.7% laban sa pinakamalapit na katulad sa parehong pamilya, maximum 35.3%.
Ang tapat na limitasyon: ito ay 232 sa 3,926 na template at 117 sa set na may garantisadong pinakamalapit na katulad. Ito ay patunay tungkol sa pinakamahirap na bahagi ng corpus, hindi isang katibayan tungkol sa kabuuan nito.
Ang aming napagpasyahan
Tinatanggal ng audit ang pagtutol sa pag-publish ng text ng slide dahil sa duplikasyon. Hindi namin na-publish ang mga katawan ng slide. Na-publish namin ang mga pamagat ng slide, na dati nang umiiral sa talaan ng template at kinukuha at itinatapon.
Sinuri sa lahat ng 3,926 na template bago i-publish ang mga ito: 14,969 na pamagat, walang laman, walang simpleng “Slide N” o “Page N”, at ang slide_titles.length ay katumbas ng slide_count sa bawat isa. Dalawang limitasyon ang itinala sa halip na pinakinis: 156 na pamagat (1.0%) ang nagtatapos sa “… Page N”, at sa 77 na template (2%) bawat pamagat ay ganoon. 1,321 na template (34%) ay may iisang slide at walang nakukuhang listahan.
Kaya, naaabot ng pagbabago ang 2,605 na pahina at nagdaragdag ng median na 15 salita sa bawat isa, isang mean na 10.4 na salita bawat pahina sa buong corpus. Totoo iyon at maliit lamang. Hindi nito inaalis ang isang pahina mula sa teritoryo ng manipis na nilalaman, at ang mas kapaki-pakinabang na bahagi ay maaaring ang mga pamagat ay maaaring i-click: ang pagpunta sa slide 7 dati ay nangangailangan ng pagpindot sa Next nang anim na beses.
Ang parehong branch ang nag-uugnay sa mga template na walang nag-uugnay. Itinakda ng mga browse surface ang aspect_ratio sa 16:9, na halos 45% ng library, kaya ang natitira ay hindi lumabas sa anumang hub page at sa anumang kaugnay na block: ang /templates?category=document at ?category=poster ay nagbalik ng isang “coming soon” na pahina na may zero na link sa template. Ang isang pahina na walang panloob na link papunta rito ay walang utang na loob sa mambabasa, dahil walang mambabasang dumarating.
Hindi na-deploy, at isang tanong na bukas pa rin
Wala sa mga ito ang live. Ito ay ang pull request 10 sa Sophon-LLC/ppt-ai, binuksan noong 15 Setyembre 2026 at bukas pa rin noong 16 Setyembre 2026, tatlong commit, na-verify sa isang type check, isang lint run at isang production build na inihain laban sa live na datastore. Hangga't hindi ito nai-merge, ang mga pahina ay tulad ng nasukat sa itaas ng post na ito.
Ang bukas na tanong ay ang hindi sinasagot ng audit. Ang sinusukat na set ay may median na 288 salita ng body text bawat template, laban sa 19 hanggang 31 na salitang partikular sa template na ipinapakita ng isang pahina ngayon. Sinasabi ng audit na ang text na iyon ay hindi nauulit. Hindi nito sinasabi na ang text na isinulat upang punan ang isang layout ay nababasa bilang nilalaman sa isang tao sa halip na bilang pampuno, at walang sinuman ang sumukat niyan. Ang pag-publish ng 3,926 na pahina nito batay lamang sa resulta ng duplikasyon ay pagsagot sa isang tanong na hindi namin tinanong.