PPT AI-k 3.926 aurkezpen-txantiloi argitaratzen ditu, bakoitza bere orriarekin ppt.sophoninc.com helbidean. Diseinu bat erakustea helburu duen orri batek irakurgarria izan behar du diseinua oraindik ikusi ezin duenarentzat, edo bien artean aukeratzen ari denarentzat. Horrek esan nahi du, gutxienez: zertarako den aurkezpena, diapositiba bakoitzean zer dagoen, zenbat diapositiba eta zein tamainatan, zer alda daitekeen eta nola hasi. Argitalpen hau gure orriak horretatik zenbateraino zeuden jakiteari buruzkoa da, eta ezer gehitu aurretik zer neurtu genuen azaltzen du.
Zer errendatzen duen gaur egun txantiloi-orri batek
Lau txantiloi-orri eskuratu eta zenbatu ziren 2026ko irailaren 16an. Zenbatzeko metodoa: script eta style elementuak kendu, gainerako etiketak kendu, HTML entitateak deskodetu, [A-Za-z0-9][A-Za-z0-9’'&-]* adierazpenarekin bat datozen hitz-tokenak hartu, eta letra xeheetara bihurtu hitz desberdinak zenbatu aurretik. Tokenizatzailea zehazten da, hitz desberdinen kopurua hitz gutxi batzuetan aldatzen delako horren arabera.
| Orria | Hitz kopurua | Hitz desberdinak | Chrome partekatuaz kanpoko hitz desberdinak |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
“Shared chrome” da lau orrialdeek komunean dituzten 60 hitz desberdinak: nabigazioa, orri-oina, ogi-mamiak eta bi deiak ekintzara. Horiek kenduz gero, orrialde bakoitzeko 19 eta 31 hitz desberdin artean txantiloi horri buruzkoak dira. Orrialdearen gainerakoa berdina da 3.926 orrialdetan.
Testuingurua jartzeko, 2026ko irailaren 16an amaitutako hiru hilabeteetan, orrialde horiek 484 inpresio eta 7 klik erakarri zituzten, batez besteko 20,2 posizioan, 187 orrialde desberdinetan eta 12 kontsulta desberdinetan. Zifra hori Google Search Console-tik dator sc-domain:sophoninc.com domeinurako, ppt.sophoninc.com/templates/ helbidera iragazita. Search Console jabetzaren jabeentzat bakarrik dago ikusgai; jabetza, iragazkia eta data-tartea ematen dira, sarbidea duen edonork erreproduzitu ahal izan dezan, eta hori da iturri horrek ahalbidetzen duen egiaztapen-maila handiena.
Auditoretzak erantzun behar zuen galdera
Txantiloi bakoitzaren diapositibek testua daramate: goiburuak, etiketak, diseinua betetzeko idatzitako testua. Publikoki zerbitzatzen da /api/v2/templates/<slug>/slides/<n> helbidean, eta hori da orrialdean jartzeko gauzarik agerikoena. Hori egin aurretik, eragozpen bati erantzun behar zaio: sortutako 3.926 aurkezpen-kopia orrialde ia berdinen 3.926 orrialde izan litezke, eta hori eduki gutxiko 3.926 orrialde baino okerragoa da.
Beraz: zenbat testu partekatzen du txantiloi batek gehien antza dion txantiloiarekin?
Zergatik ematen duen erantzun okerra lagin uniforme batek
Metodo inozoa txantiloiak ausaz hartzea eta bikoteak alderatzea da. Metodo horrek ezin du bikoizketarik aurkitu corpus honetan, eta merezi du zehatz-mehatz azaltzea zergatik.
Liburutegia kategoriaren, errezetaren eta estilo-familiaren arabera antolatuta dago. 3.926 elementutatik ausaz ateratako bikote bat, gehienetan, gai desberdinei buruzko kategoria desberdinetako bikote bat da. Bikote horiek ia ez dute ezer partekatzen, corpusak bikoiztuta egon arren. Guk neurtu genuen: ausazko 392 familia arteko bikotek 0,00 %-ko 5 gramako euste-mediana dute, eta % 0,3ko maximoa. Lagin uniforme batek “the corpus is unique” itzultzen du laginketaren artefaktu gisa, ez aurkikuntza gisa.
Bikoizketa agerian utziko luketen bikoteak hurbileneko bizilagunak dira, eta bikote guztien zati oso txiki bat dira. Beraz, lagina haietara haztatu zen. Txantiloiak kategoriaren, errezetaren slug-aren eta estilo-familiaren arabera taldekatu ziren, eta 33 talde atera ziren lau motatan banatuta:
- biki zenbakidunak, non slug-ak
-2edo-3atzizki batean bakarrik bereizten diren (8 talde) - errezeta bera eta estilo-familia bera (4 talde)
- estilo-familia bera, errezeta desberdina (13 talde)
- estaldura-taldeak, bat kategoria bakoitzeko, kategoriarik neurtu gabe gera ez zedin (8 talde)
Ondoren, talde bakoitzeko kide guztien diapositiben testua eskuratu zen: 232 txantiloi, 1.034 diapositiba, 0 eskuratze-errore, 2026ko irailaren 16an. Hori corpusaren % 5,9 da, % 5,9 zailena izateko aukeratua.
Pase erabakigarria
Lagina haztatzea ez da nahikoa bere horretan, txantiloi baten benetako auzokiderik hurbilena eskuratu ez den bat izan baitaiteke, eta horrek gainjartzea gutxietsiko luke. Beraz, bigarren txanda batek konparazioa kide guztiak eskuratu ziren klusterretara mugatu zuen: 46 kluster oso, 117 txantiloi. Horien barruan, 3.926 txantiloiko corpus osoko txantiloi baten auzokiderik hurbilena neurtutako multzoan egongo dela bermatzen da.
Metrika 5 gramako edukiera da: txantiloi baten bost hitzeko sekuentzia desberdinen frakzioa, bere kide hurbilenean ere agertzen dena. Edukiera, eta ez Jaccard, asimetrikoa delako: txantiloi luze batean erabat sartuta dagoen txantiloi labur bat erabat bikoiztutzat jo beharko litzateke, eta Jaccardek zati batean bakartzat emango luke.
Hona hemen 117 txantiloi horien emaitzak, corpuseko benetako auzokiderik hurbilenaren aldean:
| Neurria | Balioa |
|---|---|
| 5 gramako edukieraren mediana | 0,00% |
| Batez bestekoa | 0,50% |
| 95. pertzentila | 3,46% |
| Maximoa | 8,82% |
| % 10etik gorako txantiloiak | 0 |
| 3 gramako edukiera, mediana / maximoa | 0,31% / 13,89% |
3 gramako txandak berrerabili beharrean birformulatu zen kopia atzemateko balio du; zifrak mugitzen ditu, baina ez ondorioa. Corpuseko bikoterik okerrena poster-quote-typography-modern-gradient da, poster-bold-text-modern-gradient txantiloiaren aurka, % 8,82ko emaitzarekin.
232 txantiloi guztietan: sei hitz edo gehiagoko 3.448 esaldi desberdinetatik, 2 txantiloi batean baino gehiagotan agertzen dira: “the results relate only to the items tested” eta “no other graphic elements should intrude into this zone”. Diapositiba bakoitzeko, 20 hitz edo gehiago dituzten 992 diapositibetatik, beste edozein txantiloitako diapositiba hurbilenarekiko edukieraren mediana % 0,0 da; 8 % 20tik gora daude eta bat ere ez % 50etik gora. Antzekotasun tematikoa, hitz-poltsaren kosinuaren bidez neurtua (hitzak alde batera uzten dituena), handiagoa da, bi curriculum-txantiloirentzat izan beharko lukeen bezala: % 12,7ko mediana familia bereko kide hurbilenaren aldean, % 35,3ko maximoa.
Muga zintzoa: hau 3.926 txantiloietatik 232 dira, eta 117 auzokide hurbilena bermatuta dutenen multzoan. Corpuseko zatirik zailenari buruzko froga bat da, ez corpus osoari buruzko froga bat.
Erabaki genuena
Auditoretzak diapositiben testua argitaratzearen aurkako bikoizketaren objekzioa kentzen du. Ez genituen diapositiben gorputzak argitaratu. Diapositiben izenburuak argitaratu genituen, txantiloiaren erregistroan jada bazeudenak eta eskuratu eta baztertu egiten zirenak.
3.926 txantiloi guztiak egiaztatu ziren argitaratu aurretik: 14.969 izenburu, bat ere ez hutsik, bat ere ez “Slide N” edo “Page N” soil bat, eta slide_titles.length eta slide_count berdinak ziren guztietan. Bi muga erregistratu ziren, leundu beharrean: 156 izenburu (% 1,0) “… Page N” esapidearekin amaitzen dira, eta 77 txantiloitan (% 2) izenburu guztiek egiten dute. 1.321 txantiloik (% 34) diapositiba bakarra dute eta ez dute zerrendarik jasotzen.
Aldaketak, beraz, 2.605 orrialderi eragiten die eta bakoitzari 15 hitzeko mediana gehitzen dio, corpus osoan orrialde bakoitzeko 10,4 hitzeko batez bestekoa. Hori erreala da eta txikia da. Horrek ez du berez orrialde bat eduki eskaseko eremutik ateratzen, eta zatirik erabilgarriena izan daiteke izenburuak klikagarriak izatea: lehen, 7. diapositibara jauzi egiteko, Hurrengoa sei aldiz sakatu behar zen.
Adar berak lotzen zituen beste inon loturarik ez zuten txantiloiak. Arakatze-interfazeek aspect_ratio 16:9an finkatzen zuten, hau da, liburutegiaren % 45 inguru; beraz, gainerakoak ez ziren inongo hub orritan edo erlazionatutako bloketan agertzen: /templates?category=document eta ?category=poster helbideek “coming soon” orri bat itzultzen zuten, txantiloi-loturarik gabe. Bertara doan barne-loturarik ez duen orri batek ez dio ezer zor irakurleari, irakurlerik ez baita iristen.
Ez da zabaldu, eta galdera bat irekita dago oraindik
Hau ezer ez dago martxan. Sophon-LLC/ppt-ai proiektuko 10. pull requesta da, 2026ko irailaren 15ean irekia eta 2026ko irailaren 16an oraindik irekita dagoena, hiru commit, mota-egiaztapen batekin, lint exekuzio batekin eta produkzio-eraikuntza batekin egiaztatua, zuzeneko datu-biltegiaren aurka zerbitzatua. Batu arte, orrialdeak mezu honen hasieran neurtu bezala daude.
Galdera irekia auditoretzak erantzuten ez duena da. Neurtutako multzoak txantiloi bakoitzeko 288 hitzeko gorputz-testuaren mediana du, gaur egun orri batek errendatzen dituen txantiloiaren 19 eta 31 hitz espezifikoen aldean. Auditoretzak dio testu hori ez dela bikoiztua. Ez du esaten diseinu bat betetzeko idatzitako testua pertsona batek eduki gisa irakurtzen duenik betegarri gisa baino, eta inork ez du hori neurtu. Horrelako 3.926 orrialde argitaratzea bikoizketaren emaitza batean soilik oinarrituta, guk egin ez genuen galdera bati erantzutea litzateke.