PPT AI menerbitkan 3.926 templat presentasi, masing-masing dengan halamannya sendiri di ppt.sophoninc.com. Halaman yang tugasnya menampilkan desain tetap harus dapat dibaca oleh seseorang yang belum dapat melihat desainnya, atau yang sedang memutuskan di antara dua desain. Itu berarti setidaknya: untuk apa dek itu, apa yang ada di setiap slide, berapa banyak slide dan ukurannya, apa yang dapat diubah, dan bagaimana cara memulainya. Postingan ini adalah tentang mencari tahu seberapa jauh halaman kami dari itu, dan apa yang kami ukur sebelum menambahkan apa pun.
Apa yang dirender halaman templat hari ini
Empat halaman templat diambil dan dihitung pada 16 September 2026. Metode penghitungan: hapus elemen script dan style, hapus tag yang tersisa, batalkan escape entitas HTML, ambil token kata yang cocok dengan [A-Za-z0-9][A-Za-z0-9’'&-]*, dan ubah menjadi huruf kecil sebelum menghitung yang berbeda. Tokenizer disebutkan karena jumlah yang berbeda bergerak beberapa kata tergantung padanya.
| Halaman | Total kata | Kata unik | Kata unik di luar chrome bersama |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
“Shared chrome” adalah 60 kata unik yang sama di keempat halaman: navigasi, footer, breadcrumb, dan dua ajakan bertindak. Hilangkan semua itu, dan antara 19 hingga 31 kata unik di setiap halaman adalah tentang templat tersebut. Sisa halaman tersebut sama di 3.926 halaman.
Sebagai konteks, selama tiga bulan hingga 16 September 2026, halaman-halaman tersebut menghasilkan 484 impresi dan 7 klik pada posisi rata-rata 20,2, dari 187 halaman unik dan 12 kueri unik. Angka ini berasal dari Google Search Console untuk sc-domain:sophoninc.com, dengan filter ppt.sophoninc.com/templates/. Search Console hanya dapat dilihat oleh pemilik properti; properti, filter, dan rentang tanggal diberikan agar siapa pun yang memiliki akses dapat mereproduksinya, yang merupakan tingkat keterujian tertinggi yang bisa didapat dari sumber tersebut.
Pertanyaan yang harus dijawab oleh audit
Setiap slide templat berisi teks: judul, label, dan isi tulisan yang dibuat untuk mengisi desain. Teks ini disajikan untuk publik di /api/v2/templates/<slug>/slides/<n>, dan merupakan hal yang paling jelas untuk ditampilkan di halaman. Sebelum melakukannya, satu keberatan harus dijawab: 3.926 halaman berisi salinan dek yang dibuat secara otomatis bisa menjadi 3.926 halaman yang hampir identik, yang lebih buruk daripada 3.926 halaman yang tipis.
Jadi: berapa banyak teks yang dimiliki sebuah templat yang sama dengan templat yang paling mirip dengannya?
Mengapa sampel seragam memberikan jawaban yang salah
Metode naifnya adalah mengambil sampel templat secara acak dan membandingkan pasangan. Metode tersebut tidak dapat menemukan duplikasi dalam korpus ini, dan penting untuk menjelaskan alasannya secara tepat.
Pustaka ini diatur berdasarkan kategori, resep, dan rumpun gaya. Pasangan acak yang diambil dari 3.926 item sebagian besar merupakan pasangan dari kategori berbeda tentang subjek yang berbeda. Pasangan tersebut hampir tidak memiliki kesamaan, tidak peduli seberapa duplikatif korpusnya. Kami mengukurnya: 392 pasangan lintas rumpun acak memiliki median 5-gram containment sebesar 0,00% dan maksimum 0,3%. Sampel yang seragam mengembalikan “the corpus is unique” sebagai artefak dari pengambilan sampel, bukan sebagai temuan.
Pasangan yang akan mengungkapkan duplikasi adalah tetangga terdekat, dan mereka merupakan sebagian kecil dari semua pasangan. Jadi, sampel dibobotkan ke arah mereka. Templat dikelompokkan berdasarkan kategori, slug resep, dan rumpun gaya, dan 33 kelompok diambil dari empat jenis:
- kembar bernomor, di mana slug hanya berbeda pada akhiran
-2atau-3(8 kelompok) - resep yang sama dan rumpun gaya yang sama (4 kelompok)
- rumpun gaya yang sama, resep yang berbeda (13 kelompok)
- kelompok cakupan, satu per kategori, sehingga tidak ada kategori yang tidak terukur (8 kelompok)
Teks slide kemudian diambil untuk setiap anggota dari setiap kelompok: 232 templat, 1.034 slide, 0 galat pengambilan, pada 16 September 2026. Itu adalah 5,9% dari korpus, yang dipilih sebagai 5,9% yang paling sulit.
Langkah penentu
Membobot sampel saja masih belum cukup, karena tetangga terdekat templat yang sebenarnya mungkin adalah templat yang tidak diambil, yang akan membuat tumpang-tindihnya tampak lebih kecil. Jadi, langkah kedua membatasi perbandingan pada kluster yang setiap anggotanya telah diambil: 46 kluster lengkap, 117 templat. Di dalamnya, tetangga terdekat sebuah templat dalam keseluruhan korpus 3.926 templat dijamin berada dalam set yang diukur.
Metriknya adalah penahanan 5-gram: fraksi dari sekuens lima kata yang berbeda dari sebuah templat yang juga muncul pada templat terdekatnya. Penahanan, bukan Jaccard, karena bersifat asimetris—templat pendek yang seluruhnya terkandung dalam templat panjang harus dianggap terduplikasi sepenuhnya, dan Jaccard akan melaporkannya sebagai unik sebagian.
Hasil untuk 117 templat tersebut, terhadap tetangga korpus terdekat yang sebenarnya:
| Ukuran | Nilai |
|---|---|
| Penahanan 5-gram median | 0,00% |
| Rata-rata | 0,50% |
| Persentil ke-95 | 3,46% |
| Maksimum | 8,82% |
| Templat di atas 10% | 0 |
| Penahanan 3-gram, median / maksimum | 0,31% / 13,89% |
Langkah 3-gram ada untuk menangkap salinan yang disusun ulang alih-alih digunakan kembali; ini mengubah angka tetapi tidak mengubah kesimpulan. Pasangan terburuk dalam korpus adalah poster-quote-typography-modern-gradient terhadap poster-bold-text-modern-gradient, sebesar 8,82%.
Di seluruh 232 templat: dari 3.448 kalimat berbeda yang terdiri dari enam kata atau lebih, 2 di antaranya muncul di lebih dari satu templat—“the results relate only to the items tested” dan “no other graphic elements should intrude into this zone”. Per slide, dari 992 slide yang memuat 20 kata atau lebih, penahanan median dengan slide terdekat di templat lain mana pun adalah 0,0%; 8 di antaranya di atas 20% dan tidak ada yang di atas 50%. Kemiripan topikal yang diukur dengan kosinus bag-of-words, yang mengabaikan susunan kata, lebih tinggi, sebagaimana mestinya untuk dua templat resume: median 12,7% terhadap templat sejenis dalam keluarga yang sama, maksimum 35,3%.
Batas yang jujur: ini adalah 232 dari 3.926 templat dan 117 dalam set yang dijamin terdekat. Ini adalah bukti tentang bagian tersulit dari korpus, bukan bukti tentang keseluruhannya.
Apa yang kami putuskan
Audit ini menghilangkan keberatan duplikasi untuk menerbitkan teks slide. Kami tidak menerbitkan isi slide. Kami menerbitkan judul slide, yang sudah ada dalam catatan templat dan sedang diambil lalu dibuang.
Diperiksa di seluruh 3.926 templat sebelum menerbitkannya: 14.969 judul, tidak ada yang kosong, tidak ada yang hanya berupa “Slide N” atau “Page N”, dan slide_titles.length sama dengan slide_count pada setiap templat. Dua batasan dicatat alih-alih diabaikan: 156 judul (1,0%) diakhiri dengan “… Page N”, dan pada 77 templat (2%) setiap judulnya demikian. 1.321 templat (34%) memiliki satu slide dan tidak mendapatkan daftar sama sekali.
Oleh karena itu, perubahan ini menjangkau 2.605 halaman dan menambahkan median 15 kata ke setiap halaman, dengan rata-rata 10,4 kata per halaman di seluruh korpus. Itu nyata dan itu kecil. Hal ini tidak dengan sendirinya mengeluarkan sebuah halaman dari wilayah konten tipis, dan bagian yang lebih berguna mungkin adalah judul-judulnya dapat diklik: melompat ke slide 7 sebelumnya memerlukan penekanan Berikutnya sebanyak enam kali.
Cabang yang sama menautkan templat-templat yang tadinya tidak memiliki tautan. Halaman jelajah mematok aspect_ratio pada 16:9, yang merupakan sekitar 45% dari koleksi, sehingga sisanya tidak muncul di halaman hub mana pun dan di blok terkait mana pun: /templates?category=document dan ?category=poster menampilkan halaman “coming soon” tanpa tautan templat sama sekali. Halaman yang tidak memiliki tautan internal yang mengarah ke sana tidak memiliki kewajiban apa pun kepada pembaca, karena tidak ada pembaca yang sampai ke sana.
Tidak diterapkan, dan satu pertanyaan masih terbuka
Semua ini belum tayang. Ini adalah pull request 10 di Sophon-LLC/ppt-ai, dibuka pada 15 September 2026 dan masih terbuka pada 16 September 2026, tiga commit, diverifikasi dengan pemeriksaan tipe, lint run, dan build produksi yang disajikan terhadap datastore langsung. Sampai digabungkan, halaman-halamannya seperti yang diukur di awal tulisan ini.
Pertanyaan yang terbuka adalah pertanyaan yang tidak dijawab oleh audit. Set yang diukur membawa median 288 kata teks isi per templat, dibandingkan dengan 19 hingga 31 kata spesifik templat yang dirender halaman saat ini. Audit mengatakan bahwa teks tersebut tidak duplikatif. Audit tidak mengatakan bahwa teks yang ditulis untuk mengisi tata letak terbaca sebagai konten bagi seseorang alih-alih sebagai pengisi, dan tidak ada yang mengukur itu. Menerbitkan 3.926 halaman berdasarkan hasil duplikasi saja akan menjadi jawaban atas pertanyaan yang tidak kami ajukan.