PPT AI veröffentlicht 3.926 Präsentationsvorlagen, jede mit einer eigenen Seite auf ppt.sophoninc.com. Eine Seite, deren Aufgabe es ist, ein Design zu zeigen, muss dennoch für jemanden lesbar sein, der das Design noch nicht sehen kann oder der sich zwischen zwei Designs entscheidet. Das bedeutet mindestens: wofür das Deck ist, was auf jeder Folie ist, wie viele Folien und in welcher Größe, was geändert werden kann und wie man anfängt. Dieser Beitrag handelt davon, herauszufinden, wie weit unsere Seiten davon entfernt waren und was wir gemessen haben, bevor wir etwas hinzugefügt haben.
Was eine Vorlagenseite heute darstellt
Vier Vorlagenseiten wurden am 16. September 2026 abgerufen und gezählt. Zählmethode: Entfernen Sie die Elemente script und style, entfernen Sie die restlichen Tags, dekodieren Sie HTML-Entitäten, nehmen Sie Wort-Token, die auf [A-Za-z0-9][A-Za-z0-9’'&-]* passen, und wandeln Sie sie in Kleinbuchstaben um, bevor Sie die unterschiedlichen zählen. Der Tokenizer wird angegeben, weil sich die Anzahl der unterschiedlichen Wörter je nach Tokenizer um einige Wörter verschiebt.
| Seite | Laufende Wörter | Unterschiedliche Wörter | Unterschiedliche Wörter außerhalb des gemeinsamen Rahmens |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
„Shared chrome“ sind die 60 distinkten Wörter, die alle vier Seiten gemeinsam haben: die Navigation, die Fußzeile, der Breadcrumb und die beiden Handlungsaufrufe. Lässt man diese weg, handeln auf jeder Seite zwischen 19 und 31 distinkte Wörter von dieser Vorlage. Der Rest der Seite ist auf 3.926 Seiten identisch.
Zum Kontext: In den drei Monaten bis zum 16. September 2026 erzielten diese Seiten 484 Impressionen und 7 Klicks bei einer durchschnittlichen Position von 20,2, verteilt auf 187 verschiedene Seiten und 12 verschiedene Suchanfragen. Diese Zahl stammt aus der Google Search Console für sc-domain:sophoninc.com, gefiltert nach ppt.sophoninc.com/templates/. Die Search Console ist nur für die Eigentümer der Property sichtbar; die Property, der Filter und der Datumsbereich werden angegeben, damit jeder mit Zugriff sie reproduzieren kann, was so überprüfbar ist, wie diese Quelle nur sein kann.
Die Frage, die die Prüfung beantworten musste
Die Folien jeder Vorlage enthalten Text: Überschriften, Beschriftungen, Fließtext, der zur Füllung des Designs geschrieben wurde. Er wird öffentlich unter /api/v2/templates/<slug>/slides/<n> bereitgestellt und ist das Naheliegendste, was man auf die Seite stellen kann. Davor muss ein Einwand beantwortet werden: 3.926 Seiten mit generiertem Präsentationstext könnten 3.926 nahezu identische Seiten sein, was schlimmer ist als 3.926 Seiten mit wenig Inhalt.
Also: Wie viel Text teilt eine Vorlage mit der Vorlage, der sie am meisten ähnelt?
Warum eine gleichmäßige Stichprobe die falsche Antwort gibt
Die naive Methode besteht darin, Vorlagen zufällig auszuwählen und Paare zu vergleichen. Diese Methode kann in diesem Korpus keine Duplikate finden, und es lohnt sich, genau zu erklären, warum.
Die Bibliothek ist nach Kategorie, nach Rezept und nach Stilfamilie geordnet. Ein zufälliges Paar aus 3.926 Elementen ist mit überwältigender Mehrheit ein Paar aus verschiedenen Kategorien zu verschiedenen Themen. Diese Paare haben fast nichts gemeinsam, egal wie duplikativ der Korpus ist. Wir haben es gemessen: 392 zufällige, familienübergreifende Paare haben eine mediane 5-Gramm-Überschneidung von 0,00 % und ein Maximum von 0,3 %. Eine gleichmäßige Stichprobe liefert „the corpus is unique“ als Artefakt der Stichprobenziehung, nicht als Ergebnis.
Die Paare, die eine Duplizierung aufdecken würden, sind die nächsten Nachbarn, und sie machen einen verschwindend kleinen Bruchteil aller Paare aus. Daher wurde die Stichprobe auf sie ausgerichtet. Die Vorlagen wurden nach Kategorie, Rezept-Slug und Stilfamilie gruppiert, und 33 Gruppen wurden aus vier Arten gezogen:
- nummerierte Zwillinge, bei denen sich die Slugs nur durch ein angehängtes
-2oder-3unterscheiden (8 Gruppen) - gleiches Rezept und gleiche Stilfamilie (4 Gruppen)
- gleiche Stilfamilie, unterschiedliches Rezept (13 Gruppen)
- Abdeckungsgruppen, eine pro Kategorie, damit keine Kategorie ungemessen bleibt (8 Gruppen)
Dann riefen wir den Folientext für jedes Mitglied jeder Gruppe ab: 232 Vorlagen, 1.034 Folien, 0 Abruffehler, am 16. September 2026. Das sind 5,9 % des Korpus, ausgewählt als die schwierigsten 5,9 %.
Der entscheidende Durchgang
Die Gewichtung der Stichprobe allein reicht noch nicht aus, da der wirklich nächste Nachbar einer Vorlage einer sein könnte, der nicht abgerufen wurde, was die Überschneidung zu gering ausweisen würde. Ein zweiter Durchgang beschränkte den Vergleich daher auf Cluster, in denen jedes Mitglied abgerufen worden war: 46 vollständige Cluster, 117 Vorlagen. Innerhalb dieser ist der nächste Nachbar einer Vorlage im gesamten Korpus von 3.926 Vorlagen garantiert in der gemessenen Menge enthalten.
Die Metrik ist die 5-Gramm-Inklusion: der Anteil der unterschiedlichen Fünf-Wort-Sequenzen einer Vorlage, die auch in ihrem nächsten Gegenstück vorkommen. Inklusion statt Jaccard, weil sie asymmetrisch ist – eine kurze Vorlage, die vollständig in einer langen enthalten ist, sollte als vollständig dupliziert gelten, und Jaccard würde sie als teilweise einzigartig ausweisen.
Ergebnisse für diese 117 Vorlagen, im Vergleich zum wirklich nächsten Nachbarn im Korpus:
| Messgröße | Wert |
|---|---|
| Mediane 5-Gramm-Inklusion | 0,00% |
| Mittelwert | 0,50% |
| 95. Perzentil | 3,46% |
| Maximum | 8,82% |
| Vorlagen über 10 % | 0 |
| 3-Gramm-Inklusion, Median / Maximum | 0,31% / 13,89% |
Der 3-Gramm-Durchgang dient dazu, Kopien zu erfassen, die eher umformuliert als wiederverwendet wurden; er verschiebt die Zahlen, aber nicht die Schlussfolgerung. Das schlechteste Paar im Korpus ist poster-quote-typography-modern-gradient gegen poster-bold-text-modern-gradient mit 8,82 %.
Über alle 232 Vorlagen hinweg: Von 3.448 unterschiedlichen Sätzen mit sechs oder mehr Wörtern erscheinen 2 in mehr als einer Vorlage – „the results relate only to the items tested“ und „no other graphic elements should intrude into this zone“. Pro Folie, von 992 Folien mit 20 oder mehr Wörtern, beträgt die mediane Inklusion mit der nächsten Folie in einer anderen Vorlage 0,0 %; 8 liegen über 20 % und keine über 50 %. Die thematische Ähnlichkeit, gemessen durch Bag-of-Words-Kosinus, der den Wortlaut ignoriert, ist höher, wie es bei zwei Lebenslaufvorlagen sein sollte: Median 12,7 % gegenüber dem nächsten Gegenstück aus derselben Familie, Maximum 35,3 %.
Die ehrliche Einschränkung: Dies sind 232 von 3.926 Vorlagen und 117 in der Menge mit garantiertem nächsten Nachbarn. Es ist ein Beleg für den schwierigsten Teil des Korpus, kein Beweis für den gesamten Korpus.
Was wir entschieden haben
Die Prüfung beseitigt den Einwand der Duplizierung gegen die Veröffentlichung von Folientexten. Wir haben die Folieninhalte nicht veröffentlicht. Wir haben die Folientitel veröffentlicht, die bereits im Vorlagendatensatz vorhanden waren und abgerufen und verworfen wurden.
Vor der Veröffentlichung über alle 3.926 Vorlagen geprüft: 14.969 Titel, keiner leer, keiner ein bloßes „Slide N“ oder „Page N“, und slide_titles.length war bei jeder Vorlage gleich slide_count. Zwei Einschränkungen wurden erfasst statt geglättet: 156 Titel (1,0 %) enden auf „… Page N“, und bei 77 Vorlagen (2 %) tun dies alle Titel. 1.321 Vorlagen (34 %) haben eine einzige Folie und erhalten gar keine Liste.
Die Änderung betrifft daher 2.605 Seiten und fügt jeder einen Median von 15 Wörtern hinzu, einen Mittelwert von 10,4 Wörtern pro Seite über den gesamten Korpus. Das ist real und es ist wenig. Es holt eine Seite nicht von allein aus dem Bereich des „Thin Content“, und der nützlichere Teil könnte sein, dass die Titel anklickbar sind: Um zu Folie 7 zu springen, musste man zuvor sechsmal auf „Weiter“ drücken.
Derselbe Branch verlinkt die Vorlagen, auf die nichts verwies. Die Übersichtsseiten fixierten das Seitenverhältnis auf 16:9, was etwa 45 % der Bibliothek ausmacht. Der Rest erschien also auf keiner Hub-Seite und in keinem verwandten Block: /templates?category=document und ?category=poster gaben eine „coming soon“-Seite ohne Vorlagen-Links zurück. Eine Seite, auf die kein interner Link verweist, schuldet einem Leser nichts, weil kein Leser ankommt.
Nicht bereitgestellt, und eine Frage noch offen
Nichts davon ist live. Es ist Pull-Request 10 auf Sophon-LLC/ppt-ai, eröffnet am 15. September 2026 und am 16. September 2026 noch offen, drei Commits, verifiziert mit einer Typprüfung, einem Lint-Lauf und einem Production-Build, der gegen den Live-Datenspeicher ausgeführt wird. Bis zum Merge sind die Seiten so, wie oben in diesem Beitrag gemessen.
Die offene Frage ist die, die das Audit nicht beantwortet. Der gemessene Satz enthält mediane 288 Wörter Fließtext pro Vorlage, gegenüber den 19 bis 31 vorlagenspezifischen Wörtern, die eine Seite heute rendert. Das Audit besagt, dass dieser Text nicht duplikativ ist. Es besagt nicht, dass ein zum Füllen eines Layouts geschriebener Text für eine Person als Inhalt und nicht als Füllmaterial lesbar ist, und das hat niemand gemessen. 3.926 Seiten davon allein aufgrund eines Duplikationsergebnisses zu veröffentlichen, würde eine Frage beantworten, die wir nicht gestellt haben.