PPT AI publie 3 926 modèles de présentation, chacun avec sa propre page sur ppt.sophoninc.com. Une page dont le rôle est de montrer un design doit tout de même être lisible par quelqu’un qui ne peut pas encore voir le design, ou qui hésite entre deux d’entre eux. Cela signifie au minimum : à quoi sert la présentation, ce qu’il y a sur chaque diapositive, combien de diapositives et à quelle taille, ce qui peut être modifié et comment commencer. Cet article explique comment nous avons découvert à quel point nos pages en étaient éloignées, et ce que nous avons mesuré avant d’ajouter quoi que ce soit.
Ce qu’une page de modèle affiche aujourd’hui
Nous avons extrait et compté quatre pages de modèles le 16 septembre 2026. Méthode de comptage : supprimer les éléments script et style, supprimer les balises restantes, décoder les entités HTML, extraire les mots correspondant à [A-Za-z0-9][A-Za-z0-9’'&-]*, puis les passer en minuscules avant de compter les mots uniques. Le segmenteur est précisé, car le nombre de mots uniques varie de quelques unités selon celui-ci.
| Page | Nombre de mots | Mots uniques | Mots uniques hors éléments communs |
|---|---|---|---|
| brand-agency-book-editorial-dark | 148 | 91 | 31 |
| medical-blood-test-clean-corporate | 142 | 88 | 28 |
| resume-illustrator-professional-blue | 147 | 90 | 30 |
| poster-bold-text-modern-gradient | 134 | 79 | 19 |
« Shared chrome » sont les 60 mots distincts communs aux quatre pages : la navigation, le pied de page, le fil d’Ariane et les deux appels à l’action. Retirez-les et entre 19 et 31 mots distincts sur chaque page concernent ce modèle. Le reste de la page est identique sur 3 926 pages.
Pour situer le contexte, sur les trois mois précédant le 16 septembre 2026, ces pages ont généré 484 impressions et 7 clics pour une position moyenne de 20,2, sur 187 pages uniques et pour 12 requêtes uniques. Ce chiffre provient de la Google Search Console pour sc-domain:sophoninc.com, filtré sur ppt.sophoninc.com/templates/. La Search Console n’est visible que par les propriétaires de la propriété ; la propriété, le filtre et la plage de dates sont indiqués afin que toute personne y ayant accès puisse reproduire le résultat, ce qui est le maximum de vérifiabilité que cette source permet.
La question à laquelle l’audit devait répondre
Les diapositives de chaque modèle contiennent du texte : des titres, des étiquettes, du corps de texte rédigé pour remplir la maquette. Il est servi publiquement à l’adresse /api/v2/templates/<slug>/slides/<n>, et c’est l’élément le plus évident à placer sur la page. Avant cela, une objection doit être levée : 3 926 pages de texte de présentation généré pourraient devenir 3 926 pages quasi identiques, ce qui est pire que 3 926 pages au contenu léger.
Donc : quelle quantité de texte un modèle partage-t-il avec le modèle auquel il ressemble le plus ?
Pourquoi un échantillon uniforme donne une mauvaise réponse
La méthode naïve consiste à échantillonner des modèles au hasard et à comparer les paires. Cette méthode ne peut pas trouver de duplication dans ce corpus, et il est utile d’expliquer précisément pourquoi.
La bibliothèque est organisée par catégorie, par recette et par famille de style. Une paire aléatoire tirée des 3 926 éléments est très majoritairement une paire de catégories différentes sur des sujets différents. Ces paires ne partagent presque rien, peu importe le caractère répétitif du corpus. Nous l’avons mesuré : 392 paires inter-familles aléatoires ont une contenance médiane de 5-grammes de 0,00 % et un maximum de 0,3 %. Un échantillon uniforme renvoie « the corpus is unique » comme un artefact de l’échantillonnage, non comme une conclusion.
Les paires qui révéleraient une duplication sont les plus proches voisines, et elles ne représentent qu’une fraction infime de toutes les paires. L’échantillon a donc été pondéré en leur faveur. Les modèles ont été regroupés par catégorie, par slug de recette et par famille de style, et 33 groupes ont été tirés selon quatre types :
- jumeaux numérotés, où les slugs ne diffèrent que par un
-2ou-3final (8 groupes) - même recette et même famille de style (4 groupes)
- même famille de style, recette différente (13 groupes)
- groupes de couverture, un par catégorie, afin qu’aucune catégorie ne soit laissée de côté (8 groupes)
Le texte des diapositives a ensuite été récupéré pour chaque membre de chaque groupe : 232 modèles, 1 034 diapositives, 0 erreur de récupération, le 16 septembre 2026. Cela représente 5,9 % du corpus, choisis pour être les 5,9 % les plus difficiles.
La passe décisive
Pondérer l’échantillon ne suffit toujours pas, car le plus proche voisin réel d’un modèle pourrait ne pas avoir été récupéré, ce qui sous-estimerait le chevauchement. Une seconde passe a donc restreint la comparaison aux groupes dont chaque membre avait été récupéré : 46 groupes complets, 117 modèles. Au sein de ceux-ci, le plus proche voisin d’un modèle dans l’ensemble du corpus de 3 926 modèles est garanti de se trouver dans l’ensemble mesuré.
La métrique est l’inclusion de 5-grammes : la fraction des séquences distinctes de cinq mots d’un modèle qui apparaissent également chez son pair le plus proche. L’inclusion plutôt que l’indice de Jaccard, car elle est asymétrique : un modèle court entièrement contenu dans un long devrait être considéré comme entièrement dupliqué, et Jaccard le signalerait comme partiellement unique.
Résultats pour ces 117 modèles, par rapport au plus proche voisin réel du corpus :
| Mesure | Valeur |
|---|---|
| Inclusion médiane de 5-grammes | 0,00% |
| Moyenne | 0,50% |
| 95e centile | 3,46% |
| Maximum | 8,82% |
| Modèles au-dessus de 10 % | 0 |
| Inclusion de 3-grammes, médiane / maximum | 0,31% / 13,89% |
La passe de 3-grammes sert à détecter les copies qui ont été reformulées plutôt que réutilisées ; elle modifie les chiffres mais pas la conclusion. La pire paire du corpus est poster-quote-typography-modern-gradient contre poster-bold-text-modern-gradient, à 8,82 %.
Sur l’ensemble des 232 modèles : sur 3 448 phrases distinctes de six mots ou plus, 2 apparaissent dans plus d’un modèle — « the results relate only to the items tested » et « no other graphic elements should intrude into this zone ». Par diapositive, sur 992 diapositives de 20 mots ou plus, l’inclusion médiane avec la diapositive la plus proche dans tout autre modèle est de 0,0 % ; 8 sont au-dessus de 20 % et aucune n’est au-dessus de 50 %. La similarité thématique mesurée par le cosinus de sac de mots, qui ignore la formulation, est plus élevée, comme il se doit pour deux modèles de CV : médiane de 12,7 % par rapport au pair le plus proche de la même famille, maximum de 35,3 %.
La limite honnête : il s’agit de 232 des 3 926 modèles et de 117 dans l’ensemble où le plus proche voisin est garanti. C’est une preuve concernant la partie la plus difficile du corpus, pas une démonstration sur son intégralité.
Ce que nous avons décidé
L’audit lève l’objection de duplication à la publication du texte des diapositives. Nous n’avons pas publié le corps des diapositives. Nous avons publié les titres des diapositives, qui existaient déjà dans l’enregistrement du modèle et étaient récupérés puis écartés.
Vérifié sur les 3 926 modèles avant de les publier : 14 969 titres, aucun vide, aucun n’étant un simple « Slide N » ou « Page N », et slide_titles.length égal à slide_count pour chacun. Deux limites ont été enregistrées plutôt que lissées : 156 titres (1,0 %) se terminent par « … Page N », et sur 77 modèles (2 %) c’est le cas de chaque titre. 1 321 modèles (34 %) ont une seule diapositive et n’obtiennent aucune liste.
Le changement affecte donc 2 605 pages et ajoute une médiane de 15 mots à chacune, une moyenne de 10,4 mots par page sur l’ensemble du corpus. C’est réel et c’est peu. Cela ne sort pas en soi une page de la catégorie de contenu léger, et la partie la plus utile est peut-être que les titres sont cliquables : sauter à la diapositive 7 nécessitait auparavant d’appuyer six fois sur Suivant.
La même branche relie les modèles auxquels rien n’était lié. Les surfaces de navigation fixaient aspect_ratio à 16:9, soit environ 45 % de la bibliothèque, de sorte que le reste n’apparaissait sur aucune page de hub ni dans aucun bloc connexe : /templates?category=document et ?category=poster renvoyaient une page « coming soon » avec zéro lien de modèle. Une page sans lien interne pointant vers elle ne doit rien à un lecteur, car aucun lecteur n’y arrive.
Non déployé, et une question toujours ouverte
Rien de tout cela n’est en ligne. Il s’agit de la pull request 10 sur Sophon-LLC/ppt-ai, ouverte le 15 septembre 2026 et toujours ouverte le 16 septembre 2026, avec trois commits, vérifiée par un contrôle de type, une exécution de linter et une version de production servie sur la base de données active. Tant qu’elle n’est pas fusionnée, les pages sont telles que mesurées en haut de cet article.
La question en suspens est celle à laquelle l’audit ne répond pas. L’ensemble mesuré contient une médiane de 288 mots de corps de texte par modèle, contre les 19 à 31 mots spécifiques au modèle qu’une page affiche aujourd’hui. L’audit indique que ce texte n’est pas dupliqué. Il ne dit pas si un texte écrit pour remplir une mise en page est perçu par une personne comme du contenu plutôt que comme du remplissage, et personne ne l’a mesuré. En publier 3 926 pages sur la seule base d’un résultat de duplication reviendrait à répondre à une question que nous n’avons pas posée.